ゆるふわフィジカルAI
考え中のゆるロボ

SmolVLA入門|SO-101を自分のタスク専用に鍛える小型VLAモデル

2026-10-08 ・ 実践

#SmolVLA#LeRobot#VLA#実践

LeRobotで公開データセットを触ったり、SO-101でテレオペのデータを集めたりしたら、次に欲しくなるのが「自分のタスク専用に動くAI」です。その入口としていちばん手が届きやすいのがSmolVLA——Hugging Faceが2025年6月に公開した、小さいのに実用的なVLAモデルです。

この記事で分かること

  • SmolVLAはHugging Faceが2025年6月に公開した、450Mパラメータのオープンソースの小型VLAモデル
  • コミュニティがLeRobot Hubに公開した487個のデータセット・1,000万フレームで事前学習されている
  • 単体の消費者向けGPU(場合によってはMacBook)でファインチューニング・推論ができる軽さが特徴
  • LeRobotの`lerobot-train`コマンドから、SO-101などで集めた自分のデータを使って追加学習できる

対象読者:LeRobot・SO-101で模倣学習を試した次に、自分のタスク専用モデルを作りたい学習者・エンジニア

執筆:ゆるふわフィジカルAI編集部 最終更新日:2026年10月8日

SmolVLAとは何か

SmolVLAがやっていること

📷

カメラ映像

複数カメラのRGB画像を入力

→
🦾

ロボットの状態

関節角度などの現在の姿勢

→
💬

言葉の指示

「ブロックを箱に入れて」など

→
🤖

行動を出力

次に取るべき一連の動作

VLAモデル解説で紹介したRT-2やpi-0は、いずれも数十億パラメータ級の大きなモデルです。性能は高い一方、個人が手元のGPUで気軽にファインチューニングするのは簡単ではありません。SmolVLAはこの壁を下げるために作られたモデルで、パラメータ数は450MとRT-2やpi-0の数十分の一程度に抑えられています。

🧮

450M

パラメータ数

📦

487個

事前学習に使った公開データセット数

🎞️

1,000万

事前学習フレーム数

💡

小さくできた理由

SmolVLAは、LeRobot Hub上でコミュニティが公開してきた487個のデータセット(合計約1,000万フレーム)を使って事前学習されています。ゼロから巨大なデータを集めるのではなく、「みんなが公開したデータの積み重ね」を土台にすることで、小さなモデルでも実用的な性能を出せるようにした点がユニークです。

内部的には、軽量な視覚言語モデルのバックボーンと、行動を連続的な数値として出力する「フローマッチング」方式のアクション生成部を組み合わせた構成になっています。詳しい仕組みは後述の論文を参照してください。

インストール

LeRobotがすでに入っている前提で、SmolVLA用の追加パッケージを入れます。

pip install -e ".[smolvla]"

自分のデータでファインチューニングする

SO-101組み立てガイドやテレオペとデータ収集入門の手順で集めた、自分のロボット操作データセットがある前提で進めます。目安として、1つのタスクにつき50エピソード前後から試してみるとよいでしょう(物体の位置やシーンを少しずつ変えながら繰り返し記録するのがコツです)。

lerobot-train \
  --dataset.repo_id=${HF_USER}/my_dataset \
  --policy.path=lerobot/smolvla_base \
  --policy.repo_id=${HF_USER}/my_smolvla \
  --output_dir=outputs/train/my_smolvla \
  --job_name=my_smolvla_training \
  --policy.device=cuda

--policy.path=lerobot/smolvla_baseで、Hugging Face Hub上に公開されている事前学習済みのベースモデルを読み込み、そこに自分のデータセットを追加学習させる流れです。学習が終わると、チェックポイントがoutput_dir以下に保存されます。

⚠️

バージョンによってオプション名が変わる

LeRobotは開発が活発で、lerobot-trainのオプション名やデフォルト値がバージョンごとに変わることがあります。実行前に必ずlerobot-train --helpで、自分の環境に入っているバージョンのオプションを確認してください。

推論させて動かす

学習したチェックポイントを使って、実際にロボットを動かしてみます。カメラのキー名・ロボットの状態の形式・タスクの指示文の書き方は、学習時とロールアウト時で必ず揃えてください。ここがズレていると、チェックポイントは読み込めても期待した動きをしません。

lerobot-record \
  --robot.type=so101_follower --robot.port=/dev/ttyUSB0 \
  --policy.path=outputs/train/my_smolvla/checkpoints/last/pretrained_model \
  --dataset.repo_id=${HF_USER}/eval_my_smolvla \
  --dataset.num_episodes=10
🌱

いきなり実機で試さない

学習直後のチェックポイントは、まずロボットを動かさない状態で読み込みテストをしてから、実機での動作確認に進むと安全です。想定外の動きをしたときにすぐ止められる体制(電源を切れる、手で止められる距離にいる)で試しましょう。

大きなモデルとの違い・向き・不向き

SmolVLAは「何でもできる汎用ロボット頭脳」ではありません。得意・不得意を理解して使うのが大切です。

🤏

SmolVLAが向いていること

  • 個人のGPU・限られたデータで素早く試す
  • SO-101など特定のタスクへの特化
  • まず動かして感覚をつかむ入門用途
VS
🧠

大きなVLAが向いていること

  • 幅広い未知の物体・指示への汎化
  • 長く複雑な作業の連続実行
  • 企業規模のデータ・計算資源がある場合

まとめ

  • SmolVLAは、Hugging Faceが2025年6月に公開した450Mパラメータのオープンソース小型VLAモデル
  • LeRobot Hubの公開データセット(487個・約1,000万フレーム)で事前学習されており、消費者向けGPUでも扱える軽さが特徴
  • lerobot-train --policy.path=lerobot/smolvla_baseで、SO-101などで集めた自分のデータに追加学習できる
  • 汎用的な賢さよりも「特定のタスクに素早く特化させる」用途に向いている

もう少し詳しく(背景)

SmolVLAは、論文"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics"として発表されたモデルで、軽量な視覚言語モデルのバックボーンと、連続的な行動を出力する「フローマッチング」方式のアクション生成部を組み合わせた構成を取っています1。学習データは研究チーム独自の収集ではなく、LeRobot Hub上でコミュニティが公開してきたデータセットを集めて使っている点が特徴で、LeRobotが育ててきた「データを共有する文化」が、モデルの性能にそのまま直結した例といえます2。推論時には、実行中の動作と次の行動チャンクの計算を並行して進める非同期推論の仕組みも導入されており、リアルタイム性が求められる場面での応答性を高める工夫がされています2。

次の一歩 🌸

もう一度LeRobotの基本を確認したい人はそちらへ。自分のロボットでまだデータを集めていない場合は、先にSO-101組み立てガイドとテレオペとデータ収集入門を。SmolVLAと並ぶ基盤モデルの全体像は物理AI基盤モデルでも整理しています。

参考資料・出典

ゆるふわポータルでは、一次情報・公的資料にもとづき、専門用語をできるだけやさしく翻訳することを心がけています。内容に誤りや古い情報がある場合は、お問い合わせからご連絡ください。

執筆:ゆるふわフィジカルAI編集部 最終更新日:2026年10月8日

Footnotes

  1. Shukor, M. et al. (2025). "SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics." arXiv:2506.01844。450Mパラメータの軽量VLAモデルのアーキテクチャと学習方法を報告した論文。 ↩

  2. Hugging Face公式ブログ "SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data"。LeRobot Hubの公開データセットを使った事前学習と、非同期推論の仕組みを解説している。 ↩ ↩2

この記事をシェア:𝕏 で共有LINEで送る

🔥 この分野の最新トレンドをチェック →

あわせて読みたい