ウェブデータロフトで開催されたVLAナイトのまとめです。
Agility Robotics、Tesla、Prometheus、Distill LabsのエンジニアたちをサンフランシスコのBright Dataのウェブデータロフトに招き、一つの問いについて議論しました:
言語モデルから現実世界で機能するロボットへ移行するために、実際に何が必要なのか?
答えはハイプが示すよりも現実的なものでした。ボトルネックはモデルアーキテクチャだけではありません。それはトレーニングコーパスです:何を収集するか、どう組み合わせるか、どこから来るのか、そして手動チームでは到底追いつけないスケールでキュレーションできるかどうかです。
パネルにはAgility RoboticsのSriとAhmed、個人的な立場で発言するロボティクスMLエンジニアのAnkur、元1XおよびWaymoのPrometheusのDaniel、そしてDistill Labsの共同創業者Jacekが参加しました。モデレーターはHackerSquadとBuilders CollectiveのAdamが務めました。
以下は、Vision-Language-Actionモデル、ワールドモデル、またはその背後にあるデータパイプラインを構築している方に重要な5つの重要ポイントです。
1. VLAはアクションヘッドを持つVLMであり、その汎化能力はウェブスケールの事前学習から生まれる
パネルの実用的な定義はシンプルでした:VLAはキャプション生成、セグメンテーション、オブジェクト理解などのタスクにおいて、インターネットスケールのテキストと画像で学習されたビジョン言語モデルから始まります。そこにアクションコンポーネントを追加し、ロボットデータでファインチューニングします。
この区別は重要です。ロボットデータは実行を教えます。ウェブスケールの事前学習はモデルに世界とは何かを教えます。
これが、VLAが明示的にトレーニングされていないオブジェクトを時に拾い上げられる理由です。汎化能力は少数のテレオペレーションによるロボットのデモンストレーションだけから来るのではありません。ロボットがループに入る前の広範な視覚的・意味的な露出から来ています。
事前学習コーパスが狭い場合、どれだけ高価なテレオペレーションデータがあっても、省略した汎化能力を完全に取り戻すことはできません。
「インターネットスケールのテキストと画像データで学習され…その後VLMをロボットデータでファインチューニングすることでVision-Language-Actionモデルが得られます。優れた点は汎化能力が向上することです:特定のオブジェクトを拾い上げるようにトレーニングすれば、似たものを見てきたので別のオブジェクトも拾い上げるよう指示できます。」
— Ankur、ロボティクスMLエンジニア、個人的な立場での発言。9:59から視聴 →
📖 関連記事: Vision-Language Model(VLA)とは? · ベストロボティクスAIライブラリ · 基盤モデルの解説
2. ビジョン、言語、アクションが一つのトークン空間に統合されつつある
現代のVLAは重要な一点でLLMに似てきています:次のトークンを予測するのです。
そのトークンは単語、画像パッチ、または関節空間の制御コマンドかもしれません。Distill Labsの共同創業者Jacekが説明したように、ソフトウェアエージェントとの接続は直接的です。LLMはAPIツールを呼び出します。VLAは物理的なツールを呼び出します。ハーネスは「エンドポイントを呼び出す」から「カップを掴む」に変わりますが、基本的なパターンは似ています。
この意味は強力です:トークン化できるすべてのモダリティが同じトレーニング空間の一部になれます。ウェブ動画、自己中心的な映像、人間のデモンストレーション、テレオペレーション、オンポリシーのロボットデータがすべて共有表現に貢献できます。
制約は「モデルはこれを使えるか?」から「適切なスケールで適切な例を調達できるか?」に移ります。
「アクション空間をLLMのファンクションコールとして考えることができます…そのように分解すると、非物理的な世界向けに人々が構築するものと変わりません。ツールを公開するハーネス内でサブエージェントを起動するエージェントです。今はハーネスがより物理的になっています。それが強力な点です。ウェブのトレーニングデータに頼って非常に良い出発点を得られるからです。」
— Jacek、共同創業者、Distill Labs。15:14から視聴 →
📖 関連記事: トークン化の解説 · AIエージェントテックスタックの内側 · AIエージェントの構築方法:完全ロードマップ
3. VLAとワールドモデルは異なるデータを必要とし、混同するとコストが高くつく
その夜の最も鋭い区別の一つはVLAトレーニングとワールドモデルトレーニングの違いでした。
Ankurが説明したように、VLAは主に模倣学習の問題です。クリーンで成功した高品質なトラジェクトリが必要です。悪いデモンストレーションは害になります。
ワールドモデルは異なります。アクションが与えられたときに次に何が起こるかを予測する必要があるため、成功した結果だけでなく、ミス、エッジケース、失敗も理解しなければなりません。ワールドモデルを計画や強化学習の学習済みシミュレーターとして使用したい場合、可能な未来の全範囲を表現する必要があります。
以前1XでワールドモデルのリードをしていたPrometheusのエンジニアDanielは、これが難しい理由を説明しました。現在の多くのワールドモデルは成功した結果に偏っています。失敗しそうなトラジェクトリを見せると、ミスをモデル化する代わりにリカバリーを幻覚するかもしれません。ロボティクスでは、それは特に危険です。接触、把持、失敗が最も起こりやすい瞬間こそ、モデルはアクション制御可能でなければなりません。
重要なポイント:「ロボティクスデータ」は一つの汎用バケットではありません。模倣ポリシーとワールドモデルは意図的に異なるコーパスを必要とします。
「非常にアクション制御可能なワールドモデルが本当に必要です…オブジェクトを把持するときの成否を分ける瞬間。そこにギャップがあれば、それは非常に悪いサインです。」
— Daniel、Prometheus、元1X。35:36から視聴 →
📖 関連記事: AIモデルトレーニングとは? · AIハルシネーションの解説 · ロボティクスデータセット
4. データ階層は実在する:ウェブデータは幅広さを、ロボットデータは制御を与える
Agility RoboticsのエンジニアAhmedは、シグナルの明確な階層を示しました。
テレオペレーションデータは完全なロボット状態を含むため、最も強い制御情報を持ちます。人間のデモンストレーションと自己中心的な動画はより少ない直接的な制御シグナルを持ちます。ウェブ動画は低レベルの制御レイヤーでは最も少ない制御シグナルを持ちます。
しかし、それはウェブデータの重要性が低いことを意味しません。その役割が異なるということです。
ウェブスケールの動画はセマンティクス、コンテキスト、タスク構造、オブジェクトの多様性、および一般的な世界知識を教えます。部屋、ツール、人々、オブジェクト、目標が膨大なバリエーションにわたってどのように見えるかをモデルが理解するのを助けます。ただし、特定のロボット本体が特定のアクションを実行する際の細かな物理学をうまく教えることはできません。
Ankurが最も明確なアナロジーを示しました:メッシやロナウドのすべての動画を見てサッカーを深く理解しても、練習なしにはプレーできません。ウェブデータはゲームを教えます。オンロボットデータは身体を教えます。
同じ議論から実践的なデータ予算の洞察が得られました:ウェブデータの1時間はテレオペレーションデータの5分程度の転移可能な価値を提供するかもしれません。ウェブデータはテレオペを置き換えませんが、強力なウェブスケールの事前学習により、信頼性の高い実行に到達するために必要な高価なロボットデータの量を減らすことができます。
「メッシやロナウドのサッカー動画をたくさん見ることができますが、自分で練習するまで実際にプレーすることはできません。タスクの理解はウェブデータから得られます。実際に実行するためにはオンロボットデータが必要です…ウェブデータの1時間はテレオペデータの5分と同じかもしれません。」
— Ankur、ロボティクスMLエンジニア、個人的な立場での発言。1:01:09から視聴 →
📖 関連記事: AIのための動画データ · YouTube動画データセット · AI用音声データセット · 画像データセット
5. 信頼できるスケーリング則はまだ存在しないため、キュレーション速度が競争優位になる
LLMについては、業界にKaplanとChinchillaのスケーリング則があります。VLAとワールドモデルについて、Danielは直接的でした:ロボティクスはまだそこに達していません。
チームはまだ、ウェブトークン、テレオペ時間、デプロイメントデータ、計算量、またはモデルサイズのクリーンな関数としてロボットのパフォーマンスを確実に予測することができません。課題の一部は、模倣学習とワールドモデリングが異なる教師シグナルを使用することです。もう一つは、重要な指標が事前学習の損失ではなく、下流のタスク成功率であることです。
Danielはまた自律走行車のシミュレーションとの有用な対比を示しました。自動運転では、接触が起きたときにシミュレーションが止まることが多いです。ロボティクスでは、接触こそが本当の複雑さが始まる場所です。把持、押し、滑り、変形、衝突、回復はエッジケースではありません。それがタスクそのものです。
より良いスケーリング則が現れるまで、優位性は最も速く適切な例を見つけてキュレーションできるチームに向かいます:特定のシーン、タスクファミリー、オブジェクトのインタラクション、失敗、接触の多い瞬間。これはモデリングの課題だけではありません。発見とデータパイプラインの課題でもあります。
「フロップカウントやトークンカウントに関するスケーリング則への回答は、LLMではKaplan et al.やChinchillaスケーリング則として一般的になっています。VLAとワールドモデルを科学的に比較するためにそれらの質問を今日提起しているわけではありません…答えはまだそこに達していないということで、本当にそこに到達すべきです。」
— Daniel、Prometheus、元1XおよびWaymo。54:35から視聴 →
📖 関連記事: データ発見 · ベストAIトレーニングデータプロバイダー · LLMトレーニングデータ
これがロボティクスデータ戦略に意味すること
パネルは明確な結論に収束しました:
ウェブスケールのデータはロボットに世界の広い理解を与えます。オンロボットデータはその中での行動方法を教えます。事前学習コーパスが優れているほど、信頼性の高い実行に到達するために必要な高価なロボットデータが少なくなります。
それを実現するには、ほとんどのチームが過小評価している3つの能力が必要です:
🌐 ウェブスケールの抽出
時代遅れのタクソノミーを持つ固定された学術データセットだけでなく、オープンウェブからのペタバイト規模の動画、画像、音声収集。Bright Dataのウェブスケールデータ収集インフラとカスタムデータソリューションをご覧ください。
🔍 キーワード検索を超えた視覚的発見
最も価値あるタスクの多様性は、タイトル、タグ、またはキャプションに記述されることのないシーンに現れることが多いです。キーワード検索はロングテールの多くを見逃します。
⚖️ 防御可能な出所
テキストモデルは数兆のトークンで学習します。VLAは数兆のフレームで学習します。すべてのフレームにライセンスと出所の問題が伴う可能性があり、現実世界のロボットデプロイメントはリスクを高めます。トラストセンターと倫理的なデータ収集ガイドラインで詳細をご確認ください。
モデルは収束しつつあります。差別化要因はコーパスになりつつあります:どれだけ幅広いか、どれだけ関連性があるか、そしてその出所を証明できるかどうかです。
VLAまたはワールドモデルを構築中ですか?
私たちのチームにご相談ください →ウェブスケールでトレーニング動画を発見・調達することについて。
AI向けBright Dataの詳細、VLA向け動画データの提供、またはロボティクス、コンピュータービジョン、マルチモーダルトレーニング向けの既製データセットをご覧ください。