VLAとワールドモデルにはウェブスケールのデータが必要です。ただし、同じデータではありません。

VLAパネルからの5つの重要ポイント:ウェブスケールの事前学習、キュレーション速度、データの出所が現実世界のロボット構築競争を定義する理由。
1 分読

ウェブデータロフトで開催されたVLAナイトのまとめです。

Agility Robotics、Tesla、Prometheus、Distill LabsのエンジニアたちをサンフランシスコのBright Dataのウェブデータロフトに招き、一つの問いについて議論しました:

言語モデルから現実世界で機能するロボットへ移行するために、実際に何が必要なのか?

答えはハイプが示すよりも現実的なものでした。ボトルネックはモデルアーキテクチャだけではありません。それはトレーニングコーパスです:何を収集するか、どう組み合わせるか、どこから来るのか、そして手動チームでは到底追いつけないスケールでキュレーションできるかどうかです。

パネルにはAgility RoboticsのSriとAhmed、個人的な立場で発言するロボティクスMLエンジニアのAnkur、元1XおよびWaymoのPrometheusのDaniel、そしてDistill Labsの共同創業者Jacekが参加しました。モデレーターはHackerSquadとBuilders CollectiveのAdamが務めました。

以下は、Vision-Language-Actionモデル、ワールドモデル、またはその背後にあるデータパイプラインを構築している方に重要な5つの重要ポイントです。

1. VLAはアクションヘッドを持つVLMであり、その汎化能力はウェブスケールの事前学習から生まれる

パネルの実用的な定義はシンプルでした:VLAはキャプション生成、セグメンテーション、オブジェクト理解などのタスクにおいて、インターネットスケールのテキストと画像で学習されたビジョン言語モデルから始まります。そこにアクションコンポーネントを追加し、ロボットデータでファインチューニングします。

この区別は重要です。ロボットデータは実行を教えます。ウェブスケールの事前学習はモデルに世界とは何かを教えます。

これが、VLAが明示的にトレーニングされていないオブジェクトを時に拾い上げられる理由です。汎化能力は少数のテレオペレーションによるロボットのデモンストレーションだけから来るのではありません。ロボットがループに入る前の広範な視覚的・意味的な露出から来ています。

事前学習コーパスが狭い場合、どれだけ高価なテレオペレーションデータがあっても、省略した汎化能力を完全に取り戻すことはできません。

「インターネットスケールのテキストと画像データで学習され…その後VLMをロボットデータでファインチューニングすることでVision-Language-Actionモデルが得られます。優れた点は汎化能力が向上することです:特定のオブジェクトを拾い上げるようにトレーニングすれば、似たものを見てきたので別のオブジェクトも拾い上げるよう指示できます。」
Ankur、ロボティクスMLエンジニア、個人的な立場での発言。9:59から視聴 →

📖 関連記事: Vision-Language Model(VLA)とは? · ベストロボティクスAIライブラリ · 基盤モデルの解説

2. ビジョン、言語、アクションが一つのトークン空間に統合されつつある

現代のVLAは重要な一点でLLMに似てきています:次のトークンを予測するのです。

そのトークンは単語、画像パッチ、または関節空間の制御コマンドかもしれません。Distill Labsの共同創業者Jacekが説明したように、ソフトウェアエージェントとの接続は直接的です。LLMはAPIツールを呼び出します。VLAは物理的なツールを呼び出します。ハーネスは「エンドポイントを呼び出す」から「カップを掴む」に変わりますが、基本的なパターンは似ています。

この意味は強力です:トークン化できるすべてのモダリティが同じトレーニング空間の一部になれます。ウェブ動画、自己中心的な映像、人間のデモンストレーション、テレオペレーション、オンポリシーのロボットデータがすべて共有表現に貢献できます。

制約は「モデルはこれを使えるか?」から「適切なスケールで適切な例を調達できるか?」に移ります。

「アクション空間をLLMのファンクションコールとして考えることができます…そのように分解すると、非物理的な世界向けに人々が構築するものと変わりません。ツールを公開するハーネス内でサブエージェントを起動するエージェントです。今はハーネスがより物理的になっています。それが強力な点です。ウェブのトレーニングデータに頼って非常に良い出発点を得られるからです。」
Jacek、共同創業者、Distill Labs。15:14から視聴 →

📖 関連記事: トークン化の解説 · AIエージェントテックスタックの内側 · AIエージェントの構築方法:完全ロードマップ

3. VLAとワールドモデルは異なるデータを必要とし、混同するとコストが高くつく

その夜の最も鋭い区別の一つはVLAトレーニングとワールドモデルトレーニングの違いでした。

Ankurが説明したように、VLAは主に模倣学習の問題です。クリーンで成功した高品質なトラジェクトリが必要です。悪いデモンストレーションは害になります。

ワールドモデルは異なります。アクションが与えられたときに次に何が起こるかを予測する必要があるため、成功した結果だけでなく、ミス、エッジケース、失敗も理解しなければなりません。ワールドモデルを計画や強化学習の学習済みシミュレーターとして使用したい場合、可能な未来の全範囲を表現する必要があります。

以前1XでワールドモデルのリードをしていたPrometheusのエンジニアDanielは、これが難しい理由を説明しました。現在の多くのワールドモデルは成功した結果に偏っています。失敗しそうなトラジェクトリを見せると、ミスをモデル化する代わりにリカバリーを幻覚するかもしれません。ロボティクスでは、それは特に危険です。接触、把持、失敗が最も起こりやすい瞬間こそ、モデルはアクション制御可能でなければなりません。

重要なポイント:「ロボティクスデータ」は一つの汎用バケットではありません。模倣ポリシーとワールドモデルは意図的に異なるコーパスを必要とします。

「非常にアクション制御可能なワールドモデルが本当に必要です…オブジェクトを把持するときの成否を分ける瞬間。そこにギャップがあれば、それは非常に悪いサインです。」
Daniel、Prometheus、元1X。35:36から視聴 →

📖 関連記事: AIモデルトレーニングとは? · AIハルシネーションの解説 · ロボティクスデータセット

4. データ階層は実在する:ウェブデータは幅広さを、ロボットデータは制御を与える

Agility RoboticsのエンジニアAhmedは、シグナルの明確な階層を示しました。

テレオペレーションデータは完全なロボット状態を含むため、最も強い制御情報を持ちます。人間のデモンストレーションと自己中心的な動画はより少ない直接的な制御シグナルを持ちます。ウェブ動画は低レベルの制御レイヤーでは最も少ない制御シグナルを持ちます。

しかし、それはウェブデータの重要性が低いことを意味しません。その役割が異なるということです。

ウェブスケールの動画はセマンティクス、コンテキスト、タスク構造、オブジェクトの多様性、および一般的な世界知識を教えます。部屋、ツール、人々、オブジェクト、目標が膨大なバリエーションにわたってどのように見えるかをモデルが理解するのを助けます。ただし、特定のロボット本体が特定のアクションを実行する際の細かな物理学をうまく教えることはできません。

Ankurが最も明確なアナロジーを示しました:メッシやロナウドのすべての動画を見てサッカーを深く理解しても、練習なしにはプレーできません。ウェブデータはゲームを教えます。オンロボットデータは身体を教えます。

同じ議論から実践的なデータ予算の洞察が得られました:ウェブデータの1時間はテレオペレーションデータの5分程度の転移可能な価値を提供するかもしれません。ウェブデータはテレオペを置き換えませんが、強力なウェブスケールの事前学習により、信頼性の高い実行に到達するために必要な高価なロボットデータの量を減らすことができます。

「メッシやロナウドのサッカー動画をたくさん見ることができますが、自分で練習するまで実際にプレーすることはできません。タスクの理解はウェブデータから得られます。実際に実行するためにはオンロボットデータが必要です…ウェブデータの1時間はテレオペデータの5分と同じかもしれません。」
Ankur、ロボティクスMLエンジニア、個人的な立場での発言。1:01:09から視聴 →

📖 関連記事: AIのための動画データ · YouTube動画データセット · AI用音声データセット · 画像データセット

5. 信頼できるスケーリング則はまだ存在しないため、キュレーション速度が競争優位になる

LLMについては、業界にKaplanとChinchillaのスケーリング則があります。VLAとワールドモデルについて、Danielは直接的でした:ロボティクスはまだそこに達していません。

チームはまだ、ウェブトークン、テレオペ時間、デプロイメントデータ、計算量、またはモデルサイズのクリーンな関数としてロボットのパフォーマンスを確実に予測することができません。課題の一部は、模倣学習とワールドモデリングが異なる教師シグナルを使用することです。もう一つは、重要な指標が事前学習の損失ではなく、下流のタスク成功率であることです。

Danielはまた自律走行車のシミュレーションとの有用な対比を示しました。自動運転では、接触が起きたときにシミュレーションが止まることが多いです。ロボティクスでは、接触こそが本当の複雑さが始まる場所です。把持、押し、滑り、変形、衝突、回復はエッジケースではありません。それがタスクそのものです。

より良いスケーリング則が現れるまで、優位性は最も速く適切な例を見つけてキュレーションできるチームに向かいます:特定のシーン、タスクファミリー、オブジェクトのインタラクション、失敗、接触の多い瞬間。これはモデリングの課題だけではありません。発見とデータパイプラインの課題でもあります。

「フロップカウントやトークンカウントに関するスケーリング則への回答は、LLMではKaplan et al.やChinchillaスケーリング則として一般的になっています。VLAとワールドモデルを科学的に比較するためにそれらの質問を今日提起しているわけではありません…答えはまだそこに達していないということで、本当にそこに到達すべきです。」
Daniel、Prometheus、元1XおよびWaymo。54:35から視聴 →

📖 関連記事: データ発見 · ベストAIトレーニングデータプロバイダー · LLMトレーニングデータ

これがロボティクスデータ戦略に意味すること

パネルは明確な結論に収束しました:

ウェブスケールのデータはロボットに世界の広い理解を与えます。オンロボットデータはその中での行動方法を教えます。事前学習コーパスが優れているほど、信頼性の高い実行に到達するために必要な高価なロボットデータが少なくなります。

それを実現するには、ほとんどのチームが過小評価している3つの能力が必要です:

🌐 ウェブスケールの抽出

時代遅れのタクソノミーを持つ固定された学術データセットだけでなく、オープンウェブからのペタバイト規模の動画、画像、音声収集。Bright Dataのウェブスケールデータ収集インフラカスタムデータソリューションをご覧ください。

最も価値あるタスクの多様性は、タイトル、タグ、またはキャプションに記述されることのないシーンに現れることが多いです。キーワード検索はロングテールの多くを見逃します。

⚖️ 防御可能な出所

テキストモデルは数兆のトークンで学習します。VLAは数兆のフレームで学習します。すべてのフレームにライセンスと出所の問題が伴う可能性があり、現実世界のロボットデプロイメントはリスクを高めます。トラストセンター倫理的なデータ収集ガイドラインで詳細をご確認ください。

モデルは収束しつつあります。差別化要因はコーパスになりつつあります:どれだけ幅広いか、どれだけ関連性があるか、そしてその出所を証明できるかどうかです。

VLAまたはワールドモデルを構築中ですか?

私たちのチームにご相談ください →ウェブスケールでトレーニング動画を発見・調達することについて。

AI向けBright Dataの詳細、VLA向け動画データの提供、またはロボティクス、コンピュータービジョン、マルチモーダルトレーニング向けの既製データセットをご覧ください。

あなたは下記にもご興味がおありかもしれません

Best LLM Scrapers blog image
AI

2026年最高のLLMスクレイパー:究極のツール比較

2026年版トップ6 LLMスクレイパー比較表:対応モデル・価格・主要機能を網羅し、最適なツール選択を支援します。
3 分読
Best Robotics AI Libraries
AI

2026年最高のロボティクスAIライブラリ:トップ10選定

2026年におけるNVIDIA IsaacからLeRobotまで、最適なロボティクスAIライブラリを詳細比較で探求し、適切なソリューション選択を支援します。
3 分読
Building AI-Ready Vector Datasets for LLMs blog image
AI

LLMのためのAI対応ベクトルデータセット構築:Bright Data、Google Gemini、Pineconeを使ったガイド

大規模言語モデル(LLM)は、私たちが情報にアクセスし、インテリジェントなアプリケーションを構築する方法を変革しています。LLMの可能性を最大限に引き出すには、特にドメイン固有の知識や独自のデータを使用する場合、高品質で構造化されたベクトルデータセットを作成することが重要です。LLMの性能と精度は、入力データの品質に直接結びついています。準備不足のデータセットは劣悪な結果をもたらす可能性があり、一方、十分にキュレーションされたデータセットはLLMを真のドメイン・エキスパートに変えることができます。 このガイドでは、AIに対応したベクターデータセットを生成するための自動パイプラインの構築方法を順を追って説明する。 課題:LLMのためのデータ収集と準備 LLMは膨大な汎用テキストコーパスで学習されますが、商品関連のクエリへの回答、業界ニュースの分析、顧客フィードバックの解釈など、特定のタスクやドメインに適用すると、不足することがよくあります。LLMを真に役立てるには、ユースケースに合わせた高品質のデータが必要です。 このデータは通常、ウェブ上に分散していたり、複雑なサイト構造の背後に隠されていたり、ボット対策によって保護されていたりする。 当社の自動ワークフローは、データセット作成の最も困難な部分を処理する合理化されたパイプラインでこれを解決します: コア技術の概要 パイプラインを構築する前に、関連するコアテクノロジーと、それぞれがワークフローをどのようにサポートしているかを簡単に見ておこう。 ブライトデータスケーラブルなウェブデータ収集 AIに対応したベクターデータセットを作成するための最初のステップは、関連性のある高品質なソースデータを収集することです。ナレッジベースやドキュメンテーションのような内部システムから得られるものもあるが、大部分は公共のウェブから得られることが多い。 しかし、最近のウェブサイトは、CAPTCHA、IPレート制限、ブラウザフィンガープリントなどの高度なボット対策メカニズムを使用しているため、大規模なスクレイピングは困難である。 Bright Dataは、データ収集の複雑さを抽象化するWeb Unlocker APIでこの課題を解決します。プロキシのローテーション、CAPTCHAの解決、ブラウザのエミュレーションを自動的に処理するため、データへのアクセス方法ではなく、データに集中することができます。 Google Gemini: インテリジェント・コンテンツ・トランスフォーメーション Geminiは、Googleによって開発された強力なマルチモーダルAIモデルのファミリーであり、様々なタイプのコンテンツを理解し処理することに優れている。私たちのデータ抽出パイプラインにおいて、Geminiは3つの重要な機能を果たします: このAIを活用したアプローチは、特に以下のような使用例において、脆弱なCSSセレクタや壊れやすい正規表現に依存する従来の方法よりも大きな利点をもたらす: AIがデータ抽出プロセスにどのような変化をもたらしているかについては、Using AI for Web Scrapingをご覧ください。スクレイピングのワークフローにGeminiを実装するための実践的なチュートリアルをお探しの場合は、包括的なガイドをご覧ください:GeminiによるWebスクレイピングをご覧ください。 文の変形意味埋め込み文の生成 エンベッディングは、高次元空間におけるテキスト(または他のデータタイプ)の密なベクトル表現である。これらのベクトルは意味的な意味を捉え、コサイン類似度やユークリッド距離のようなメトリクスを用いて測定される、類似したテキスト片を近接したベクトルで表現することを可能にする。この特性は、セマンティック検索、クラスタリング、検索拡張生成(RAG)のようなアプリケーションで重要である。 Sentence Transformersライブラリは、高品質の文や段落の埋め込みを生成するための使いやすいインターフェースを提供する。Hugging Face Transformersの上に構築され、意味タスクのために微調整された幅広い事前学習済みモデルをサポートしています。 このエコシステムで最も人気があり、効果的なモデルの1つがオールMiniLM-L6-v2である: より大きなモデルはより微妙なエンベディングを提供するかもしれないが、all-MiniLM-L6-v2は性能、効率、コストの間で非常に優れたバランスを提供する。その384次元ベクトルは ほとんどの実用的なユースケース、特に初期段階の開発やリソースに制約のある環境では、このモデルで十分すぎる。エッジケースにおける精度のわずかな低下は、通常、スピードとスケーラビリティの大幅な向上によって相殺されます。そのため、AIアプリケーションの最初のイテレーションを構築する場合や、控えめなインフラストラクチャでパフォーマンスを最適化する場合は、all-MiniLM-L6-v2を使用することをお勧めします。 Pineconeベクトル埋め込み画像の保存と検索 テキストがベクトル埋め込みデータに変換されると、それを効率的に保存、管理、照会するための専用のデータベースが必要になります。従来のデータベースはこのために設計されていません。ベクトル・データベースは、埋め込みデータの高次元の性質を扱うために特別に設計されており、RAGパイプライン、セマンティック検索、パーソナライゼーション、その他のAI駆動型アプリケーションに不可欠なリアルタイムの類似性検索を可能にします。 Pineconeは、開発者フレンドリーなインターフェイス、低レイテンシの検索パフォーマンス、完全に管理されたインフラストラクチャで知られる人気のベクトルデータベースです。ベクトル検索インフラストラクチャの複雑さを抽象化することで、複雑なベクトルインデックスと検索を効率的に管理します。主なコンポーネントは以下の通りです: Pineconeは2つのデプロイメントアーキテクチャを提供する:ServerlessとPod-Based です。ほとんどのユースケース、特に開始時や動的な負荷に対処する場合は、シンプルさとコスト効率からサーバーレスが推奨されます。 セットアップと前提条件 パイプラインを構築する前に、以下のコンポーネントが適切に設定されていることを確認する。 前提条件 各APIキーの生成方法については、以下のツール固有の設定セクションを参照してください。 必要なライブラリのインストール このプロジェクトのコアとなるPythonライブラリをインストールする: これらのライブラリーは提供している: 環境変数の設定 プロジェクトのルート・ディレクトリに.envファイルを作成し、APIキーを追加する: ブライトデータ設定 Bright DataのWeb Unlockerを使用するには: 実装例と統合コードについては、Web Unlocker GitHub […]
6 分読