2026年7月、Together AIとY Combinator は初の専用YC GPUクラスターを立ち上げました。YCの創業者は数週間で本格的なコンピュートを確保できるようになりました。かつての2年契約がもはや唯一の選択肢ではなくなったのです。
あなたが新興ベンチャーのAIリーダーだとしましょう。物理AI、動画、または検索向けのファウンデーションモデルをトレーニングしています。それらのモデルには大量のFLOPsと大量の学習データが必要です。このアナウンスを聞いて、二つの感情が同時に湧くはずです。安堵、なぜなら最も難しい調達問題が解決されたから。そして不安、なぜなら他の全員にとっても同じだから。
これが今サイクル全体のパターンです。あなたが苦労して手に入れようとしているすべてのインプットが、競合他社にも同じ条件で手に入るようになっています。それがボードが繰り返し問う問いを生み出します。あなたの堀(モート)とは、一体何なのか?
まず「堀ではないもの」を消去する
コードは堀ではありません。エージェント型コーディングがその議論に終止符を打ちました。トレーニングインフラ、サービングスタック、評価ハーネスはすべて再構築可能です。コーディングエージェントを持つ有能なチームなら数週間で再現できます。完璧ではないにせよ、十分なレベルで。
アーキテクチャも堀ではありません。アーキテクチャは公開され、リークされ、あるいは挙動からリバースエンジニアリングされます。DeepSeekは、後発でも数年分のリードを数ヶ月に圧縮できることを示しました。今日あなたが好むアテンション・バリアントや状態空間のトリックも、ブログ記事一本で誰もが使えるものになります。
GPUそれ自体も堀ではありません。コンピュートは希少ですが、調達可能になりつつあります。TogetherとYCの契約がその証拠です。多くの売り手、低下するスイッチングコスト、そして柔軟性を目指して競い合う契約条件。コンピュートは負けてはならないレースです。しかし、勝てるレースではありません。
データもそれ単体では堀ではありません。あなたの計画が他の全員と同じライセンスデータセットと同じAPIを使うものなら、問題があります。多大なコストをかけて、他の全員と同じモデルを事前学習していることになります。では、何が残るのでしょうか?
Compute + Data + Recipe = Company
次のボードミーティングに持ち込むべきフレームがこれです。
2026年、方程式はシンプルです:Compute + Data + Recipe = Company。コード、インフラ、アプリ層など、それ以外のものはエージェントが再構築できます。あなたの重みこそ、三つが交わる場所であり、物理的に具現化されたもの。それが堀です。
重みは、エージェント型コーディングが複製できない唯一のアーティファクトです。それが秘密だからではありません。意思決定の圧縮された記録だからです。すべてのフィルタリング処理、カリキュラムの選択、RLの環境がパラメータに焼き込まれています。ドメイン専門家がゴミだと言ったのでコーパスの40%を捨てたという判断もそうです。同一クラスターと同一の生データを持つ二つのチームでも、異なるモデルを出荷します。なぜなら、レシピこそがモデルだからです。
これが、どの単一の円よりも交差点が重要な理由です。
- コンピュートのないデータはハードドライブに過ぎません。
- 差別化されたデータのないコンピュートは、Llamaを再現するための非常に高価な方法です。
- 判断のないデータとコンピュートは、シリーズAの資金を燃やしてベンチマーク向けのコモディティを生産する方法です。
重みは三つが重なる場所に存在します。スタックのそれ以外のものはすべて置き換え可能です。そのアーティファクトだけは違います。
あなたは同時に二つのレースを走っている
コンピュートのレースは誰もが認識しています。スコアボードがうるさいからです。クラスターの発表、巨額ラウンド、2年契約。そして今やYCスタイルのパートナーシップがそれをショートカットします。データのレースは並行して、今まさに、同じ物理法則と同じ緊迫感で走っています。希少な供給、集約するアクセス、そして先行者が条件を固めています。
シグナルはいたるところにあります。Redditはグーグルと年間6000万ドルのライセンス契約を締結しました。あるインファレンスクラウドはウェブアクセスレイヤーの取得に2億7500万ドルを支払いました。ハイパースケーラーは今やデータアクセスをファーストパーティのインフラとして提供しています。コンピュートと同じ見出しパターンです。ただ、もっと静かなページに印刷されているだけです。
データのレースには一つの決定的な違いがあります。収集していないデータのスポット市場は存在しません。コンピュートの機会を逃せば四半期待てばいい。データの機会を逃せば、必要だったコーパスは永遠に収集されなかったことになります。
では、そのスケールのデータは実際どこにあるのでしょうか?凍結されているアカデミックなスナップショットにはありません。一度に一ドメインという狭いサイロである、ライセンスカタログにもありません。使い果たされ、そもそも動画を保有したことのないCommon Crawlにもありません。オープンウェブは現存する最大のトレーニングデータソースです。テキスト、画像、PDF、そして何より動画が、あらゆる言語、あらゆるドメインにわたって毎日更新されています。
しかし、ウェブは自らを差し出しません。ペタバイト規模では、収集は産業的な能力です。ボットウォール、レート制限、レンダリング、鮮度、そして法務チームが守れるプロベナンス。オープンソースのスクレイピングスタックは成功率60〜75%が上限で、途中で壊れます。だからこそ、多くの資金力のあるラボが、モデルをトレーニングする代わりにクローラーの監視に研究者を費やすことになるのです。
自社でGPUを製造しないのと同様に、ウェブを自前で収集することは会社の中に別の会社を作るようなものです。ここで私の立場を率直にお伝えします。これがBright Dataで私たちがやっていることだからです。私たちは毎週約1ペタバイトのウェブデータを収集しています。それは90ペタバイトのウェブアーカイブの上に積み重なっています。3億2000万ドメインにわたる6300億ページを保有しています。99.99%の稼働率で運用し、法廷でテスト済みのコンプライアンスを備えています。私の知る限り、フロンティアのトレーニングランが必要とするスケールでウェブ収集を運営している会社は他にありません。
この並行線を最後まで引きましょう。コンピュートを早期に確保することは最低条件です。ウェブスケールのデータ供給を早期に確保することは全く同じ動きであり、全く同じ瞬間です。同じ市場のダイナミクスが、今まさに、より少ない人が注目しているレーンで展開されています。
調達した資金の使い方への示唆
1. コンピュートをレースとして、データを資産として扱う。コンピュートは最良の条件で借ります。市場はあなたに有利な方向に動いているので、それに乗りましょう。データはあなたが所有します。確保され、バージョン管理され、更新され、競合他社が入手できるものとは異なるものを。ほとんどのチームにとって、それは使い尽くされた公開コーパスを超えることを意味します。研究者たちは今、高品質な公開テキストが2026年から2032年の間に使い尽くされると予測しています。誰もがダウンロードできるものでトレーニングすれば、競合他社のモデルを選んだことになります。
2. 物理AIや動画の領域にいるなら、これは二倍当てはまります。あなたのコーパスはそもそもCommon Crawlにありませんでした。ワールドモデルとVLAは、自己中心的で、タスクリッチで、多様な動画で動きます。そのレースで勝っているラボは、カテゴリーが標準化される前の今、収集を産業化しているところです。データパイプラインは支援インフラではありません。それがプロダクトの意思決定そのものです。
3. 希少なシニア人材は配管ではなくレシピに投入する。エージェントはデータローダーを書けます。しかし、ロボットが洗濯物をたたむことを学ぶために何を見るべきかは決められません。検索モデルがあなたの垂直領域でGoogleを打ち負かすために何を見なければならないかも決められません。その判断、第三の円こそ、あなたの研究者が替えの利かない部分です。それに合わせて人員配置をしましょう。
4. ボードに明確に伝える。私たちの堀は重みです。競合他社が持てないデータ供給、独自のレシピ、早期に確保したコンピュートの上に。これはデューデリジェンスに耐える一文です。「優秀なエンジニアがいる」はもはや通用しません。
不快な時計
TogetherとYCの契約がもう一つ示していること。インプットは急速に集約されています。コンピュートはクラスターとパートナーシップに囲い込まれています。データはライセンスと買収に囲い込まれています。2026年に構築できる交差点は、2027年に利用可能になるものより大きいのです。後発者にとって、円は縮小しています。
Compute + Data + Recipe = Company。二つのレースは並行して走っています。両方でフィニッシャーとしてカウントされなければなりません。