AI

DeerFlowでBright Dataを使ったエンタープライズグレードのウェブデータアクセス

エンタープライズ向けウェブアクセスのためにBright DataをDeerFlowに統合し、AIエージェントが大規模にウェブデータを確実に検索・取得できるようにします。
4 分読
DeerFlow with Bright Data

この記事では、以下の内容を学びます:

  • DeerFlowとは何か、また長期タスクのハーネスとして何を提供するか。
  • Bright Dataがウェブ検索とフェッチ機能に最適な理由。
  • Bright Data MCPを通じてBright DataをDeerFlowに統合する方法。

さっそく始めましょう!

DeerFlowとは?

DeerFlow

DeerFlowは、ByteDanceが開発したオープンソースのAIエージェントハーネスです。サブエージェント、メモリ、スキル、ツール、サンドボックスを組み合わせて、AIによる複雑なタスクの処理を支援します。

DeerFlowは、ウェブアプリから直接操作するか、メッセージングゲートウェイを通じてTelegramやWeChatなどのメッセージングプラットフォームから利用できます。

DeerFlowは長期的なワークロードを専門としており、ディープリサーチ、コーディング、データパイプライン、レポート生成、コンテンツ作成などのユースケースをサポートしています。このプロジェクトは完全にオープンソースで、GitHubスターが79k以上あります。

主な機能

DeerFlowがサポートするコア機能は以下の通りです:

  • スキルとツール:リサーチ、レポート、スライド、ウェブページ、画像生成などのための拡張可能な機能。
  • サブエージェント:複雑なタスクに対して、独立したコンテキスト、ツール、終了条件を持つ専門エージェントを生成します。
  • サンドボックス実行:エージェントにファイルやコマンドの読み書き・編集・実行のための隔離された環境を提供します。
  • エージェントブラウザ:エージェントがウェブサイトのナビゲート、クリック、入力、フォーム送信、動的ページとのインタラクションを行えます。
  • ウェブアクセス:ウェブ検索、フェッチ、レンダリング済みページキャプチャツールを提供します。
  • 長期メモリ:セッションをまたいでユーザーの設定、プロファイル、蓄積された知識を保存します。
  • コンテキストエンジニアリング:完了した作業を要約し、中間結果をオフロードしてコンテキストを効率的に維持します。
  • MCPサポート:外部MCPサーバーに接続してエージェントのツールと機能を拡張します。
  • スケジュールタスク:cronベースのスケジュールを使用して、定期的または一回限りのタスクを自動実行します。
  • メッセージングチャンネル:Telegram、Slack、Discord、Feishu、DingTalk、WeChat等を通じてエージェントと対話できます。
  • オブザーバビリティ:LangSmith、Langfuse、Monocleと統合して、エージェントの実行、ツール、LLM呼び出しをトレースします。
  • 組み込みクライアント:DeerFlowをアプリケーションに直接統合するためのPythonクライアントを提供します。

詳細は公式ドキュメントをご覧ください。

DeerFlowのウェブ検索・フェッチエンジンとしてのBright Data

DeerFlowの多くの機能の中に、組み込みのウェブ検索・フェッチツールがあります。これらのツールにより、内部AIエージェントがオンラインの新しいソースを検索し、ウェブグラウンディングのためにそのコンテンツにアクセスできます。

これはLLMの知識カットオフを克服するために不可欠です。また、AIエージェントが最新のウェブデータを使用してタスクを実行し、より正確な回答を提供することも可能にします。ウェブ検索・フェッチツールを提供するために、DeerFlowはFirecrawl、Brave、DuckDuckGoなどのSERPおよびウェブ検索APIソリューションと統合されています。

しかし、これらのプロバイダーは必ずしもエンタープライズ用途に対応しているわけではありません。多言語検索、複数の検索エンジン、またはブロックされずにウェブサイトへ確実にアクセスするためのサポートが不足している場合があります。CAPTCHAの解決機能や大規模なIPプロキシネットワークが欠けているものもあります。

まさにそこでBright Dataが役立ちます!

Bright DataはDeerFlowの組み込みウェブプロバイダーと一線を画しており、4億以上のレジデンシャルIPを含むグローバルインフラを備えています。このアーキテクチャは、実際のウェブデータワークフローに必要なスケーラビリティ、アンチボット機能、パフォーマンスを提供します。無制限の同時実行をサポートし、99.99%のアップタイムと99.95%の成功率を達成しています。

解決策としてのBright Data MCP

DeerFlowをBright Dataのウェブツールに接続する最も簡単な方法は、Bright Data MCPを使用することです。

Bright Data MCPは70以上のツールを提供しており、それぞれBright DataのAPIベースの製品によって動作します。Rapidモード(月5,000リクエストの無料ティア)でも、ウェブ検索、スクレイピング、ソース発見に役立つツールが利用できます:

ツール 説明
search_engine + 並列リクエスト用特別バージョン(search_engine Google、Bing、Yandexなどの検索エンジンから結果を取得します。
scrape_as_markdown + 並列リクエスト用特別バージョン(scrape_batch ボット保護を処理しながら、ウェブページをクリーンなMarkdownに変換します。
discover AIを活用した検索を実行し、ランク付けされた関連ウェブ結果を返します。

70以上のツールすべてにアクセスするには、Proモードを有効化する必要があります。これにより、Amazon、LinkedIn、Instagram、YouTube、Zillow、Google Mapsなどのプラットフォームの構造化データ抽出ツールや40以上の他のウェブサイト、さらにBright DataのブラウザAPIを活用したブラウザ自動化ツールが利用可能になります。

Bright Data MCPをDeerFlowに統合する方法

このステップバイステップのセクションでは、DeerFlowにBright Data MCPをセットアップする方法を学びます。

Bright Dataの統合により、DeerFlow AIエージェントはアンチボットのブロックを気にすることなく、ウェブを検索し、新しいソースを発見し、ウェブページをスクレイピングし、ウェブコンテンツと対話する能力を得ます。

以下の手順に従ってください!

前提条件

このチュートリアルセクションを進めるには、以下が必要です:

厳密には必須ではありませんが、以下も推奨します:

ステップ#1:DeerFlowをインストールする

DeerFlowのインストール用フォルダを作成し、その中でローカルコーディングエージェントセッションを起動して、以下のプロンプトを実行してください:

Help me clone DeerFlow if needed, then bootstrap it for local development by following https://raw.githubusercontent.com/bytedance/deer-flow/main/Install.md

これはDeerFlowをインストールする最も簡単な方法です。

コーディングAIエージェントは、DeerFlowリポジトリのインストール手順を含むMarkdownファイルをダウンロードします。その後、その手順に従ってDeerFlowをローカルにインストールおよび設定します。

前提条件が不足している場合、エージェントはそれらをインストールするために必要なコマンドを提供します。別のターミナルウィンドウでそれらのコマンドを実行し、AIエージェントとの会話を続けてください。

プロセスの終わりに、以下のような出力が表示されるはずです:

DeerFlowインストール後にAIエージェントが生成した出力

インストールフォルダには、以下のような構造のDeerFlowプロジェクトが含まれているはずです:

<your_deerflow_installation_folder>
├── backend/
├── contracts/
├── deploy/
├── docker/
├── docs/
├── frontend/
├── logs/
├── plans/
├── pr-build/
├── scripts/
├── skills/
├── temp/
├── tests/
├── AGENTS.md
├── CHANGELOG.md
├── CHANGELOG_zh.md
├── CLAUDE.md
├── CODE_OF_CONDUCT.md
├── CONTRIBUTING.md
├── Install.md
├── LICENSE
├── Makefile
├── README.md
├── README_fr.md
├── README_ja.md
├── README_ru.md
├── README_zh.md
├── RELEASING.md
├── SECURITY.md
├── config.example.yaml
├── deer-flow.code-workspace
└── extensions_config.example.json

特に重要なファイルが2つあります:

  • extensions_config.example.jsonMCPサーバーまたはスキルを通じてDeerFlow拡張機能を設定するためのサンプルJSONファイル。
  • config.example.yaml:LLM統合、スキルディレクトリ、DeerFlowのAIエージェント動作をカスタマイズするための多くのオプションを設定するためのサンプル設定ファイル。

よくできました!DeerFlowがローカルにインストールされました。

ステップ#2:DeerFlowを設定する

次に、DeerFlowのインストールフォルダで以下のコマンドを実行してハーネスを設定します:

make setup
DeerFlowのセットアップを開始する

これにより、いくつかの設定ステップをガイドするインタラクティブなCLIセットアップウィザードが起動します。最初のステップはLLMプロバイダーの選択です。

注意:DeerFlowはDoubao-Seed-2.0-CodeDeepSeek V3.2Kimi 2.5の使用を強く推奨しています。

ただし、ここではDeerFlowをOpenAIと統合する方法を説明します。まず、ターゲットLLMプロバイダーとして「OpenAI」を選択します:

OpenAIプロバイダーを選択する

次にモデルを選択し(例:gpt-5-mini)、OpenAI APIキーを入力します。DeerFlowは選択したOpenAIモデルを使用してAIエージェントを動作させます。

次に、組み込みのウェブ検索・フェッチツールのいずれかをオプションで設定するかどうか尋ねられます:

ウェブ検索とフェッチの設定をスキップする

どちらの場合も「Skip for now」オプションを選択してください。Bright Data MCPがこの機能を提供します。

実行ポリシーと安全ポリシーを選択して続行します。オプションでIMチャンネルを統合することもできます。最終的に、セットアッププロセスによりDeerFlowを起動するための最小限のconfig.yamlファイルが生成され、APIキーが.envに保存されます。

素晴らしい!これでDeerFlowを起動する準備が整いました。

ステップ#3:DeerFlowフロントエンドを起動する

DeerFlowのインストールフォルダで、以下のコマンドを実行してフロントエンドとバックエンドの依存関係をインストールします:

make install

次に、以下のコマンドでローカル開発サーバーを起動します:

make dev

以下のような出力が表示されるはずです:

「make dev」コマンドの出力

DeerFlowは以下の構成でローカルに実行されます:

  • ゲートウェイ:アプリケーションのバックエンドで、ポート8001で実行されます。
  • フロントエンド:ポート3000で実行され、Nginxがポート2026でリバースプロキシを処理します。

DeerFlowフロントエンドにアクセスするには、ブラウザで以下のURLを開いてください:

http://localhost:2026

以下が表示されるはずです:

「http://localhost:2026」の表示

ローカルフロントエンドは公式DeerFlowウェブサイトと同じUIを共有していることに注意してください。

「Get Started with 2.0」をクリックしてDeerFlowワークスペースにアクセスします。ワークスペースに初めてアクセスする際は、管理者アカウントの作成を求められます。

サインアップフォームに記入してローカルアカウントを作成します:

ローカルDeerFlowアカウントを作成するフォーム

次に、ログインしてDeerFlowワークスペースにアクセスします:

DeerFlowフロントエンド

ここから、DeerFlowエージェントと対話し、設定されたMCPサーバー、スキル、IMチャンネル、その他の設定を確認できます。すばらしい!

ステップ#4:Bright Data MCPに慣れる

Bright Data MCPをDeerFlowに接続する前に、MCPサーバーがマシンで動作することを確認してください。

まず、@brightdata/mcp npmパッケージを通じてBright Data MCPパッケージをグローバルにインストールします:

npm install -g @brightdata/mcp

MCPサーバーが正しく起動することを確認します:

API_TOKEN="<YOUR_BRIGHT_DATA_API>" npx -y @brightdata/mcp

<YOUR_BRIGHT_DATA_API>をBright Data APIキーに置き換えてください。これにより必要なAPI_TOKEN環境変数が設定され、Bright Data MCPサーバーがローカルで起動します。詳細については、Bright Data MCPドキュメントをご覧ください。

すべてが正しく設定されている場合、以下のような起動ログが表示されるはずです:

Bright Data MCPの起動ログ

初回実行時に、@brightdata/mcpパッケージがBright Dataアカウントに2つのAPIを自動的に作成することに注意してください:

  • mcp_unlocker:Bright DataのWeb Unlocker API(およびSERP API)に接続します。
  • mcp_browser:Bright DataのブラウザAPIに接続します。

これらのAPIがBright Data MCPを通じて利用可能な70以上のツールを動作させます。公式リポジトリに記載されているように、カスタムAPIを設定することもできます。

デフォルトのAPIが正常に作成されたことを確認するには、Bright Dataコントロールパネルの「Web Access > Web Access API」を開いてください。両方のAPIが「My APIs」テーブルに表示されているはずです:

起動時にBright Data MCPが作成した「mcp_unlocker」と「mcp_browser」APIに注目

デフォルトでは、Bright Data MCPはRapidモード(無料ティア)で起動し、限られたツールのみにアクセスできます。70以上のツールすべてを有効にするには、PRO_MODE=true環境変数を設定してProモードに切り替えます:

API_TOKEN="<YOUR_BRIGHT_DATA_API>" PRO_MODE="true" npx -y @brightdata/mcp

注意:Proモードは[追加料金が発生します](https://github.com/brightdata/brightdata-mcp?tab=readme-ov-file#-pricing, modes)。

すばらしい!Bright Data MCPがローカルで動作することを確認できました。次はそれをDeerFlowに接続します。

ステップ#5:DeerFlowでBright Data MCPを設定する

extensions_config.jsonファイルを通じてDeerFlowでMCPサーバー接続を設定できます。

まず、インストールに含まれているサンプル設定ファイルのコピーを作成します:

cp extensions_config.example.json extensions_config.json

サンプルファイルにはGitHubとPostgreSQLのMCPサーバーの設定が含まれています。それらを削除し、mcpServersセクションに以下の内容が含まれていることを確認してください:

{
  // ...
  "mcpServers": {
    "bright-data-web-mcp": {
      "enabled": true,
      "command": "npx",
      "args": [
        "@brightdata/mcp"
      ],
      "env": {
        "API_TOKEN": "<YOUR_BRIGHT_DATA_API_KEY>",
        "PRO_MODE": "true"
      }
    }
  },
  // ...
}

これにより、DeerFlowにローカルのBright Data MCPサーバーインスタンス(bright-data-web-mcpと呼ばれる)への接続方法が指示されます。具体的には、以下の2つの環境変数とともにnpx -y @brightdata/mcpコマンドを使用するよう指示します:

  • API_TOKEN(必須):Bright Data APIキーに設定します。
  • PRO_MODE(オプション):Proモードを有効にするにはtrueに設定します。Rapidモードでのビルドデータ MCP接続をセットアップするにはfalseに設定するか、PRO_MODE=trueを削除します。

MCPサーバー接続を有効にする"enabled": trueの設定に注意してください。

extensions_config.jsonを保存します。DeerFlowはBright Data MCPサーバーをローカルで起動して接続するために必要なすべての情報を持っています。クール!

ステップ#6:接続が機能することを確認する

現在のDeerFlowプロセスを終了し、以下のコマンドで再起動します:

make dev

ワークスペースのウェブアプリで、左下隅の「Settings and more」をクリックし、「Settings」を選択します:

「Settings and More > Settings」オプションの選択”/></figure>
<p class=「Settings」モーダルが表示されます。「Tools」セクションに移動すると、設定されたbright-data-web-mcpサーバーが表示されます:

「bright-data-web-mcp」MCPサーバーに注目

設定通り、Bright Data MCPの接続はすでに有効化されています。

DeerFlowは現在、MCPサーバーから利用可能なツールを表示する方法を提供していません。そのため、新しいチャットを開始して次のようなプロンプトを入力してください:

Which Bright Data MCP tools do you have access to? 

Bright Data MCPをProモードで設定した場合、次のような応答が返されます:

利用可能なBright Data MCPツールに注目

Bright Data MCPが公開する70以上のツールすべてがリストされていることに注目してください。Rapidモードを使用している場合、AIエージェントはそのモードで利用可能なツールのみを返します。

すばらしい!これにより、DeerFlow AIエージェントがBright Data MCPツールにアクセスできることが確認されました。

ステップ#7:統合をテストする

Bright DataがそのMCPを通じて提供する機能がDeerFlowに正しく統合されてアクセス可能であることを確認する時です。そのためには、ウェブ検索とスクレイピングを必要とするタスクをAIエージェントに与える必要があります。

例えば、特定のトピック(この場合はMCP自体)に関する論文を発見し、DeerFlow AIエージェントにそれらを分析させたいとします。

DeerFlowには科学論文分析のための組み込みacademic-paper-reviewスキルが搭載されていることをお忘れなく:

「academic-paper-review」スキルに注目

AIエージェントがBright Data MCPツールを使用してウェブから論文を検索・アクセスできるか確認してみましょう。

確認するために、エージェントに次のようなタスクを依頼してみてください:

Search the web for the most recent papers (last 12 months) on arXiv related to MCP (Model Context Protocol). Select the 5 most relevant papers and scrape their Markdown content from their HTML pages. Review and summarize the papers using the /academic-paper-review skill, then produce a final report highlighting the most interesting insights, findings, and criticisms.

以下のようになるはずです:

プロンプトの実行

最初に、AIエージェントは以下の情報を提供するよう求めるフォームを表示しました:

  • 検索するキーワード(推奨:「MCP」と「Model Context Protocol」)。
  • 期間(推奨:「12ヶ月」)。
  • 論文を取得するソース(推奨:「arXiv」)。
  • 論文の数(推奨:「5」)。

フォームに記入してデータを送信すると、AIエージェントがタスクを開始します。すばらしい!

ステップ#8:エージェントの実行と出力を分析する

DeerFlow AIエージェントが何を行ったかをより深く理解するために、ステップのドロップダウンを展開してください:

タスクを完了するためにDeerFlow AIエージェントが実行したステップ

実行中、AIエージェントは:

  1. academic-paper-reviewスキルをロードしました。
  2. Bright Data MCPのdiscoverツールを使用して「MCP」と「Model Context Protocol」に関する論文を検索しました。
  3. 各arXiv論文のHTMLページURLを取得しました。
  4. Bright DataのWeb Unlocker APIを通じてscrape_as_markdownツールを使用して5つの論文をスクレイピングしました。
  5. ロードされたスキルを使用して論文をレビューし、分析を最終的なMarkdownレポートにまとめました。

生成されたレポートをスクロールすると、以下が表示されます:

DeerFlow AIエージェントが生成したレポート

各論文に対して、DeerFlow AIエージェントが要約、主な貢献、強み、弱み、方法論の評価、著者への質問、および推奨事項を生成したことに注目してください。レポートには論文への直接リンクが含まれており、DeerFlowのacademic-paper-reviewスキルから導出されたスコアを含む詳細な分析も記載されています。

Et voilà!これにより、Bright DataがDeerFlowに正しく統合されており、ウェブ検索、発見、スクレイピング、その他多くのウェブベースの機能のソースとして機能できることが証明されました。

まとめ

このブログ記事では、DeerFlowとは何か、そしてそれがAIエージェントによる長期タスクの処理をどのように可能にするかを学びました。特に、エンタープライズグレードのウェブアクセスツールのソースとして、Bright Data MCPへの接続方法を詳しく見てきました。

ここで示したように、Bright DataとDeerFlowを統合することで、DeerFlowの組み込みウェブ検索・フェッチオプションを完全に置き換えられます。これにより、ブロックされることなくウェブページにアクセスして対話するための、本番環境対応でスケーラブルかつ高信頼性のツールが提供されます。

今すぐ無料でBright Dataアカウントに登録し、AI対応のウェブ製品を探索してください!