---
title: "LlamaIndexとブライト・データによるウェブ・スクレイピング"
slug: web-scraping-with-llamaindex
date: 2025-06-30T09:08:23+00:00
modified: 2025-09-16T16:32:53+00:00
permalink: https://brightdata.jp/blog/ai/web-scraping-with-llamaindex
type: blog
---

[ ブログ ](https://brightdata.jp/blog "ブログ") / [AI](https://brightdata.jp/blog/ai)







 [AI](https://brightdata.jp/blog/ai)

# LlamaIndexとブライト・データによるウェブ・スクレイピング

PythonでLlamaIndexとBright Dataツールを使って、ウェブページのスクレイピング、スクリーンショットの撮影、Google検索の実行、データフィードの自動化を簡単に行う方法をご紹介します。

 6 分読





 [ ![Jacob Nulty](https://media.brightdata.jp/2024/12/Jacob-Nulty-50x50.jpg) ](https://brightdata.com/blog/authors/jake-nulty)

 [Jake Nulty

Technical Writer

 ](https://brightdata.com/blog/authors/jake-nulty)





 ![LlamaIndex & Bright Data Web Scraping](https://media.brightdata.jp/2025/06/LlamaIndex-Bright-Data-Web-Scraping.png)





このガイドでは、LlamaIndexの[Bright Dataツールを使って](https://docs.llamaindex.ai/en/stable/api_reference/tools/brightdata/)データを抽出します。このチュートリアルを終えると、以下のことができるようになります。

- ウェブサイトのデータをマークダウンとして抽出
- ウェブページのスクリーンショットを撮る
- アプリケーション内からGoogle検索を実行
- データフィードとBright DataのWeb Scraper APIを使用して、オンデマンドでコレクションをトリガーする。

## はじめにLlamaIndexとは？

AIの時代以前は、データ収集はもろくメンテナンスの多いプロセスだった。サイトのレイアウトを1つ変更するだけで、パイプライン全体が壊れてしまうこともあった。現代では、適切なツールを使っている限り、そのようなことはない。

LlamaIndexは、言語モデルを外部のツールやデータソースに接続します。LlamaIndexには、これらのツールセットと最小限の機能で動作するように構築された最小限のモデルが同梱されています。特に私たちのケースでは、LlamaIndexは[Bright DataのMCPサーバーと](/ai/mcp-server)統合することができます。

次のセクションでは、LlamaIndexのBright Dataツールセットの機能について説明します。Pythonがインストールされていることを確認してください。

## 前提条件

ここでの要求は驚くほど軽い。単純なスクレイピング操作であれば、LLMすら必要ない。必要なのはLlamaIndexとBright Data APIキー、それだけだ！

### ラマインデックス

LlamaIndexは、以下のコマンドでインストールできるツール一式を提供している。ウェブをスクレイピングするだけなら、これは厳密には必要ない。

```none
pip install llama-index
```

同社のブライト・データ・ツールは、pip経由で以下のコマンドでインストールできる。

```none
pip install llama-index-tools-brightdata
```

### ブライトデータ

まず、Bright Dataのアカウントが必要です。[このリンクから](/products/web-unlocker)Unlockerの無料トライアルにサインアップできます。アカウントを取得したら、**APIキーを保存します。**

APIキーは、Bright Dataの「プロキシ」ダッシュボードまたは[ユーザー](/cp/setting/users)設定で確認できます。

![APIキーの検索](https://media.brightdata.com/2025/06/image-50-1024x196.png)## LlamaIndexによるスクレイピング

### BrightDataToolSpec：Bright Data MCPへの架け橋

LlamaIndexは`BrightDataToolSpec`クラスへのアクセスを提供します。以下のスニペットは、すべてのツールへのアクセスを設定します。APIキーを自分のもの、ゾーン名を自分の個人的なゾーンに置き換えることを忘れないでください。

```none
from llama_index.tools.brightdata import BrightDataToolSpec

brightdata = BrightDataToolSpec(
    api_key="your-api-key",
    zone="your-zone-name")
```

### マークダウンとしてスクレイプ

以下のスニペットは、任意のページをスクレイピングし、その内容をマークダウンとして返すように設定します。`scrape_as_markdown()`メソッドがすべてやってくれます。

```none
from llama_index.tools.brightdata import BrightDataToolSpec

brightdata = BrightDataToolSpec(
    api_key="your-api-key",
    zone="your-zone-name")
result = brightdata.scrape_as_markdown(url="https://www.amazon.com")
print(result.text)
```

以下は、このコマンドのサンプル出力だ。ご覧の通り、Amazonのデータをスクレイピングし、マークダウンに変換することに成功している。

```none
![](https://m.media-amazon.com/images/G/01/gno/sprites/nav-sprite-global-1x-reorg-privacy._CB546805360_.png)

## Skip to

* [ Main content](#skippedLink)

---

##  Keyboard shortcuts

* Search
alt + /
* Cart
shift + alt + C
* Home
shift + alt + H
* Orders
shift + alt + O
* Show/Hide shortcuts
shift + alt + Z

To move between items, use your keyboard's up or down arrows.

[ .us ](/ref=nav%5Flogo)

 Delivering to Bothell 98011  Update location

All

Select the department you want to search in All Departments Alexa Skills All The Best Pets Amazon Autos Amazon Devices Amazon Fresh Amazon Global Store Amazon Haul Amazon One Medical Amazon Pharmacy Amazon Resale Appliances Apps & Games Arts, Crafts & Sewing Audible Books & Originals Automotive Parts & Accessories Baby Beauty & Personal Care Books CDs & Vinyl Cell Phones & Accessories Clothing, Shoes & Jewelry Women's Clothing, Shoes & Jewelry Men's Clothing, Shoes & Jewelry Girl's Clothing, Shoes & Jewelry Boy's Clothing, Shoes & Jewelry Baby Clothing, Shoes & Jewelry Collectibles & Fine Art Computers Credit and Payment Cards Digital Music Electronics Garden & Outdoor Gift Cards Grocery & Gourmet Food Handmade Health, Household & Baby Care Home & Business Services Home & Kitchen Industrial & Scientific Just for Prime Kindle Store Luggage & Travel Gear Luxury Stores Magazine Subscriptions Metropolitan Market Movies & TV Musical Instruments Office Products Pet Supplies Premium Beauty Prime Video Same-Day Store Smart Home Software Sports & Outdoors Subscribe & Save Subscription Boxes Tools & Home Improvement Toys & Games Under $10 Video Games Whole Foods Market

Search Amazon

[ EN ](/customer-preferences/edit?ie=UTF8&preferencesReturnUrl=%2F&ref%5F=topnav%5Flang)

[ Hello, sign in Account & Lists ](https://www.amazon.com/ap/signin?openid.pape.max%5Fauth%5Fage=0&openid.return%5Fto=https%3A%2F%2Fwww.amazon.com%2F%3F%5Fencoding%3DUTF8%26ref%5F%3Dnav%5Fya%5Fsignin&openid.identity=http%3A%2F%2Fspecs.openid.net%2Fauth%2F2.0%2Fidentifier%5Fselect&openid.assoc%5Fhandle=usflex&openid.mode=checkid%5Fsetup&openid.claimed%5Fid=http%3A%2F%2Fspecs.openid.net%2Fauth%2F2.0%2Fidentifier%5Fselect&openid.ns=http%3A%2F%2Fspecs.openid.net%2Fauth%2F2.0)

[ Returns & Orders ](/gp/css/order-history?ref%5F=nav%5Forders%5Ffirst) [ 0  Cart ](/gp/cart/view.html?ref%5F=nav%5Fcart)

[ All ](/gp/site-directory?ref%5F=nav%5Fem%5Fjs%5Fdisabled)

* [Amazon Haul](/haul/store?ref%5F=nav%5Fcs%5Fhul%5Fdisb)
* [Medical Care ](https://health.amazon.com/prime?ref%5F=nav%5Fcs%5Fall%5Fhealth%5Fingress%5Fonem%5Fh)
* [Saks](/luxurystores/saks?ref%5F=nav%5Fcs%5Fsaks%5Fdisc)
* [Best Sellers](/gp/bestsellers/?ref%5F=nav%5Fcs%5Fbestsellers)
* [Amazon Basics](/Amazon%5FBasics?channel=discovbar&field-lbr%5Fbrands%5Fbrowse-bin=AmazonBasics&ref%5F=nav%5Fcs%5Famazonbasics)
* [New Releases](/gp/new-releases/?ref%5F=nav%5Fcs%5Fnewreleases)
* [Registry](/gp/browse.html?node=16115931011&ref%5F=nav%5Fcs%5Fregistry)
* [Groceries ](/fmc/learn-more?ref%5F=nav%5Fcs%5Fgroceries)
* [Today's Deals](/deals?ref%5F=nav%5Fcs%5Fgb)
* [Gift Cards ](/gift-cards/b/?ie=UTF8&node=2238192011&ref%5F=nav%5Fcs%5Fgc)
* [Smart Home](/Smart-Home/b/?ie=UTF8&node=6563140011&ref%5F=nav%5Fcs%5Fsmart%5Fhome)
* [Music](/music/player?ref%5F=nav%5Fcs%5Fmusic)
* [Prime ](/prime?ref%5F=nav%5Fcs%5Fprimelink%5Fnonmember)
* [Customer Service](/gp/help/customer/display.html?nodeId=508510&ref%5F=nav%5Fcs%5Ffs%5Fhub%5Fnavbar%5Fc)
* [Books](/books-used-books-textbooks/b/?ie=UTF8&node=283155&ref%5F=nav%5Fcs%5Fbooks)
* [Pharmacy](https://pharmacy.amazon.com/?nodl=0&ref%5F=nav%5Fcs%5Fpharmacy)
* [Luxury Stores](/luxurystores?ref%5F=nav%5Fcs%5Fluxury)
* [Amazon Home](/home-garden-kitchen-furniture-bedding/b/?ie=UTF8&node=1055398&ref%5F=nav%5Fcs%5Fhome)
* [Fashion](/amazon-fashion/b/?ie=UTF8&node=7141123011&ref%5F=nav%5Fcs%5Ffashion)
* [Toys & Games](/toys/b/?ie=UTF8&node=165793011&ref%5F=nav%5Fcs%5Ftoys)
* [Beauty & Personal Care](/Beauty-Makeup-Skin-Hair-Products/b/?ie=UTF8&node=3760911&ref%5F=nav%5Fcs%5Fbeauty)
* [Sell](/b/?%5Fencoding=UTF8&ld=AZUSSOA-sell&node=12766669011&ref%5F=nav%5Fcs%5Fsell)
* [Gift Shop](/gcx/Gifts-for-Everyone/gfhz/?ref%5F=nav%5Fcs%5Fgiftfinder)
* [Automotive](/automotive-auto-truck-replacements-parts/b/?ie=UTF8&node=15684181&ref%5F=nav%5Fcs%5Fautomotive)
* [Home Improvement](/Tools-and-Home-Improvement/b/?ie=UTF8&node=228013&ref%5F=nav%5Fcs%5Fhi)
* [Computers](/computer-pc-hardware-accessories-add-ons/b/?ie=UTF8&node=541966&ref%5F=nav%5Fcs%5Fpc)
* [Sports & Outdoors](/sports-outdoors/b/?ie=UTF8&node=3375251&ref%5F=nav%5Fcs%5Fsports)

[Prime Day is July 8-11](/primeday/?%5Fencoding=UTF8&ref%5F=nav%5Fswm%5FUS%5FPD25%5FLU%5FGW%5FSWM%5FAnnounce&pf%5Frd%5Fp=72020f4f-d636-4d60-9e39-399532eba237&pf%5Frd%5Fs=nav-sitewide-msg-text&pf%5Frd%5Ft=4201&pf%5Frd%5Fi=navbar-4201&pf%5Frd%5Fm=ATVPDKIKX0DER&pf%5Frd%5Fr=JA1EM1AGN54HEE871RFM)
```

### スクリーンショットを撮る

スクリーンショットは、ウェブをスクラップする際のもう一つの優れたツールである。最近のLLMのほとんどは、画像を見て解釈することができる。以下のスニペットでは、`get_screenshot()`メソッドでページのスクリーンショットを撮っています。

```none
from llama_index.tools.brightdata import BrightDataToolSpec

brightdata = BrightDataToolSpec(
    api_key="your-api-key",
    zone="your-zone-name")
result = brightdata.get_screenshot(url="https://example.com", output_path="my-screenshot.png")
```

下のショットは`BrightDataToolSpecから`。これはPythonの中で最も簡単なスクリーンショットの方法かもしれません。

![example.comのスクリーンショット](https://media.brightdata.com/2025/06/image-51-1024x442.png)### 検索エンジン

その前のツール同様、単純なメソッド`search_engine()`を使って検索エンジンを呼び出す。デフォルトではGoogleを使いますが、好きな検索エンジンを使うことができます。SERPのクエリ・パラメータについては、[こちらを](https://docs.brightdata.com/scraping-automation/serp-api/query-parameters/google)参照してください。

以下の検索エンジンが利用可能です。

- グーグル
- ビング
- ヤンデックス
- ダックダックゴー

```none
from llama_index.tools.brightdata import BrightDataToolSpec

brightdata = BrightDataToolSpec(
    api_key="your-api-key",
    zone="mcp_unlocker")
result = brightdata.search_engine(
    query="Top News Articles"
)

with open("output.json", "w") as file:
    json.dump(json.loads(result.json()), file, indent=4)
```

データをJSONファイルにダンプする前に、`json.loads()を呼び出して`いることに注目してください。`.json()を`使用しても、LlamaIndexはJSONを文字列として出力します。`dictの`ように扱いたい場合は、`json.loads()が`従来のJSONオブジェクトに変換してくれます。

スクレイパーが書き込むJSONファイルの一部である。

```none
{
    "id_": "34bcf1ea-998a-48ce-beb2-0d6feff950e1",
    "embedding": null,
    "metadata": {
        "query": "Top News Articles",
        "engine": "google",
        "url": "https://www.google.com/search?q=Top%20News%20Articles&num=10"
    },
    "excluded_embed_metadata_keys": [],
    "excluded_llm_metadata_keys": [],
    "relationships": {},
    "metadata_template": "{key}: {value}",
    "metadata_separator": "\n",
    "text_resource": {
        "embeddings": null,
        "text": "# Accessibility Links\n\nSkip to main content[Accessibility help](https://support.google.com/websearch/answer/181196?hl=en)\n\nAccessibility feedback\n\n[](https://www.google.com/webhp?hl=en&ictx=0&sa=X&ved=0ahUKEwizmMaNvoCOAxUmmYkEHa58MagQpYkNCAo)\n\nPress / to jump to the search box\n\nTop News Articles\n\n[Sign in](https://accounts.google.com/ServiceLogin?hl=en&passive=true&continue=https://www.google.com/search%3Fq%3DTop%2BNews%2BArticles%26num%3D10%26oq%3DTop%2BNews%2BArticles%26uule%3Dw%2BCAIQICINVW5pdGVkIFN0YXRlcw%26hl%3Den%26sourceid%3Dchrome%26ie%3DUTF-8&ec=GAZAAQ)\n\n# Filters and Topics\n\n[AI Mode](/search?q=Top+News+Articles&sca%5Fesv=62890ff6c1b2e448&hl=en&udm=50&
```

### ウェブスクレーパーAPI

[スクレイピング API](/products/web-scraper)では、オンデマンドでコレクションをトリガーするデータフィードを作成できます。以下のコードでは、`web_data_feed() を`使用して Scraper API からコレクションをトリガーしています。

```none
from llama_index.tools.brightdata import BrightDataToolSpec

brightdata = BrightDataToolSpec(
    api_key="your-api-key",
    zone="mcp_unlocker")
result = brightdata.web_data_feed(
    source_type="linkedin_person_profile",
    url="https://www.linkedin.com/in/williamhgates/",
    timeout=600,
    polling_interval=30)

print(result)
```

しばらくしたら、[ログのページに](/cp/scrapers/api/logs?)移動してください。すべてのコレクションが記録され、ボタンをクリックするだけでダウンロードできるようになっているはずです。

![スクレイパー・レポートはダウンロード可能](https://media.brightdata.com/2025/06/image-52-1024x277.png)## 結論

これでウェブスクレイピングがレベルアップし、作業量が大幅に削減された。LlamaIndex、Bright Data、そしてほんの数行のPythonがあれば、ウェブから欲しいデータをほとんど引き出すことができる。

マークダウンの抽出、スクリーンショットのキャプチャ、Google検索の実行、完全なスクレイピングジョブのトリガーなど、LlamaIndexとBright Dataは貴重なデータを収穫する力を提供します。

次のレベルに進む準備はできていますか？このパワーツールのコンボをライブ・データ・パイプラインに接続したり、AIエージェントを構築したりしましょう。

今すぐ無料トライアルに登録して、データ収集のレベルアップを図りましょう！



お問い合わせ無料トライアル![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 目次







日本企業向けデータソリューション

日本のトップ企業が信頼するスケーラブルなウェブデータプラットフォーム。日本語24時間サポート、GDPR・個人情報保護法準拠、日本企業20社以上の導入実績。

[詳細を見る](https://brightdata.jp/solutions/data-solutions-for-japanese-companies "詳細を見る")







 [ ](https://news.ycombinator.com/submitlink?t=LlamaIndex%E3%81%A8%E3%83%96%E3%83%A9%E3%82%A4%E3%83%88%E3%83%BB%E3%83%87%E3%83%BC%E3%82%BF%E3%81%AB%E3%82%88%E3%82%8B%E3%82%A6%E3%82%A7%E3%83%96%E3%83%BB%E3%82%B9%E3%82%AF%E3%83%AC%E3%82%A4%E3%83%94%E3%83%B3%E3%82%B0&u=https://brightdata.jp/blog/ai/web-scraping-with-llamaindex) [ ](https://www.linkedin.com/shareArticle?mini=true&title=LlamaIndex%E3%81%A8%E3%83%96%E3%83%A9%E3%82%A4%E3%83%88%E3%83%BB%E3%83%87%E3%83%BC%E3%82%BF%E3%81%AB%E3%82%88%E3%82%8B%E3%82%A6%E3%82%A7%E3%83%96%E3%83%BB%E3%82%B9%E3%82%AF%E3%83%AC%E3%82%A4%E3%83%94%E3%83%B3%E3%82%B0&url=https://brightdata.jp/blog/ai/web-scraping-with-llamaindex) [ ](http://www.reddit.com/submit?title=LlamaIndex%E3%81%A8%E3%83%96%E3%83%A9%E3%82%A4%E3%83%88%E3%83%BB%E3%83%87%E3%83%BC%E3%82%BF%E3%81%AB%E3%82%88%E3%82%8B%E3%82%A6%E3%82%A7%E3%83%96%E3%83%BB%E3%82%B9%E3%82%AF%E3%83%AC%E3%82%A4%E3%83%94%E3%83%B3%E3%82%B0&url=https://brightdata.jp/blog/ai/web-scraping-with-llamaindex)







##  あなたは下記にもご興味がおありかもしれません

 [ ![OpenHuman with Bright Data](https://media.brightdata.jp/2026/09/OpenHuman-with-Bright-Data.png) ](https://brightdata.jp/blog/ai/openhuman-with-bright-data "Bright Data CLIを通じたOpenHumanにおける本番対応ウェブアクセス")

 [AI



 ![Antonello Zanini](https://media.brightdata.jp/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Bright Data CLIを通じたOpenHumanにおける本番対応ウェブアクセス

Bright Data CLIをOpenHumanに統合して、AIエージェント向けの本番対応ウェブアクセスとデータ収集を実現します。



 09-Sep-2026

 3 分読

 ](https://brightdata.jp/blog/ai/openhuman-with-bright-data)

 [ ![Multimodal Web Scraping with MiniMax](https://media.brightdata.jp/2026/09/Multimodal-Web-Scraping-with-MiniMax.png) ](https://brightdata.jp/blog/%e3%82%a6%e3%82%a7%e3%83%96%e3%83%87%e3%83%bc%e3%82%bf/multimodal-web-scraping-with-minimax "MiniMaxによるマルチモーダルウェブスクレイピング")

 [ウェブデータ



 ![Antonello Zanini](https://media.brightdata.jp/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### MiniMaxによるマルチモーダルウェブスクレイピング

Bright Data Web UnlockerとMiniMax M3ビジョンを組み合わせて、画像やウェブページのスクリーンショットから構造化データを抽出します。



 09-Sep-2026

 1 分読

 ](https://brightdata.jp/blog/%e3%82%a6%e3%82%a7%e3%83%96%e3%83%87%e3%83%bc%e3%82%bf/multimodal-web-scraping-with-minimax)

 [ ![The 10 Best CLI Tools for Codex in 2026](https://media.brightdata.jp/2026/08/The-10-Best-CLI-Tools-for-Codex-in-2026.png) ](https://brightdata.jp/blog/ai/best-cli-tools-for-codex "2026年版 Codex向けCLIツール10選 – テスト＆ランキング")

 [AI



 ![Daniel Shashko](https://media.brightdata.jp/2022/04/Daniel-Shashko-2-50x50.png)

Daniel Shashko

Web Data &amp; AI Expert





### 2026年版 Codex向けCLIツール10選 – テスト＆ランキング

Codexをより速く、より有能にする10のCLIツール。サンドボックス内から実際のウェブアクセスを提供するBright Data CLIから始まります。



 06-Sep-2026

 4 分読

 ](https://brightdata.jp/blog/ai/best-cli-tools-for-codex)
