コンテンツにスキップ

Firecrawlを使用したウェブコンテンツの抽出

ウェブサイトからデータを取得しようとしたとき、JavaScriptが多用されていたり、ボット対策でアクセスがブロックされたりして困ったことはありませんか?単純なリクエストだけでは中身が取得できないサイトは意外と多いものです。

OpenClawでは、こうした難しいサイトへの対策として Firecrawl を web_fetch のフォールバック抽出器として利用できます。Firecrawlは、ホスト型のコンテンツ抽出サービスで、ボット回避やキャッシュ機能を備えているため、確実にデータを手に入れたい場合に最適な選択肢です。

設定を始める前に、以下の準備ができているか確認してください。

  • Firecrawlのアカウント
  • Firecrawlの API key
  • OpenClawの Gateway 環境

わずか数分で Firecrawl を有効化できます。

  1. API key の取得: Firecrawl でアカウントを作成し、API key を生成します。
  2. 環境変数の設定: 取得したキーを Gateway 環境の FIRECRAWL_API_KEY に設定するか、設定ファイルに直接記述します。
  3. 設定の構成: 以下のように tools セクションを設定に追加してください。
{
tools: {
web: {
fetch: {
firecrawl: {
apiKey: "FIRECRAWL_API_KEY_HERE",
baseUrl: "https://api.firecrawl.dev",
onlyMainContent: true,
maxAgeMs: 172800000,
timeoutSeconds: 60,
},
},
},
},
}

API key が設定されている場合、firecrawl.enabled はデフォルトで true になります。また、maxAgeMs(デフォルトは2日間)を変更することで、キャッシュの保持期間を調整できます。

web_fetch を実行すると、システムは以下の順番で抽出を試みます。

  1. Readability: まずローカルで解析を試みます。
  2. Firecrawl: 設定されている場合、Readability の次に行われます。
  3. Basic HTML cleanup: 最後の手段として、基本的なクリーンアップのみを行います。

クレジットの消費が予想より多い

Section titled “クレジットの消費が予想より多い”

Firecrawlのリクエストにおいて、OpenClawは常に proxy: "auto" と storeInCache: true を使用します。auto モードは、通常の試行が失敗した際に stealth プロキシを使用してリトライします。この挙動により、基本的なスクレイピングよりも多くのクレジットを消費する場合がある点に注意してください。


セットアップで困ったことがあれば、AI Setup Assistant に聞いてみてください。

  • Web tools: ウェブツールの全体的なセットアップを確認する
OpenClaw

OpenClaw Expert

まだ解決しませんか?

このページで解決しない場合は、OpenClaw Expertに直接質問してください。