跳到內容

使用 Firecrawl 強化網頁抓取

寫過爬蟲的人都知道,最頭痛的不是解析 HTML,而是遇到那些 JS 渲染的網頁,或是動不動就把你擋掉的防爬機制。當你發現簡單的 HTTP 請求已經搞不定某些網站時,這就是 Firecrawl 該上場的時候了。

Firecrawl 是一個專門處理內容提取的託管服務,它內建了規避機器人偵測的功能,還能幫你處理快取。在 OpenClaw 裡,我們把它當作 web_fetch 的強力後援。

  • Firecrawl 帳號與 API key
  • 正在運行的 OpenClaw Gateway 環境

要在 OpenClaw 中啟用 Firecrawl,只需要簡單兩個步驟:

  1. 取得 API key:在 Firecrawl 官網建立帳號並生成 key。
  2. 更新配置:你可以直接在設定檔中填入,或是將 FIRECRAWL_API_KEY 設定在 Gateway 的環境變數中。

以下是完整的配置範例,直接貼進你的設定檔即可:

{
tools: {
web: {
fetch: {
firecrawl: {
apiKey: "FIRECRAWL_API_KEY_HERE",
baseUrl: "https://api.firecrawl.dev",
onlyMainContent: true,
maxAgeMs: 172800000,
timeoutSeconds: 60,
},
},
},
},
}
  • 自動啟用:只要 OpenClaw 偵測到 API key,firecrawl.enabled 就會自動設為 true。
  • 快取控制:maxAgeMs 決定了快取結果可以存多久,預設是 172,800,000 毫秒(也就是 2 天)。
  • 隱身模式:OpenClaw 預設會開啟 proxy: "auto" 和 storeInCache: true。當 auto 模式發現基本請求失敗時,會自動嘗試使用 stealth 代理進行重試。

當你呼叫 web_fetch 時,OpenClaw 會照這個順序嘗試抓取資料:

  1. Readability (本地解析)
  2. Firecrawl (如果已配置)
  3. 基本 HTML 清理 (最後的保底方案)

如果你發現 Firecrawl 的額度用得很快,通常是因為觸發了 auto 代理模式。當基本抓取失敗時,Firecrawl 會切換到 stealth 代理進行重試,這類請求通常會消耗更多額度。

有任何設定上的疑問嗎?可以直接詢問 AI Setup Assistant。

  • Web tools:查看完整的網頁工具設定指南。
OpenClaw

OpenClaw Expert

還是卡住了?

如果這篇文件沒有解決你的情境,直接問 OpenClaw Expert,拿到可執行步驟。