使用 Firecrawl 強化網頁抓取
寫過爬蟲的人都知道,最頭痛的不是解析 HTML,而是遇到那些 JS 渲染的網頁,或是動不動就把你擋掉的防爬機制。當你發現簡單的 HTTP 請求已經搞不定某些網站時,這就是 Firecrawl 該上場的時候了。
Firecrawl 是一個專門處理內容提取的託管服務,它內建了規避機器人偵測的功能,還能幫你處理快取。在 OpenClaw 裡,我們把它當作 web_fetch 的強力後援。
需要準備的東西
Section titled “需要準備的東西”- Firecrawl 帳號與 API key
- 正在運行的 OpenClaw Gateway 環境
要在 OpenClaw 中啟用 Firecrawl,只需要簡單兩個步驟:
- 取得 API key:在 Firecrawl 官網建立帳號並生成 key。
- 更新配置:你可以直接在設定檔中填入,或是將
FIRECRAWL_API_KEY設定在 Gateway 的環境變數中。
以下是完整的配置範例,直接貼進你的設定檔即可:
{ tools: { web: { fetch: { firecrawl: { apiKey: "FIRECRAWL_API_KEY_HERE", baseUrl: "https://api.firecrawl.dev", onlyMainContent: true, maxAgeMs: 172800000, timeoutSeconds: 60, }, }, }, },}- 自動啟用:只要 OpenClaw 偵測到 API key,
firecrawl.enabled就會自動設為 true。 - 快取控制:
maxAgeMs決定了快取結果可以存多久,預設是 172,800,000 毫秒(也就是 2 天)。 - 隱身模式:OpenClaw 預設會開啟
proxy: "auto"和storeInCache: true。當auto模式發現基本請求失敗時,會自動嘗試使用 stealth 代理進行重試。
當你呼叫 web_fetch 時,OpenClaw 會照這個順序嘗試抓取資料:
- Readability (本地解析)
- Firecrawl (如果已配置)
- 基本 HTML 清理 (最後的保底方案)
額度消耗比預期快
Section titled “額度消耗比預期快”如果你發現 Firecrawl 的額度用得很快,通常是因為觸發了 auto 代理模式。當基本抓取失敗時,Firecrawl 會切換到 stealth 代理進行重試,這類請求通常會消耗更多額度。
有任何設定上的疑問嗎?可以直接詢問 AI Setup Assistant。
- Web tools:查看完整的網頁工具設定指南。
OpenClaw Expert
還是卡住了?
如果這篇文件沒有解決你的情境,直接問 OpenClaw Expert,拿到可執行步驟。