Firecrawl로 웹 데이터 추출 한계 극복하기
웹 데이터를 가져오다 보면 단순한 HTTP 요청만으로는 해결되지 않는 순간이 있어요. JavaScript가 화면을 꽉 채우고 있는 사이트나, 봇 방어 솔루션 때문에 접근조차 막히는 페이지를 만나면 정말 답답하죠.
이런 까다로운 상황을 해결하기 위해 OpenClaw는 Firecrawl을 web_fetch의 fallback 추출기로 사용해요. Firecrawl은 봇 우회와 캐싱을 지원하는 호스팅 서비스로, 일반적인 방법으로 데이터를 가져오기 힘든 사이트에서 큰 힘이 돼요.
필요한 것
섹션 제목: “필요한 것”- Firecrawl 계정 및 API key
- OpenClaw Gateway 환경 설정 권한
빠른 시작
섹션 제목: “빠른 시작”5분 안에 Firecrawl 설정을 마칠 수 있어요. 먼저 Firecrawl 계정에서 API key를 생성하세요. 그 다음 FIRECRAWL_API_KEY를 Gateway 환경 변수에 설정하거나, 아래와 같이 config 파일에 직접 입력하면 돼요.
{ tools: { web: { fetch: { firecrawl: { apiKey: "FIRECRAWL_API_KEY_HERE", baseUrl: "https://api.firecrawl.dev", onlyMainContent: true, maxAgeMs: 172800000, timeoutSeconds: 60, }, }, }, },}몇 가지 참고할 점이 있어요:
- API key가 설정에 있으면
firecrawl.enabled는 자동으로 true가 돼요. maxAgeMs는 캐시를 얼마나 오래 유지할지 결정해요. 기본값은 2일(172,800,000ms)이에요.
OpenClaw의 web_fetch는 아래와 같은 순서로 데이터를 추출해요:
- Readability (로컬 엔진)
- Firecrawl (설정된 경우)
- Basic HTML cleanup (최후의 수단)
문제 해결
섹션 제목: “문제 해결”크레딧이 생각보다 빨리 소모돼요
OpenClaw는 Firecrawl 요청 시 proxy: "auto" 모드를 사용해요. 이 모드는 일반적인 요청이 실패하면 자동으로 stealth proxy를 써서 재시도하는데, 이때 일반 요청보다 더 많은 크레딧을 사용할 수 있어요.
설정 과정에서 도움이 필요하다면 AI Setup Assistant에게 질문해 보세요.
다음 단계
섹션 제목: “다음 단계”OpenClaw Expert
아직 막혀 있나요?
이 문서에서 답을 못 찾았다면 OpenClaw Expert에게 바로 물어보세요.