Deepgram으로 음성 메시지 텍스트 변환하기
음성 메시지나 오디오 파일을 받으면 내용을 일일이 듣고 확인하기 번거로울 때가 많아요. 특히 자동화 파이프라인에서 오디오 데이터를 텍스트로 바로 처리하고 싶을 때 적절한 도구가 없으면 작업이 막히곤 하죠.
OpenClaw에서는 Deepgram API를 연결해 이 문제를 해결할 수 있어요. 오디오 파일을 Deepgram에 업로드하고 변환된 텍스트를 응답 파이프라인에 바로 넣어주는 방식이에요.
필요한 것
섹션 제목: “필요한 것”- Deepgram API Key
- Deepgram 계정 (https://deepgram.com)
빠른 시작
섹션 제목: “빠른 시작”5분 안에 설정을 끝내고 오디오 변환을 시작해 보세요.
-
API 키 설정하기 환경 변수에 Deepgram API 키를 추가하세요.
DEEPGRAM_API_KEY=dg_... -
Provider 활성화하기 설정 파일에서 다음과 같이 Deepgram을 활성화하세요. 기본적으로
nova-3모델을 사용합니다.{tools: {media: {audio: {enabled: true,models: [{ provider: "deepgram", model: "nova-3" }],},},},}
상세 옵션 설정하기
섹션 제목: “상세 옵션 설정하기”특정 언어를 지정하거나 Deepgram의 부가 기능을 사용하고 싶다면 아래 예시처럼 설정할 수 있어요.
언어 지정 예시:
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3", language: "en" }], }, }, },}언어 감지 및 문장 부호 옵션 사용 예시:
{ tools: { media: { audio: { enabled: true, providerOptions: { deepgram: { detect_language: true, punctuate: true, smart_format: true, }, }, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}문제 해결
섹션 제목: “문제 해결”설정 과정에서 문제가 생기면 다음 사항을 확인해 보세요.
- 인증 오류:
DEEPGRAM_API_KEY가 정확하게 입력되었는지 확인하세요. OpenClaw는 표준 Provider 인증 순서를 따릅니다. - 프록시 사용 시: 별도의 Gateway나 프록시를 사용한다면
tools.media.audio.baseUrl과tools.media.audio.headers를 통해 엔드포인트와 헤더를 직접 설정해야 합니다. - 출력 제한: 변환 결과는 OpenClaw의 오디오 규칙(파일 크기 제한, 타임아웃, 텍스트 삽입 방식)을 그대로 따릅니다.
- 스트리밍 미지원: 이 기능은 실시간 스트리밍이 아니라 Pre-recorded transcription 엔드포인트를 사용합니다.
설정 중에 도움이 더 필요하다면 AI Setup Assistant에게 물어보세요.
다음 단계
섹션 제목: “다음 단계”OpenClaw Expert
아직 막혀 있나요?
이 문서에서 답을 못 찾았다면 OpenClaw Expert에게 바로 물어보세요.