콘텐츠로 이동

Deepgram으로 음성 메시지 텍스트 변환하기

음성 메시지나 오디오 파일을 받으면 내용을 일일이 듣고 확인하기 번거로울 때가 많아요. 특히 자동화 파이프라인에서 오디오 데이터를 텍스트로 바로 처리하고 싶을 때 적절한 도구가 없으면 작업이 막히곤 하죠.

OpenClaw에서는 Deepgram API를 연결해 이 문제를 해결할 수 있어요. 오디오 파일을 Deepgram에 업로드하고 변환된 텍스트를 응답 파이프라인에 바로 넣어주는 방식이에요.

5분 안에 설정을 끝내고 오디오 변환을 시작해 보세요.

  1. API 키 설정하기 환경 변수에 Deepgram API 키를 추가하세요.

    DEEPGRAM_API_KEY=dg_...
  2. Provider 활성화하기 설정 파일에서 다음과 같이 Deepgram을 활성화하세요. 기본적으로 nova-3 모델을 사용합니다.

    {
    tools: {
    media: {
    audio: {
    enabled: true,
    models: [{ provider: "deepgram", model: "nova-3" }],
    },
    },
    },
    }

특정 언어를 지정하거나 Deepgram의 부가 기능을 사용하고 싶다면 아래 예시처럼 설정할 수 있어요.

언어 지정 예시:

{
tools: {
media: {
audio: {
enabled: true,
models: [{ provider: "deepgram", model: "nova-3", language: "en" }],
},
},
},
}

언어 감지 및 문장 부호 옵션 사용 예시:

{
tools: {
media: {
audio: {
enabled: true,
providerOptions: {
deepgram: {
detect_language: true,
punctuate: true,
smart_format: true,
},
},
models: [{ provider: "deepgram", model: "nova-3" }],
},
},
},
}

설정 과정에서 문제가 생기면 다음 사항을 확인해 보세요.

  • 인증 오류: DEEPGRAM_API_KEY가 정확하게 입력되었는지 확인하세요. OpenClaw는 표준 Provider 인증 순서를 따릅니다.
  • 프록시 사용 시: 별도의 Gateway나 프록시를 사용한다면 tools.media.audio.baseUrl과 tools.media.audio.headers를 통해 엔드포인트와 헤더를 직접 설정해야 합니다.
  • 출력 제한: 변환 결과는 OpenClaw의 오디오 규칙(파일 크기 제한, 타임아웃, 텍스트 삽입 방식)을 그대로 따릅니다.
  • 스트리밍 미지원: 이 기능은 실시간 스트리밍이 아니라 Pre-recorded transcription 엔드포인트를 사용합니다.

설정 중에 도움이 더 필요하다면 AI Setup Assistant에게 물어보세요.

OpenClaw

OpenClaw Expert

아직 막혀 있나요?

이 문서에서 답을 못 찾았다면 OpenClaw Expert에게 바로 물어보세요.