OpenClawでDeepgramを使った音声文字起こしを設定する
音声データを扱うアプリケーションを開発していると、音声ファイルをどうやってテキスト化してAIに渡すかという問題に直面します。手動で処理を組むのは手間ですし、精度も気になるところです。
Deepgram APIを使用すると、OpenClawに送られた音声メッセージを簡単にテキストへ変換できます。
What You’ll Need
Section titled “What You’ll Need”- Deepgram API キー
- OpenClaw の動作環境
Quick Start
Section titled “Quick Start”Deepgramは OpenClaw で tools.media.audio を通じて音声の文字起こしを行うために使用されます。設定は非常にシンプルで、5分ほどで完了します。
- API キーを環境変数に設定します。
DEEPGRAM_API_KEY=dg_...- プロバイダーを有効にします。
nova-3モデルを使用するのがおすすめです。
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}これで、OpenClaw は音声ファイルを Deepgram にアップロードし、取得したテキストを {{Transcript}} + [Audio] ブロックとして返信パイプラインに挿入します。これはストリーミングではなく、録音済みデータの文字起こしエンドポイントを使用します。
オプション設定
Section titled “オプション設定”特定の言語を指定したり、詳細なフォーマット設定を行いたい場合は、以下のオプションが利用可能です。
model: Deepgram のモデル ID(デフォルトはnova-3)language: 言語のヒントdetect_language: 言語の自動検出を有効化punctuate: 句読点の付与を有効化smart_format: スマートフォーマットを有効化
言語を指定する場合の例:
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3", language: "en" }], }, }, },}Deepgram の詳細オプションを有効にする場合の例:
{ tools: { media: { audio: { enabled: true, providerOptions: { deepgram: { detect_language: true, punctuate: true, smart_format: true, }, }, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}Troubleshooting
Section titled “Troubleshooting”- 認証エラーが出る場合:
DEEPGRAM_API_KEYが正しく設定されているか確認してください。これが最も簡単な認証パスです。 - Proxy を使用している場合:
tools.media.audio.baseUrlやtools.media.audio.headersを設定することで、エンドポイントやヘッダーを上書きできます。 - 文字起こしが途切れる場合: ファイルサイズ制限やタイムアウト設定など、他のプロバイダーと共通の音声ルールが適用されます。
セットアップで困ったことがあれば、AI Setup Assistant で質問してみてください。
What’s Next
Section titled “What’s Next”OpenClaw Expert
まだ解決しませんか?
このページで解決しない場合は、OpenClaw Expertに直接質問してください。