コンテンツにスキップ

OpenClawでDeepgramを使った音声文字起こしを設定する

音声データを扱うアプリケーションを開発していると、音声ファイルをどうやってテキスト化してAIに渡すかという問題に直面します。手動で処理を組むのは手間ですし、精度も気になるところです。

Deepgram APIを使用すると、OpenClawに送られた音声メッセージを簡単にテキストへ変換できます。

  • Deepgram API キー
  • OpenClaw の動作環境

Deepgramは OpenClaw で tools.media.audio を通じて音声の文字起こしを行うために使用されます。設定は非常にシンプルで、5分ほどで完了します。

  1. API キーを環境変数に設定します。
DEEPGRAM_API_KEY=dg_...
  1. プロバイダーを有効にします。nova-3 モデルを使用するのがおすすめです。
{
tools: {
media: {
audio: {
enabled: true,
models: [{ provider: "deepgram", model: "nova-3" }],
},
},
},
}

これで、OpenClaw は音声ファイルを Deepgram にアップロードし、取得したテキストを {{Transcript}} + [Audio] ブロックとして返信パイプラインに挿入します。これはストリーミングではなく、録音済みデータの文字起こしエンドポイントを使用します。

特定の言語を指定したり、詳細なフォーマット設定を行いたい場合は、以下のオプションが利用可能です。

  • model: Deepgram のモデル ID(デフォルトは nova-3)
  • language: 言語のヒント
  • detect_language: 言語の自動検出を有効化
  • punctuate: 句読点の付与を有効化
  • smart_format: スマートフォーマットを有効化

言語を指定する場合の例:

{
tools: {
media: {
audio: {
enabled: true,
models: [{ provider: "deepgram", model: "nova-3", language: "en" }],
},
},
},
}

Deepgram の詳細オプションを有効にする場合の例:

{
tools: {
media: {
audio: {
enabled: true,
providerOptions: {
deepgram: {
detect_language: true,
punctuate: true,
smart_format: true,
},
},
models: [{ provider: "deepgram", model: "nova-3" }],
},
},
},
}
  • 認証エラーが出る場合: DEEPGRAM_API_KEY が正しく設定されているか確認してください。これが最も簡単な認証パスです。
  • Proxy を使用している場合: tools.media.audio.baseUrl や tools.media.audio.headers を設定することで、エンドポイントやヘッダーを上書きできます。
  • 文字起こしが途切れる場合: ファイルサイズ制限やタイムアウト設定など、他のプロバイダーと共通の音声ルールが適用されます。

セットアップで困ったことがあれば、AI Setup Assistant で質問してみてください。

OpenClaw

OpenClaw Expert

まだ解決しませんか?

このページで解決しない場合は、OpenClaw Expertに直接質問してください。