Zum Inhalt springen

Deepgram Audio-Transkription in OpenClaw einrichten

Kennst du das? Du willst Audio-Features in deine App einbauen, aber die Transkription ist entweder zu langsam oder versteht kein Wort. Wenn du Voice Notes oder Audio-Dateien verarbeiten willst, ohne dich mit komplexen Setups herumzuschlagen, ist Deepgram eine exzellente Wahl.

In OpenClaw nutzen wir Deepgram für die Transkription von eingehendem Audio über tools.media.audio. Das System lädt die Datei hoch, lässt sie von Deepgram verarbeiten und injiziert den Text direkt in die Reply Pipeline via {{Transcript}}. Es ist kein Streaming, sondern nutzt den Endpoint für voraufgezeichnete Audios.

In fünf Minuten ist Deepgram startklar. Folge diesen Schritten:

  1. API Key setzen: Füge deinen Key zu deinen Umgebungsvariablen hinzu:

    Terminal-Fenster
    DEEPGRAM_API_KEY=dg_...
  2. Provider aktivieren: Konfiguriere den Provider in deiner config.json5. Wir empfehlen das nova-3 Model für die beste Performance:

    {
    tools: {
    media: {
    audio: {
    enabled: true,
    models: [{ provider: "deepgram", model: "nova-3" }],
    },
    },
    },
    }

Du kannst die Transkription mit zusätzlichen Parametern verfeinern. Hier ist ein Beispiel für ein Setup mit automatischer Spracherkennung und Formatierung:

{
tools: {
media: {
audio: {
enabled: true,
providerOptions: {
deepgram: {
detect_language: true,
punctuate: true,
smart_format: true,
},
},
models: [{ provider: "deepgram", model: "nova-3" }],
},
},
},
}

Wenn du eine spezifische Sprache erzwingen willst, füge das language Feld direkt im Model-Objekt hinzu:

{
tools: {
media: {
audio: {
enabled: true,
models: [{ provider: "deepgram", model: "nova-3", language: "de" }],
},
},
},
}
  • Authentifizierungsfehler: OpenClaw folgt einer Standard-Reihenfolge für die Provider-Auth. Der einfachste Weg ist die Verwendung der DEEPGRAM_API_KEY Umgebungsvariable.
  • Proxy-Probleme: Falls du einen Proxy nutzt, musst du die Endpoints oder Headers manuell überschreiben. Nutze dafür tools.media.audio.baseUrl und tools.media.audio.headers.
  • Output-Limits: Die Ausgabe unterliegt denselben Regeln wie bei anderen Providern (Größenbeschränkungen, Timeouts).
  • Transkript fehlt: Stelle sicher, dass enabled: true im audio Block gesetzt ist, damit die Transkription in die Pipeline injiziert wird.

Hast du Fragen zum Setup? Nutze den AI Setup Assistant.

OpenClaw

OpenClaw Expert

Noch festgefahren?

Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.