Deepgram Audio-Transkription in OpenClaw einrichten
Kennst du das? Du willst Audio-Features in deine App einbauen, aber die Transkription ist entweder zu langsam oder versteht kein Wort. Wenn du Voice Notes oder Audio-Dateien verarbeiten willst, ohne dich mit komplexen Setups herumzuschlagen, ist Deepgram eine exzellente Wahl.
In OpenClaw nutzen wir Deepgram für die Transkription von eingehendem Audio über tools.media.audio. Das System lädt die Datei hoch, lässt sie von Deepgram verarbeiten und injiziert den Text direkt in die Reply Pipeline via {{Transcript}}. Es ist kein Streaming, sondern nutzt den Endpoint für voraufgezeichnete Audios.
Voraussetzungen
Abschnitt betitelt „Voraussetzungen“- Einen Deepgram API Key (von deepgram.com)
- Zugriff auf die Dokumentation unter developers.deepgram.com
Schnellstart
Abschnitt betitelt „Schnellstart“In fünf Minuten ist Deepgram startklar. Folge diesen Schritten:
-
API Key setzen: Füge deinen Key zu deinen Umgebungsvariablen hinzu:
Terminal-Fenster DEEPGRAM_API_KEY=dg_... -
Provider aktivieren: Konfiguriere den Provider in deiner
config.json5. Wir empfehlen dasnova-3Model für die beste Performance:{tools: {media: {audio: {enabled: true,models: [{ provider: "deepgram", model: "nova-3" }],},},},}
Erweiterte Optionen
Abschnitt betitelt „Erweiterte Optionen“Du kannst die Transkription mit zusätzlichen Parametern verfeinern. Hier ist ein Beispiel für ein Setup mit automatischer Spracherkennung und Formatierung:
{ tools: { media: { audio: { enabled: true, providerOptions: { deepgram: { detect_language: true, punctuate: true, smart_format: true, }, }, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}Wenn du eine spezifische Sprache erzwingen willst, füge das language Feld direkt im Model-Objekt hinzu:
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3", language: "de" }], }, }, },}Fehlerbehebung
Abschnitt betitelt „Fehlerbehebung“- Authentifizierungsfehler: OpenClaw folgt einer Standard-Reihenfolge für die Provider-Auth. Der einfachste Weg ist die Verwendung der
DEEPGRAM_API_KEYUmgebungsvariable. - Proxy-Probleme: Falls du einen Proxy nutzt, musst du die Endpoints oder Headers manuell überschreiben. Nutze dafür
tools.media.audio.baseUrlundtools.media.audio.headers. - Output-Limits: Die Ausgabe unterliegt denselben Regeln wie bei anderen Providern (Größenbeschränkungen, Timeouts).
- Transkript fehlt: Stelle sicher, dass
enabled: trueimaudioBlock gesetzt ist, damit die Transkription in die Pipeline injiziert wird.
Hast du Fragen zum Setup? Nutze den AI Setup Assistant.
Nächste Schritte
Abschnitt betitelt „Nächste Schritte“OpenClaw Expert
Noch festgefahren?
Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.