Audio und Voice Notes mit OpenClaw verarbeiten
Du kennst das: Jemand schickt dir eine Sprachnachricht, aber du bist gerade in einem Meeting oder hast keine Kopfhörer zur Hand. Als Entwickler willst du diese Audiodaten nicht mühsam selbst abtippen, sondern sie direkt als Text verarbeiten, um darauf basierend Aktionen auszulösen oder Slash-Commands zu nutzen. Die manuelle Konvertierung von Audio in Text ist oft zeitfressend und unterbricht deinen Workflow.
Mit OpenClaw kannst du diesen Prozess automatisieren. Das System erkennt Audiodaten, transkribiert sie und stellt den Text für deine Templates und Befehle bereit.
Voraussetzungen
Abschnitt betitelt „Voraussetzungen“- Eine laufende OpenClaw-Instanz
- API Keys für Provider (OpenAI, Groq, Deepgram oder Google)
- Lokale CLI-Tools im
PATH(optional für lokales Processing), wiewhisperodersherpa-onnx-offline - Ausreichend Berechtigungen für den Zugriff auf lokale Pfade oder URLs
Schnellstart
Abschnitt betitelt „Schnellstart“In nur 5 Minuten ist deine Audio-Transkription einsatzbereit. OpenClaw nutzt standardmäßig eine Auto-Detection, solange du tools.media.audio.enabled nicht auf false setzt.
Am besten konfigurierst du einen Provider mit einem CLI-Fallback, falls die Cloud-API einmal nicht erreichbar ist oder du Kosten sparen willst:
{ tools: { media: { audio: { enabled: true, maxBytes: 20971520, // 20MB Limit models: [ { provider: "openai", model: "gpt-4o-mini-transcribe" }, { type: "cli", command: "whisper", args: ["--model", "base", "{{MediaPath}}"], timeoutSeconds: 45, }, ], }, }, },}Sobald diese Konfiguration aktiv ist, lädt OpenClaw das erste Audio-Attachment herunter, prüft die Dateigröße und schickt es an den ersten verfügbaren Model-Eintrag. Wenn die Transkription erfolgreich ist, wird der Body der Nachricht durch einen [Audio] Block ersetzt und der Text steht in der Variable {{Transcript}} zur Verfügung.
Funktionsweise und Limits
Abschnitt betitelt „Funktionsweise und Limits“OpenClaw geht bei der Erkennung sehr strukturiert vor. Wenn du keine spezifischen Modelle konfigurierst, wird diese Reihenfolge abgearbeitet:
- Lokale CLIs: Zuerst wird nach
sherpa-onnx-offline,whisper-clioderwhispergesucht. - Gemini CLI: Nutzung von
geminiviaread_many_files. - Provider Keys: Prüfung der API-Keys für OpenAI, Groq, Deepgram und Google.
Hier sind wichtige technische Eckdaten, die du beachten solltest:
- Größenbeschränkung: Der Standardwert für
maxBytesliegt bei 20MB. Dateien, die größer sind, werden übersprungen und das nächste Modell in der Liste wird versucht. - Command Parsing: Wenn die Transkription klappt, werden
CommandBodyundRawBodymit dem Text gefüllt. So funktionieren deine Slash-Commands auch per Sprachnachricht. - Timeouts: Der Standard-Timeout liegt bei 60 Sekunden. Du kannst diesen Wert pro Modell mit
timeoutSecondsanpassen. - Logging: Nutze das Flag
--verbose, um zu sehen, wann die Transkription startet und wann der Body ersetzt wird.
Fehlerbehebung
Abschnitt betitelt „Fehlerbehebung“Falls die Transkription nicht wie gewünscht funktioniert, liegt es meist an einer dieser Ursachen:
- Datei zu groß: Wenn das Audio-File das
maxBytesLimit überschreitet, wird das Modell übersprungen. Erhöhe den Wert in der Config oder komprimiere die Audiodaten. - CLI-Fehler: Deine CLI-Tools müssen den Exit-Code 0 zurückgeben und den transkribierten Text als Plain Text ausgeben. Wenn dein Tool JSON liefert, musst du es mit
jq -r .textvorverarbeiten. - Timeout: Bei langen Sprachnachrichten oder langsamen lokalen Modellen greift der Standard-Timeout von 60 Sekunden. Setze
timeoutSecondsin der Modell-Konfiguration höher. - Pfad-Probleme: Stelle sicher, dass die CLI-Binaries in deinem
PATHliegen. OpenClaw versucht zwar~zu expandieren, aber ein absoluter Pfad imcommandFeld ist oft sicherer.
Du brauchst Hilfe bei der Konfiguration deiner Provider? Frag unseren AI Setup Assistant.
Nächste Schritte
Abschnitt betitelt „Nächste Schritte“OpenClaw Expert
Noch festgefahren?
Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.