Zum Inhalt springen

Audio und Voice Notes mit OpenClaw verarbeiten

Du kennst das: Jemand schickt dir eine Sprachnachricht, aber du bist gerade in einem Meeting oder hast keine Kopfhörer zur Hand. Als Entwickler willst du diese Audiodaten nicht mühsam selbst abtippen, sondern sie direkt als Text verarbeiten, um darauf basierend Aktionen auszulösen oder Slash-Commands zu nutzen. Die manuelle Konvertierung von Audio in Text ist oft zeitfressend und unterbricht deinen Workflow.

Mit OpenClaw kannst du diesen Prozess automatisieren. Das System erkennt Audiodaten, transkribiert sie und stellt den Text für deine Templates und Befehle bereit.

  • Eine laufende OpenClaw-Instanz
  • API Keys für Provider (OpenAI, Groq, Deepgram oder Google)
  • Lokale CLI-Tools im PATH (optional für lokales Processing), wie whisper oder sherpa-onnx-offline
  • Ausreichend Berechtigungen für den Zugriff auf lokale Pfade oder URLs

In nur 5 Minuten ist deine Audio-Transkription einsatzbereit. OpenClaw nutzt standardmäßig eine Auto-Detection, solange du tools.media.audio.enabled nicht auf false setzt.

Am besten konfigurierst du einen Provider mit einem CLI-Fallback, falls die Cloud-API einmal nicht erreichbar ist oder du Kosten sparen willst:

{
tools: {
media: {
audio: {
enabled: true,
maxBytes: 20971520, // 20MB Limit
models: [
{ provider: "openai", model: "gpt-4o-mini-transcribe" },
{
type: "cli",
command: "whisper",
args: ["--model", "base", "{{MediaPath}}"],
timeoutSeconds: 45,
},
],
},
},
},
}

Sobald diese Konfiguration aktiv ist, lädt OpenClaw das erste Audio-Attachment herunter, prüft die Dateigröße und schickt es an den ersten verfügbaren Model-Eintrag. Wenn die Transkription erfolgreich ist, wird der Body der Nachricht durch einen [Audio] Block ersetzt und der Text steht in der Variable {{Transcript}} zur Verfügung.

OpenClaw geht bei der Erkennung sehr strukturiert vor. Wenn du keine spezifischen Modelle konfigurierst, wird diese Reihenfolge abgearbeitet:

  1. Lokale CLIs: Zuerst wird nach sherpa-onnx-offline, whisper-cli oder whisper gesucht.
  2. Gemini CLI: Nutzung von gemini via read_many_files.
  3. Provider Keys: Prüfung der API-Keys für OpenAI, Groq, Deepgram und Google.

Hier sind wichtige technische Eckdaten, die du beachten solltest:

  • Größenbeschränkung: Der Standardwert für maxBytes liegt bei 20MB. Dateien, die größer sind, werden übersprungen und das nächste Modell in der Liste wird versucht.
  • Command Parsing: Wenn die Transkription klappt, werden CommandBody und RawBody mit dem Text gefüllt. So funktionieren deine Slash-Commands auch per Sprachnachricht.
  • Timeouts: Der Standard-Timeout liegt bei 60 Sekunden. Du kannst diesen Wert pro Modell mit timeoutSeconds anpassen.
  • Logging: Nutze das Flag --verbose, um zu sehen, wann die Transkription startet und wann der Body ersetzt wird.

Falls die Transkription nicht wie gewünscht funktioniert, liegt es meist an einer dieser Ursachen:

  • Datei zu groß: Wenn das Audio-File das maxBytes Limit überschreitet, wird das Modell übersprungen. Erhöhe den Wert in der Config oder komprimiere die Audiodaten.
  • CLI-Fehler: Deine CLI-Tools müssen den Exit-Code 0 zurückgeben und den transkribierten Text als Plain Text ausgeben. Wenn dein Tool JSON liefert, musst du es mit jq -r .text vorverarbeiten.
  • Timeout: Bei langen Sprachnachrichten oder langsamen lokalen Modellen greift der Standard-Timeout von 60 Sekunden. Setze timeoutSeconds in der Modell-Konfiguration höher.
  • Pfad-Probleme: Stelle sicher, dass die CLI-Binaries in deinem PATH liegen. OpenClaw versucht zwar ~ zu expandieren, aber ein absoluter Pfad im command Feld ist oft sicherer.

Du brauchst Hilfe bei der Konfiguration deiner Provider? Frag unseren AI Setup Assistant.

OpenClaw

OpenClaw Expert

Noch festgefahren?

Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.