Talk Mode: Sprachinteraktion in Echtzeit
Manchmal reicht Tippen einfach nicht aus, um komplexe Logik zu durchdenken. Wenn du mitten im Coding-Flow bist, unterbricht der Wechsel zur Tastatur oft den Gedankengang. Ein direktes Gespräch mit deiner KI hilft dabei, Ideen schneller zu validieren, ohne die Hände vom Code zu nehmen.
Anstatt mühsam Sätze zu formulieren, kannst du deine Gedanken einfach laut aussprechen. Das System kümmert sich um die Erkennung und antwortet direkt über eine Sprachausgabe, sodass ein flüssiger Dialog entsteht.
Voraussetzungen
Abschnitt betitelt „Voraussetzungen“Bevor du startest, stelle sicher, dass folgende Voraussetzungen erfüllt sind:
- Mikrofon-Berechtigungen sind auf deinem Gerät aktiv.
- Speech-Berechtigungen wurden erteilt.
- Ein gültiger ElevenLabs API Key liegt vor.
- Du nutzt macOS, iOS oder Android.
Schnellstart
Abschnitt betitelt „Schnellstart“Der Talk Mode ist eine kontinuierliche Schleife: Er hört zu, sendet das Transkript an das Modell (chat.send), wartet auf die Antwort und gibt diese via ElevenLabs aus.
- Konfiguration anpassen: Öffne deine Konfigurationsdatei unter
~/.openclaw/openclaw.jsonund füge dentalkBlock hinzu:{talk: {voiceId: "elevenlabs_voice_id",modelId: "eleven_v3",outputFormat: "mp3_44100_128",apiKey: "elevenlabs_api_key",interruptOnSpeech: true,},} - Talk Mode starten: Aktiviere in der macOS Menu bar den Punkt Talk. Ein Overlay erscheint und zeigt dir den aktuellen Status (Listening, Thinking oder Speaking) an.
- Interaktion: Sprich einfach los. Nach einer kurzen Pause wird dein Text automatisch gesendet. Wenn du das Modell unterbrechen möchtest, fang einfach an zu reden – die Wiedergabe stoppt sofort.
- Steuerung: Klicke auf die Cloud im Overlay, um die aktuelle Sprachausgabe zu stoppen. Mit einem Klick auf das X verlässt du den Talk Mode komplett.
Fortgeschrittene Sprachsteuerung
Abschnitt betitelt „Fortgeschrittene Sprachsteuerung“Du kannst die Stimme für einzelne Antworten gezielt steuern. Füge dazu eine JSON-Zeile am Anfang deiner Antwort ein:
{ "voice": "<voice-id>", "once": true }Das System nutzt diese Parameter für die aktuelle Antwort und entfernt die Zeile, bevor die TTS-Wiedergabe startet. Ohne den Parameter once: true wird die gewählte Stimme als neuer Standard für den Talk Mode übernommen.
Fehlerbehebung
Abschnitt betitelt „Fehlerbehebung“Hier sind Lösungen für bekannte Probleme aus der Dokumentation:
- Falsche Stability-Werte: Wenn du das Modell
eleven_v3nutzt, akzeptiert das System nur die Werte0.0,0.5oder1.0. Andere Modelle erlauben eine Range von0..1. - Latenz-Probleme: Überprüfe den
latency_tier. Dieser muss innerhalb des Bereichs0..4liegen, falls er manuell gesetzt wurde. - Android Audio-Probleme: Für Low-Latency Streaming via AudioTrack unterstützt Android die Formate
pcm_16000,pcm_22050,pcm_24000undpcm_44100. - Streaming-Format erzwingen: Falls du MP3-Streaming benötigst, setze das
outputFormatexplizit auf einenmp3_*Wert.
Nächste Schritte
Abschnitt betitelt „Nächste Schritte“OpenClaw Expert
Noch festgefahren?
Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.