Zum Inhalt springen

Talk Mode: Sprachinteraktion in Echtzeit

Manchmal reicht Tippen einfach nicht aus, um komplexe Logik zu durchdenken. Wenn du mitten im Coding-Flow bist, unterbricht der Wechsel zur Tastatur oft den Gedankengang. Ein direktes Gespräch mit deiner KI hilft dabei, Ideen schneller zu validieren, ohne die Hände vom Code zu nehmen.

Anstatt mühsam Sätze zu formulieren, kannst du deine Gedanken einfach laut aussprechen. Das System kümmert sich um die Erkennung und antwortet direkt über eine Sprachausgabe, sodass ein flüssiger Dialog entsteht.

Bevor du startest, stelle sicher, dass folgende Voraussetzungen erfüllt sind:

  1. Mikrofon-Berechtigungen sind auf deinem Gerät aktiv.
  2. Speech-Berechtigungen wurden erteilt.
  3. Ein gültiger ElevenLabs API Key liegt vor.
  4. Du nutzt macOS, iOS oder Android.

Der Talk Mode ist eine kontinuierliche Schleife: Er hört zu, sendet das Transkript an das Modell (chat.send), wartet auf die Antwort und gibt diese via ElevenLabs aus.

  1. Konfiguration anpassen: Öffne deine Konfigurationsdatei unter ~/.openclaw/openclaw.json und füge den talk Block hinzu:
    {
    talk: {
    voiceId: "elevenlabs_voice_id",
    modelId: "eleven_v3",
    outputFormat: "mp3_44100_128",
    apiKey: "elevenlabs_api_key",
    interruptOnSpeech: true,
    },
    }
  2. Talk Mode starten: Aktiviere in der macOS Menu bar den Punkt Talk. Ein Overlay erscheint und zeigt dir den aktuellen Status (Listening, Thinking oder Speaking) an.
  3. Interaktion: Sprich einfach los. Nach einer kurzen Pause wird dein Text automatisch gesendet. Wenn du das Modell unterbrechen möchtest, fang einfach an zu reden – die Wiedergabe stoppt sofort.
  4. Steuerung: Klicke auf die Cloud im Overlay, um die aktuelle Sprachausgabe zu stoppen. Mit einem Klick auf das X verlässt du den Talk Mode komplett.

Du kannst die Stimme für einzelne Antworten gezielt steuern. Füge dazu eine JSON-Zeile am Anfang deiner Antwort ein:

{ "voice": "<voice-id>", "once": true }

Das System nutzt diese Parameter für die aktuelle Antwort und entfernt die Zeile, bevor die TTS-Wiedergabe startet. Ohne den Parameter once: true wird die gewählte Stimme als neuer Standard für den Talk Mode übernommen.

Hier sind Lösungen für bekannte Probleme aus der Dokumentation:

  • Falsche Stability-Werte: Wenn du das Modell eleven_v3 nutzt, akzeptiert das System nur die Werte 0.0, 0.5 oder 1.0. Andere Modelle erlauben eine Range von 0..1.
  • Latenz-Probleme: Überprüfe den latency_tier. Dieser muss innerhalb des Bereichs 0..4 liegen, falls er manuell gesetzt wurde.
  • Android Audio-Probleme: Für Low-Latency Streaming via AudioTrack unterstützt Android die Formate pcm_16000, pcm_22050, pcm_24000 und pcm_44100.
  • Streaming-Format erzwingen: Falls du MP3-Streaming benötigst, setze das outputFormat explizit auf einen mp3_* Wert.

AI Setup Assistant

OpenClaw

OpenClaw Expert

Noch festgefahren?

Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.