Cómo configurar notas de voz y audio en OpenClaw
Recibir notas de voz cuando estás en una reunión o en un lugar ruidoso es un problema común. No puedes escucharlas, pero necesitas saber qué dicen para responder o ejecutar un comando.
OpenClaw soluciona esto procesando el audio automáticamente. Transforma los archivos de voz en texto para que puedas leer el contenido de inmediato y permite que los comandos de tipo slash funcionen directamente desde la transcripción.
Requisitos previos
Sección titulada «Requisitos previos»- Una instancia activa de OpenClaw.
- Credenciales de un provider (OpenAI, Groq, Deepgram o Google) o herramientas CLI instaladas localmente.
Inicio rápido
Sección titulada «Inicio rápido»Si no configuras nada, OpenClaw intentará auto-detectar herramientas en tu sistema. Para un control total, te recomiendo definir un provider con un fallback local. Aquí tienes la ruta más rápida de 5 minutos:
- Abre tu archivo de configuración.
- Añade el bloque
tools.media.audio. - Define tus modelos de transcripción.
Este ejemplo usa OpenAI como opción principal y Whisper CLI como respaldo:
{ tools: { media: { audio: { enabled: true, maxBytes: 20971520, // 20MB models: [ { provider: "openai", model: "gpt-4o-mini-transcribe" }, { type: "cli", command: "whisper", args: ["--model", "base", "{{MediaPath}}"], timeoutSeconds: 45, }, ], }, }, },}Cómo funciona la detección automática
Sección titulada «Cómo funciona la detección automática»Si prefieres no configurar modelos manualmente, OpenClaw busca opciones en este orden:
- Local CLIs: Busca
sherpa-onnx-offline,whisper-clio elwhisperoriginal de Python en tuPATH. - Gemini CLI: Utiliza
geminicon la funciónread_many_files. - Provider keys: Intenta usar las llaves configuradas en el orden OpenAI, Groq, Deepgram y finalmente Google.
- Configuración manual: Si nada de lo anterior funciona, deberás especificar los modelos en
tools.media.audio.models.
Notas y límites
Sección titulada «Notas y límites»- Tamaño de archivos: El límite por defecto es de 20MB. Si un audio supera este tamaño, OpenClaw saltará al siguiente modelo en la lista.
- Variables: El texto transcrito se guarda en
{{Transcript}}, que puedes usar en tus plantillas. - Comandos: Si la transcripción tiene éxito, puedes usar comandos como
/resumirdirectamente en la nota de voz. - Timeouts: El tiempo de espera por defecto es de 60 segundos para evitar bloquear la cola de respuestas.
Solución de problemas
Sección titulada «Solución de problemas»- El audio se ignora en grupos: Revisa las reglas de
scope. Por defecto, puedes tener reglas que deniegan el procesamiento enchatType: "group". - Error de CLI: Asegúrate de que tu herramienta (como Whisper) esté en el
PATHdel sistema y que devuelva texto plano en lugar de JSON. - Audio demasiado pesado: Si recibes errores de tamaño, aumenta
maxByteso usa un modelo que soporte archivos más grandes. - Transcripción incompleta: Si el texto se corta, verifica si tienes configurado un
maxCharsrestrictivo en la configuración del modelo.
¿Necesitas ayuda específica con tu configuración? Prueba el AI Setup Assistant.
Próximos pasos
Sección titulada «Próximos pasos»OpenClaw Expert
Sigues atascado?
Si esta pagina no resolvio tu caso, pregunta a OpenClaw Expert para pasos concretos.