Ir al contenido

Cómo configurar notas de voz y audio en OpenClaw

Recibir notas de voz cuando estás en una reunión o en un lugar ruidoso es un problema común. No puedes escucharlas, pero necesitas saber qué dicen para responder o ejecutar un comando.

OpenClaw soluciona esto procesando el audio automáticamente. Transforma los archivos de voz en texto para que puedas leer el contenido de inmediato y permite que los comandos de tipo slash funcionen directamente desde la transcripción.

  • Una instancia activa de OpenClaw.
  • Credenciales de un provider (OpenAI, Groq, Deepgram o Google) o herramientas CLI instaladas localmente.

Si no configuras nada, OpenClaw intentará auto-detectar herramientas en tu sistema. Para un control total, te recomiendo definir un provider con un fallback local. Aquí tienes la ruta más rápida de 5 minutos:

  1. Abre tu archivo de configuración.
  2. Añade el bloque tools.media.audio.
  3. Define tus modelos de transcripción.

Este ejemplo usa OpenAI como opción principal y Whisper CLI como respaldo:

{
tools: {
media: {
audio: {
enabled: true,
maxBytes: 20971520, // 20MB
models: [
{ provider: "openai", model: "gpt-4o-mini-transcribe" },
{
type: "cli",
command: "whisper",
args: ["--model", "base", "{{MediaPath}}"],
timeoutSeconds: 45,
},
],
},
},
},
}

Si prefieres no configurar modelos manualmente, OpenClaw busca opciones en este orden:

  1. Local CLIs: Busca sherpa-onnx-offline, whisper-cli o el whisper original de Python en tu PATH.
  2. Gemini CLI: Utiliza gemini con la función read_many_files.
  3. Provider keys: Intenta usar las llaves configuradas en el orden OpenAI, Groq, Deepgram y finalmente Google.
  4. Configuración manual: Si nada de lo anterior funciona, deberás especificar los modelos en tools.media.audio.models.
  • Tamaño de archivos: El límite por defecto es de 20MB. Si un audio supera este tamaño, OpenClaw saltará al siguiente modelo en la lista.
  • Variables: El texto transcrito se guarda en {{Transcript}}, que puedes usar en tus plantillas.
  • Comandos: Si la transcripción tiene éxito, puedes usar comandos como /resumir directamente en la nota de voz.
  • Timeouts: El tiempo de espera por defecto es de 60 segundos para evitar bloquear la cola de respuestas.
  • El audio se ignora en grupos: Revisa las reglas de scope. Por defecto, puedes tener reglas que deniegan el procesamiento en chatType: "group".
  • Error de CLI: Asegúrate de que tu herramienta (como Whisper) esté en el PATH del sistema y que devuelva texto plano en lugar de JSON.
  • Audio demasiado pesado: Si recibes errores de tamaño, aumenta maxBytes o usa un modelo que soporte archivos más grandes.
  • Transcripción incompleta: Si el texto se corta, verifica si tienes configurado un maxChars restrictivo en la configuración del modelo.

¿Necesitas ayuda específica con tu configuración? Prueba el AI Setup Assistant.

OpenClaw

OpenClaw Expert

Sigues atascado?

Si esta pagina no resolvio tu caso, pregunta a OpenClaw Expert para pasos concretos.