Ir al contenido

Configura modelos locales en OpenClaw: Guía de alto rendimie

¿Te ha pasado que quieres total privacidad o simplemente dejar de depender de APIs externas, pero te preocupa que el rendimiento caiga al suelo? Configurar modelos locales suele ser un dolor de cabeza entre dependencias rotas y hardware que no da la talla.

Ejecutar modelos en local es posible, pero OpenClaw espera un contexto grande y defensas sólidas contra el prompt injection. Las tarjetas pequeñas truncan el contexto y filtran fallos de seguridad. Apunta alto: 2 Mac Studios al máximo o un equipo con GPUs equivalentes (~$30k+). Una sola GPU de 24 GB solo sirve para prompts ligeros con latencia alta. Usa la variante de modelo más grande o completa que puedas ejecutar; los checkpoints muy cuantizados o “pequeños” aumentan el riesgo de prompt injection (revisa Security).

Si buscas la configuración con menos fricción para empezar, usa Ollama y openclaw onboard. Esta página es la guía de opinión para pilas tecnológicas locales de gama alta y servidores locales personalizados compatibles con OpenAI.

Recomendado: LM Studio + modelo local grande (Responses API)

Sección titulada «Recomendado: LM Studio + modelo local grande (Responses API)»

Es la mejor combinación local actual. Carga un modelo grande en LM Studio (por ejemplo, un build completo de Qwen, DeepSeek, Llama o Mistral), activa el servidor local (por defecto en http://127.0.0.1:1234) y usa la Responses API para mantener el razonamiento separado del texto final.

{
agents: {
defaults: {
model: { primary: “lmstudio/my-local-model” },
models: {
“anthropic/claude-opus-4-6”: { alias: “Opus” },
“lmstudio/my-local-model”: { alias: “Local” },
},
},
},
models: {
mode: “merge”,
providers: {
lmstudio: {
baseUrl: “http://127.0.0.1:1234/v1”,
apiKey: “lmstudio”,
api: “openai-responses”,
models: [
{
id: “my-local-model”,
name: “Local Model”,
reasoning: false,
input: [“text”],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 196608,
maxTokens: 8192,
},
],
},
},
},
}

Lista de verificación de configuración

  • Instala LM Studio: https://lmstudio.ai
  • En LM Studio, descarga el build de modelo más grande disponible (evita variantes “small” o muy cuantizadas), inicia el servidor y confirma que http://127.0.0.1:1234/v1/models lo muestra en la lista.
  • Reemplaza my-local-model con el ID real del modelo que aparece en LM Studio.
  • Mantén el modelo cargado; la carga en frío añade latencia al inicio.
  • Ajusta contextWindow/maxTokens si tu build de LM Studio es diferente.
  • Para WhatsApp, quédate con la Responses API para que solo se envíe el texto final.

Mantén los modelos en la nube configurados incluso si usas local; usa models.mode: "merge" para que los fallbacks sigan disponibles.

Configuración híbrida: primario en la nube, fallback local

Sección titulada «Configuración híbrida: primario en la nube, fallback local»
{
agents: {
defaults: {
model: {
primary: "anthropic/claude-sonnet-4-6",
fallbacks: ["lmstudio/my-local-model", "anthropic/claude-opus-4-6"],
},
models: {
"anthropic/claude-sonnet-4-6": { alias: "Sonnet" },
"lmstudio/my-local-model": { alias: "Local" },
"anthropic/claude-opus-4-6": { alias: "Opus" },
},
},
},
models: {
mode: "merge",
providers: {
lmstudio: {
baseUrl: "http://127.0.0.1:1234/v1",
apiKey: "lmstudio",
api: "openai-responses",
models: [
{
id: "my-local-model",
name: "Local Model",
reasoning: false,
input: ["text"],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 196608,
maxTokens: 8192,
},
],
},
},
},
}

Local primero con red de seguridad en la nube

Sección titulada «Local primero con red de seguridad en la nube»

Intercambia el orden del primario y el fallback; mantén el mismo bloque de proveedores y models.mode: "merge" para poder volver a Sonnet u Opus cuando el equipo local no esté disponible.

  • Existen variantes de MiniMax, Kimi o GLM en OpenRouter con endpoints fijados por región (por ejemplo, alojados en EE. UU.). Elige la variante regional allí para mantener el tráfico en la jurisdicción que prefieras mientras sigues usando models.mode: "merge" para fallbacks de Anthropic u OpenAI.
  • La opción solo local sigue siendo la ruta más fuerte para la privacidad; el enrutamiento regional en la nube es el punto medio cuando necesitas funciones del proveedor pero quieres controlar el flujo de datos.

Otros proxies locales compatibles con OpenAI

Sección titulada «Otros proxies locales compatibles con OpenAI»

vLLM, LiteLLM, OAI-proxy o Gateways personalizados funcionan si exponen un endpoint tipo OpenAI en /v1. Reemplaza el bloque de proveedor anterior con tu endpoint e ID de modelo:

{
models: {
mode: "merge",
providers: {
local: {
baseUrl: "http://127.0.0.1:8000/v1",
apiKey: "sk-local",
api: "openai-responses",
models: [
{
id: "my-local-model",
name: "Local Model",
reasoning: false,
input: ["text"],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 120000,
maxTokens: 8192,
},
],
},
},
},
}

Mantén models.mode: "merge" para que los modelos en la nube sigan disponibles como fallbacks.

  • ¿El Gateway llega al proxy? Prueba con curl http://127.0.0.1:1234/v1/models.
  • ¿Modelo de LM Studio descargado? Recárgalo; el inicio en frío es una causa común de bloqueos.
  • ¿Errores de contexto? Baja el contextWindow o sube el límite de tu servidor.
  • Seguridad: los modelos locales se saltan los filtros del proveedor; mantén los agentes con tareas específicas y la compactación activada para limitar el alcance de un posible prompt injection.

AI Setup Assistant

OpenClaw

OpenClaw Expert

Sigues atascado?

Si esta pagina no resolvio tu caso, pregunta a OpenClaw Expert para pasos concretos.