Cuando Codex puede usar modelos locales, muchos desarrolladores quieren mover tareas sencillas a Ollama para ahorrar cuota y mantener parte del trabajo en local. Pero al configurarlo aparecen fallos pequeños: Ollama funciona, el modelo está descargado, pero Codex no conecta o la salida es pobre.
La forma más segura de depurar es: primero hacer funcionar Ollama, luego probar su API y después ajustar Codex.
Para qué sirve un modelo local
Es útil para explicar fragmentos pequeños, redactar scripts, editar README, revisar configuración y procesar texto privado de bajo riesgo. No sustituye necesariamente a modelos cloud potentes en refactors grandes, razonamiento profundo de repositorio, cambios sensibles o ejecución autónoma larga.
Paso 1: comprobar Ollama
|
|
Descarga un modelo para código:
|
|
Ejecútalo:
|
|
Si esto falla, el problema aún no está en Codex.
Paso 2: probar la API de Ollama
La dirección habitual es:
|
|
|
|
En PowerShell:
|
|
Si no ves la lista de modelos, Codex tampoco podrá llamar al servicio.
Paso 3: configurar Codex
Comprueba:
base_urlapunta a Ollama.- El nombre del modelo coincide exactamente con
ollama list. - El modo de API es el correcto: nativo de Ollama u OpenAI compatible.
Los fallos suelen ser un puerto incorrecto, un tag distinto o un localhost que apunta al entorno equivocado.
Prueba mínima
Empieza con una tarea de solo lectura:
|
|
O:
|
|
connection refused
|
|
Posibles causas:
- Ollama no está iniciado.
- El puerto no es
11434. - Codex se ejecuta en WSL, contenedor o entorno remoto.
- Proxy o firewall bloquea la conexión.
Prueba desde el mismo entorno donde corre Codex:
|
|
Si Codex está en WSL y Ollama en Windows, usa la IP del host Windows.
model not found
|
|
|
|
Si el nombre es qwen2.5-coder:7b, usa exactamente ese nombre.
|
|
|
|
404 o ruta equivocada
Ollama tiene endpoints nativos y compatibles con OpenAI:
|
|
Si Codex espera OpenAI compatible, normalmente usa:
|
|
No:
|
|
context length exceeded
|
|
Reduce archivos, recorta logs y pasa solo fragmentos relevantes. Para refactors grandes, usa el modelo local como apoyo, no como responsable principal.
Mala calidad de salida
Las causas habituales son modelo pequeño, modelo no orientado a código, tarea demasiado abierta, sampling agresivo o demasiado contexto irrelevante.
Mejor:
|
|
Peor:
|
|
Respuestas lentas
Dependen del tamaño del modelo, CPU/GPU, memoria y longitud del contexto. Empieza con 7B antes de subir a 14B o 32B.
|
|
Windows y WSL
Si Ollama corre en Windows y Codex en WSL, localhost dentro de WSL puede apuntar al propio WSL.
|
|
Si falla:
|
|
Prueba la IP del nameserver:
|
|
Variables de proxy
|
|
PowerShell:
|
|
Añade:
|
|
Cuándo no conviene usar Ollama con Codex
Evita usarlo en rutas críticas de producción, cambios de arquitectura en muchos archivos, tareas largas autónomas, proyectos con pocas pruebas o tareas que el modelo ya ha malinterpretado.
Plantilla de tarea
|
|
Para modificar:
|
|
FAQ
¿Puede funcionar totalmente offline?
Sí, si Codex, el modelo y las herramientas se ejecutan localmente y no se llama a proveedores cloud. Verifícalo con firewall o monitorización de red si importa.
¿Qué modelo conviene probar primero?
Para código, qwen2.5-coder:7b o qwen2.5-coder:14b.
¿Por qué un modelo cloud resuelve algo que el local no?
Porque el tamaño, datos, contexto y adaptación a herramientas son distintos. Reduce el alcance.
¿Puedo pasarle todo el repositorio?
No al principio. Empieza por archivo, función o error.
¿Ollama debe estar siempre abierto?
Sí. Si el servicio se cierra, Codex verá errores de conexión.
Error: Codex no está usando Ollama
Si Codex sigue pidiendo login o API key, probablemente no está en modo local provider.
|
|
Busca opciones relacionadas con local provider, OSS mode u Ollama. Revisa también la configuración global, la del proyecto y las variables de entorno.
Error: unknown option
El tutorial puede estar escrito para otra versión de Codex.
|
|
Usa la ayuda de tu instalación como referencia. Actualiza Codex si hace falta.
Error: 401, API key o autenticación
Ollama local normalmente no requiere una clave de OpenAI. Si ves errores de API key, Codex puede seguir usando un provider en la nube.
|
|
Para una ejecución local pura, limpia variables y configuración que apunten a otro provider.
Error: la solicitud se queda colgada
Los modelos locales pueden ser lentos, sobre todo en CPU, con modelos grandes o prompts largos.
Empieza con un modelo pequeño y una tarea mínima. Si una pregunta corta ya tarda en ollama run, también tardará dentro de Codex.
Error: llamadas a herramientas inestables
Muchos modelos locales escriben código, pero no siempre siguen bien un flujo agentic con herramientas. Pueden inventar comandos, ignorar salidas o romper JSON.
Úsalos para cambios pequeños, explicación, refactor sencillo y documentación. Para revisiones complejas, seguridad o depuración larga, conviene un modelo más fuerte.
Flujo estable recomendado
|
|
Prueba con una tarea pequeña:
|
|
Luego amplía a ediciones, pruebas y tareas más largas.
Plantilla para pedir ayuda
|
|
Resumen
Revisa en orden: proceso de Ollama, API HTTP, base URL de Codex, modo de interfaz, nombre de modelo, contexto y alcance de la tarea. Los modelos locales funcionan mejor con tareas pequeñas, claras y de bajo riesgo.