Cómo usar Codex de manera ilimitada y económica con enrutado inteligente
Estrategia técnica para combinar modelos frontera en planificación con modelos rápidos y locales en la ejecución de código, reduciendo costes hasta un 80%.

Fundador de Aducti. Software e IA.
El error más común al programar con agentes de IA es usar el modelo más potente y caro (como Claude 3.7 Sonnet o GPT-4o) para absolutamente todas las tareas: desde planificar la arquitectura hasta cambiar un nombre de variable o ejecutar un ls.
Eso no solo destruye tu presupuesto de API en horas, sino que agota tus límites de tokens y ralentiza el ciclo de desarrollo.
La solución profesional es el enrutado de modelos por niveles de complejidad.
1. La arquitectura de 2 niveles (Planner / Worker)
En lugar de un único agente, separamos la ejecución en dos capas:
- Nivel 1 (Planificador): Un modelo de razonamiento superior (Claude 3.7 Sonnet / o3-mini) que analiza el problema, lee el repositorio, define el plan de ataque y divide la tarea en pasos pequeños y atómicos.
- Nivel 2 (Ejecutores / Workers): Modelos ultra rápidos y económicos (DeepSeek V3, Qwen 2.5 Coder 7B, Haiku 3.5) que toman cada instrucción individual, editan el archivo correspondiente y ejecutan los tests.
┌─────────────────────────────────────────┐
│ Planificador (Modelo Frontera) │
│ - Lee contexto general │
│ - Descompone el problema en pasos │
└────────────────────┬────────────────────┘
│ Emite tareas atómicas
▼
┌─────────────────────────────────────────┐
│ Workers (Modelos Rápidos/Locales) │
│ - Tarea 1: Editar componente A │
│ - Tarea 2: Crear test unitario │
│ - Tarea 3: Ejecutar linter y verificar │
└─────────────────────────────────────────┘2. Configuración del Enrutador Local
Puedes configurar un proxy de enrutado local con LiteLLM o un script de orquestación para repartir las peticiones según la ruta o el subagente:
# config.yaml - Enrutador LiteLLM
model_list:
- model_name: planner
litellm_params:
model: anthropic/claude-3-7-sonnet-20250219
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: worker
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
api_base: https://api.deepseek.com/v1
- model_name: local-coder
litellm_params:
model: openai/qwen2.5-coder-7b
api_base: http://localhost:8080/v1
api_key: "none"Inicia el proxy en segundo plano:
litellm --config ./config.yaml --port 40003. Aprovechar el Prompt Caching al 100%
El factor clave para no pagar de más en sesiones largas de Codex es el Prompt Caching.
Anthropic y OpenAI ofrecen descuentos de hasta el 90% en tokens de lectura cuando el contexto del repositorio permanece fijo:
- Estructura fija en prompts del sistema: Pon tus reglas y documentación estática al principio del prompt.
- Archivos de proyecto ordenados: Evita reordenar archivos leídos en cada turno para no romper el caché de prefijo.
- Subagentes efímeros: Cada subagente debe recibir solo los fragmentos relevantes en lugar de volcar el historial completo de la conversación previa.
Comparativa de Coste por Sprint (100 horas de código)
| Estrategia | Coste Estimado | Velocidad Media | |---|---|---| | Modelo frontera para todo | ~180 € - 250 € | Lenta (espera de tokens) | | Enrutado 2 Niveles (Planner + DeepSeek) | ~18 € - 35 € | Rápida | | Enrutado con Worker Local (Heretic) | ~8 € (solo planner) | Ultra rápida en local |
Conclusión
El futuro del desarrollo con IA no es pagar suscripciones más caras, sino construir sistemas donde los modelos caros piensen y los modelos baratos o locales ejecuten el trabajo pesado.
Recursos relacionados
Dónde se van tus tokens de Claude Code: el informe que ya tienes en tu ordenador
El comando /insights analiza tus sesiones y te genera un HTML. Y por qué acortar prompts no sirve de nada: el 97 % de tus tokens es Claude releyendo.
/grill-me: el comando que obliga a Claude a preguntar antes de escribir código
Cómo funciona la entrevista por rondas de /grill-me, los tres ficheros para instalarlo y el orden en el que conviene usarlo.