Saltar al contenido
Claude Code

Cómo usar Codex de manera ilimitada y económica con enrutado inteligente

Estrategia técnica para combinar modelos frontera en planificación con modelos rápidos y locales en la ejecución de código, reduciendo costes hasta un 80%.

Alejandro de Blas, fundador de Aducti

Fundador de Aducti. Software e IA.

7 min de lectura
Ver vídeo original

El error más común al programar con agentes de IA es usar el modelo más potente y caro (como Claude 3.7 Sonnet o GPT-4o) para absolutamente todas las tareas: desde planificar la arquitectura hasta cambiar un nombre de variable o ejecutar un ls.

Eso no solo destruye tu presupuesto de API en horas, sino que agota tus límites de tokens y ralentiza el ciclo de desarrollo.

La solución profesional es el enrutado de modelos por niveles de complejidad.

1. La arquitectura de 2 niveles (Planner / Worker)

En lugar de un único agente, separamos la ejecución en dos capas:

  • Nivel 1 (Planificador): Un modelo de razonamiento superior (Claude 3.7 Sonnet / o3-mini) que analiza el problema, lee el repositorio, define el plan de ataque y divide la tarea en pasos pequeños y atómicos.
  • Nivel 2 (Ejecutores / Workers): Modelos ultra rápidos y económicos (DeepSeek V3, Qwen 2.5 Coder 7B, Haiku 3.5) que toman cada instrucción individual, editan el archivo correspondiente y ejecutan los tests.
texto
┌─────────────────────────────────────────┐
│     Planificador (Modelo Frontera)      │
│  - Lee contexto general                 │
│  - Descompone el problema en pasos      │
└────────────────────┬────────────────────┘
                     │ Emite tareas atómicas
                     ▼
┌─────────────────────────────────────────┐
│       Workers (Modelos Rápidos/Locales) │
│  - Tarea 1: Editar componente A         │
│  - Tarea 2: Crear test unitario         │
│  - Tarea 3: Ejecutar linter y verificar │
└─────────────────────────────────────────┘

2. Configuración del Enrutador Local

Puedes configurar un proxy de enrutado local con LiteLLM o un script de orquestación para repartir las peticiones según la ruta o el subagente:

yaml
# config.yaml - Enrutador LiteLLM
model_list:
  - model_name: planner
    litellm_params:
      model: anthropic/claude-3-7-sonnet-20250219
      api_key: os.environ/ANTHROPIC_API_KEY

  - model_name: worker
    litellm_params:
      model: deepseek/deepseek-chat
      api_key: os.environ/DEEPSEEK_API_KEY
      api_base: https://api.deepseek.com/v1

  - model_name: local-coder
    litellm_params:
      model: openai/qwen2.5-coder-7b
      api_base: http://localhost:8080/v1
      api_key: "none"

Inicia el proxy en segundo plano:

bash
litellm --config ./config.yaml --port 4000

3. Aprovechar el Prompt Caching al 100%

El factor clave para no pagar de más en sesiones largas de Codex es el Prompt Caching.

Anthropic y OpenAI ofrecen descuentos de hasta el 90% en tokens de lectura cuando el contexto del repositorio permanece fijo:

  1. Estructura fija en prompts del sistema: Pon tus reglas y documentación estática al principio del prompt.
  2. Archivos de proyecto ordenados: Evita reordenar archivos leídos en cada turno para no romper el caché de prefijo.
  3. Subagentes efímeros: Cada subagente debe recibir solo los fragmentos relevantes en lugar de volcar el historial completo de la conversación previa.

Comparativa de Coste por Sprint (100 horas de código)

| Estrategia | Coste Estimado | Velocidad Media | |---|---|---| | Modelo frontera para todo | ~180 € - 250 € | Lenta (espera de tokens) | | Enrutado 2 Niveles (Planner + DeepSeek) | ~18 € - 35 € | Rápida | | Enrutado con Worker Local (Heretic) | ~8 € (solo planner) | Ultra rápida en local |

Conclusión

El futuro del desarrollo con IA no es pagar suscripciones más caras, sino construir sistemas donde los modelos caros piensen y los modelos baratos o locales ejecuten el trabajo pesado.

Etiquetas:#codex#enrutado-modelos#claude-code#prompt-caching#costes-ia

Recursos relacionados