Saltar al contenido
Modelos

¿Puede un modelo local sustituir a Claude Code? Lo probé en una 4070 Ti Super

Prueba real de un modelo de código local de 35B en una gráfica de 900 euros contra Claude Code: velocidad, ventana de contexto, herramientas y dónde se rompe.

Alejandro de Blas, fundador de Aducti

Fundador de Aducti. Software e IA.

7 min de lectura
Ver vídeo original

Una tarjeta gráfica de unos 900 euros con 16 GB de VRAM. La pregunta es simple: ¿puede ejecutar un modelo de IA local que sustituya a Claude Code?

La respuesta corta es que ejecuta un modelo muy bueno, y que aun así no lo sustituye. La respuesta larga es más útil, porque explica por qué y eso te dice si a ti te vale o no.

El montaje

  • Hardware: RTX 4070 Ti Super, 16 GB de VRAM
  • Modelo: Ornith 1.5, 35B de parámetros, específico de programación
  • Motor: llama.cpp
  • Agente: el harness de código abierto de DeepSeek, para convertir el modelo en un agente con herramientas

Esa última pieza es la que la gente se salta. Un modelo suelto en una terminal no es Claude Code. Claude Code es un modelo más un bucle de agente que lee archivos, ejecuta comandos y decide qué hacer después. Sin harness no estás comparando lo mismo.

Velocidad: gana el local, y no por poco

Ornith decodifica a unos 78 tokens por segundo en esa gráfica. Eso es más rápido que Claude Opus 5 en la aplicación.

Es un resultado que sorprende a casi todo el mundo. Un modelo que corre en tu mesa escupe texto más rápido que un modelo frontier servido desde un centro de datos, porque tú eres el único usuario de tu GPU y ellos reparten la suya entre miles.

Si tu cuello de botella es esperar a que salgan los tokens, el local gana.

Calidad: gana Claude, y por mucho

Les pasé la misma tarea a los dos: revisar un repositorio y encontrar una serie de hallazgos.

Claude respondió enseguida y encontró todo lo que le pedí. El modelo local estuvo 22 minutos pensando, compactó su contexto cuatro veces y no había dicho nada todavía.

Esto es lo importante de la prueba. Ser rápido por token no es ser rápido en resolver. Si el modelo necesita diez veces más tokens de razonamiento para llegar al mismo sitio, y por el camino se queda sin contexto y tiene que resumirse a sí mismo, la velocidad de decodificación no te salva.

Contexto y herramientas: no hay comparación

Ventana de contexto. El local se queda en unos 65.000 tokens. Claude Code llega hasta un millón.

Búsqueda en internet. El local no la tiene. Claude sí.

Herramientas e integraciones. Muy limitadas en el local; en Claude son parte del producto.

Los 65.000 tokens no son un límite del modelo, son un límite de mi ordenador: el KV cache también vive en la VRAM, y con 16 GB no da para más. Ahí es donde se nota que la gráfica es de consumo.

Y es un límite que duele en el trabajo real. Un repositorio de tamaño medio no cabe. Por eso compactaba cuatro veces: cada vez que se llena, tiene que resumir lo que llevaba y pierde detalle.

Entonces, ¿sirve o no?

¿Puede una 4070 Ti Super ejecutar un modelo local bastante inteligente? Sí, perfectamente. Esa parte ya está resuelta y hace dos años no lo estaba.

¿Puede sustituir a Claude Code? De momento no. Es más rápido, pero la ventana de contexto, las herramientas y las integraciones le pasan factura en cuanto la tarea deja de ser pequeña.

Lo que sí hace, y es donde yo lo uso, es complementarlo. Para tareas pequeñas o muy acotadas (renombrar, generar un test, explicarte una función, escribir un script corto) va sobrado y no te gastas un céntimo. Guardas la suscripción para lo que de verdad la necesita.

Si te vas a montar uno

Dos avisos que me habría gustado leer antes:

La VRAM manda sobre todo lo demás. Antes de mirar qué modelo es más listo, mira cuánto contexto te cabe con él cargado, porque eso es lo que va a decidir si te sirve.

Y monta el harness desde el principio. Probar el modelo en un chat te va a dar una impresión buenísima y completamente engañosa de lo que hace cuando le pides que trabaje solo sobre un repositorio.

Etiquetas:#modelos-locales#llama-cpp#claude-code#gpu#vram#agentes

Recursos relacionados

ModelosDestacado
7 min

Qué modelo de IA usar para cada tarea (y cuál dejar de usar)

Programar, generar imágenes, copywriting, aprender e investigar: cinco pares de herramientas con la elección que funciona y el motivo real de por qué la otra no.

#claude#chatgpt#gemini#notebooklm#perplexity#nano-banana#comparativa
2 sept 2026
Ver recurso