Saltar al contenido
Modelos

Cómo quitar las restricciones a modelos de código con Qwen 2.5 Coder Heretic

Guía paso a paso para ejecutar modelos sin censura localmente con llama.cpp y cuantizaciones GGUF optimizadas para desarrollo.

Alejandro de Blas, fundador de Aducti

Fundador de Aducti. Software e IA.

6 min de lectura
Ver vídeo original

Los modelos comerciales como Claude o GPT-4o tienen capas de seguridad excesivas que a menudo se disparan por falso positivo cuando trabajas en auditoría de código, ciberseguridad, scrapers o automatizaciones internas.

La solución no es pelear contra los filtros del prompt: es ejecutar un modelo local sin restricciones alineadas (abliterated / heretic).

El rey actual en código local sin censura es Qwen 2.5 Coder 7B Heretic. Supera a GPT-4o-mini en benchmarks de programación y corre en cualquier gráfica moderna con 6 a 8 GB de VRAM.

Aquí tienes la guía de instalación y despliegue local paso a paso con llama.cpp.

1. Descargar el modelo cuantizado (GGUF)

Para obtener el mejor equilibrio entre velocidad de inferencia (tokens/s) y precisión de código, la cuantización recomendada es Q6_K o BF16 si tienes VRAM de sobra:

bash
# Descargar Qwen 2.5 Coder 7B Heretic (Q6_K ~6.2 GB)
curl -L -o Qwen2.5-Coder-7B-Heretic-Q6_K.gguf \
  "https://huggingface.co/bartowski/Qwen2.5-Coder-7B-Instruct-GGUF/resolve/main/Qwen2.5-Coder-7B-Instruct-Q6_K.gguf"

2. Servidor local con llama.cpp

llama.cpp ofrece el menor overhead de memoria y soporte nativo de aceleración por GPU (CUDA / Metal / Vulkan).

Inicia el servidor compatible con OpenAI API en el puerto 8080:

bash
llama-server \
  -m ./Qwen2.5-Coder-7B-Heretic-Q6_K.gguf \
  -c 32768 \
  -ngl 99 \
  --port 8080 \
  --host 0.0.0.0

Parámetros clave:

  • -c 32768: Contexto extendido de 32k tokens para admitir archivos enteros de código.
  • -ngl 99: Descarga todas las capas del modelo en la VRAM de la GPU (GPU offloading).
  • --host 0.0.0.0: Permite conectar tu IDE, agentes o herramientas de la red local.

3. Conectar a tu entorno de desarrollo o Agentes

Como el servidor expone el protocolo estándar de OpenAI (/v1/chat/completions), puedes conectarlo directamente a cualquier cliente, extensión o agente de IA:

Configuración en Python:

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8080/v1",
    api_key="sk-local-no-key-required"
)

response = client.chat.completions.create(
    model="qwen2.5-coder-7b-heretic",
    messages=[
        {"role": "system", "content": "Eres un ingeniero de software senior experto en desarrollo y pentesting."},
        {"role": "user", "content": "Escribe un script en Python para extracción de datos sin bloqueos."}
    ],
    temperature=0.2
)

print(response.choices[0].message.content)

4. Comparativa de Rendimiento

| Formato / Cuantización | VRAM Requerida | Velocidad (RTX 4070) | Pérdida de Calidad | |---|---|---|---| | BF16 / FP16 | ~15.2 GB | ~45 tokens/s | 0% (Base pura) | | Q6_K (Recomendado) | ~6.3 GB | ~85 tokens/s | < 0.2% (Indistinguible) | | Q4_K_M | ~4.6 GB | ~110 tokens/s | ~1.5% |

Cuándo usar un modelo Heretic

Úsalo cuando desarrolles herramientas internas, scrapers, análisis de vulnerabilidades o cuando las APIs comerciales rechacen tus instrucciones legítimas por falsos positivos. Para arquitectura compleja a gran escala, mantén Claude o modelos frontera en la fase de diseño.

Etiquetas:#qwen#heretic#llama-cpp#gguf#modelos-locales#uncensored

Recursos relacionados

ModelosDestacado
7 min

Qué modelo de IA usar para cada tarea (y cuál dejar de usar)

Programar, generar imágenes, copywriting, aprender e investigar: cinco pares de herramientas con la elección que funciona y el motivo real de por qué la otra no.

#claude#chatgpt#gemini#notebooklm#perplexity#nano-banana#comparativa
2 sept 2026
Ver recurso