Saltar al contenido
Modelos

Dictado por voz en local con Whisper: escribir en cualquier app de Windows sin tocar el teclado

Cómo montar Whisper My Name, un dictado por voz que corre en tu propia GPU con Whisper large-v3 y pega el texto en la ventana que tengas delante.

Alejandro de Blas, fundador de Aducti

Fundador de Aducti. Software e IA.

6 min de lectura
Ver vídeo original

Escribo bastante más rápido hablando que tecleando, y lo mismo te pasa a ti aunque no lo hayas medido. El problema nunca ha sido la velocidad de dictar, sino que las herramientas de dictado buenas mandan tu voz a un servidor ajeno y te cobran por minuto.

Whisper My Name es la alternativa aburrida y directa: el modelo corre en tu tarjeta gráfica, el audio no sale del ordenador y el texto aparece en la aplicación que tengas abierta en ese momento. VS Code, Chrome, Word, Discord, el buscador de Windows. Le da igual.

Es gratis y de código abierto, con licencia MIT.

Qué hace exactamente

Se queda en la bandeja del sistema esperando un atajo global: Ctrl + Alt + Espacio. Lo pulsas, sale un pequeño HUD con el visualizador de audio, hablas, y cuando paras el texto se escribe solo donde estaba el cursor.

Por debajo usa faster-whisper, que es la implementación de Whisper sobre CTranslate2, cargando large-v3 en CUDA con precisión float16. En una 4070 Ti o una 3080, una frase normal se transcribe en menos de 60 ms. La latencia que notas es la de soltar la tecla, no la del modelo.

Requisitos

  • Windows 10 u 11 de 64 bits
  • GPU NVIDIA con CUDA
  • Python 3.10 o superior (o uv, si ya lo usas)

No hay versión para CPU que merezca la pena. large-v3 en CPU tarda segundos por frase y el dictado deja de tener sentido en cuanto tienes que esperar.

Instalación

bash
git clone https://github.com/AlejandroDeBlas/whisper-my-name.git
cd whisper-my-name

Y ejecutas run.bat. Eso crea el entorno virtual en .venv, instala las dependencias, prepara la carpeta local de modelos y te deja un acceso directo en el escritorio. La primera vez tarda, porque se descarga large-v3 entero.

Los modelos se guardan en models/ dentro del propio proyecto, no en la caché global de Hugging Face. Es una decisión deliberada: puedes mover la carpeta a otro equipo y sigue funcionando sin volver a descargar nada.

Las cuatro cosas que lo hacen usable a diario

Un dictado que funciona en la demo y molesta en el día a día no sirve. Estas son las partes que marcan la diferencia:

Gestión de VRAM. El modelo se carga cuando empiezas a grabar y se descarga solo tras 3 minutos sin usarlo. Mientras no dictas, el consumo de VRAM es 0 MB. Si programas y juegas en la misma máquina, esto es lo que evita que tengas que cerrar la app.

Corte por silencio con VAD. Detecta cuándo has terminado de hablar y transcribe tras 3,5 segundos de silencio. Usa Silero VAD, así que no se inventa frases con el ruido de fondo ni con tu respiración, que es el fallo clásico de Whisper cuando le pasas silencio.

Puntuación hablada. Puedes decir "coma", "punto", "nueva línea" o "interrogación" y las convierte en signos reales, además de arreglarte las mayúsculas después de cada punto. Sin esto acabas corrigiendo a mano cada párrafo.

Pipeline en lotes. Para audios largos parte el habla con VAD y procesa los trozos en paralelo con BatchedInferencePipeline, aprovechando los Tensor Cores. Una nota de voz de varios minutos no tarda varios minutos en transcribirse.

Idioma

Detecta el idioma del sistema y trae traducciones de la interfaz en español, inglés, francés, italiano y alemán. Si dictas en español, large-v3 lo hace bien, incluidos los nombres propios técnicos, que es donde suelen romperse los modelos pequeños.

Dónde falla

Merece la pena decirlo: si tu GPU no tiene VRAM suficiente para large-v3, tendrás que bajar a un modelo menor y la calidad de la transcripción cae de forma notable en español. Y al ser un atajo global, si otra aplicación ya tiene reservado Ctrl + Alt + Espacio, tendrás que cambiar uno de los dos.

Por qué en local y no una API

Una API de transcripción te cobra por minuto de audio y ve todo lo que dictas. Si usas dictado en serio, dictas correos, contraseñas dichas en voz alta sin darte cuenta, notas de clientes y código. Ese material no tiene por qué salir de tu equipo cuando la misma calidad de modelo cabe en una gráfica de consumo.

El repositorio está aquí: github.com/AlejandroDeBlas/whisper-my-name

Etiquetas:#whisper#faster-whisper#dictado#stt#local#windows#cuda

Recursos relacionados

ModelosDestacado
7 min

Qué modelo de IA usar para cada tarea (y cuál dejar de usar)

Programar, generar imágenes, copywriting, aprender e investigar: cinco pares de herramientas con la elección que funciona y el motivo real de por qué la otra no.

#claude#chatgpt#gemini#notebooklm#perplexity#nano-banana#comparativa
2 sept 2026
Ver recurso