Transcribir audio
Graba directamente con tu micrófono o suelta los archivos que ya tengas — varios a la vez si quieres — y recupera el texto con marcas de tiempo exportables como subtítulos. El reconocimiento de voz se ejecuta en tu dispositivo y no se sube nada: algo decisivo en entrevistas, clases y cualquier material confidencial.
Añadir archivos de audio
o arrástralos aquí
Añade uno o varios archivos de audio, o graba directamente con tu micrófono.
Prueba después
Your files are processed locally in your browser. They are not uploaded to our servers.
Cómo se usa
- Añade tus archivos de audio — MP3, WAV, M4A, OGG, FLAC y la mayoría de formatos funcionan — o pulsa «Grabar ahora» para capturar con el micrófono.
- Elige un modelo: rápido para un borrador, preciso para el mejor resultado. Indica el idioma hablado si lo conoces, o deja que se detecte.
- Inicia la transcripción. Cada archivo obtiene su propia transcripción para copiar o descargar como TXT, SRT o VTT — o todo junto en un ZIP.
¿Qué es esta herramienta?
Transcribir audio ejecuta Whisper, el modelo de reconocimiento de voz de OpenAI, directamente en tu navegador mediante WebAssembly y WebGPU. El modelo se descarga una vez desde un CDN público y luego queda en caché; tu grabación no se envía a ninguna parte. Ese es justamente el punto: la transcripción es la tarea en la que el archivo suele ser delicado — entrevistas de trabajo, sesiones de terapia, notas médicas, grabaciones legales, periodismo sin publicar — y toda alternativa habitual te pide subirlo antes a un servidor. Como todo ocurre en local, tampoco hay cuota de minutos, ni marca de agua, ni cuenta. Whisper es multilingüe, transcribe decenas de idiomas y puede traducir al inglés en la misma pasada. Los archivos se procesan uno tras otro cargando el modelo una sola vez, así que un lote cuesta poco más que una grabación suelta.
Usos habituales
- Convertir una entrevista o reunión en texto que se pueda buscar
- Generar subtítulos SRT o VTT a partir de la pista de sonido de un vídeo
- Pasar a texto una clase o un episodio de pódcast sin teclearlo
- Obtener una transcripción en inglés de una grabación en otro idioma
Preguntas frecuentes
¿Se sube mi grabación a algún sitio?
No. El modelo de voz se ejecuta dentro de tu navegador, así que el audio nunca sale de tu dispositivo. Lo único que se descarga es el modelo (entre 40 y 250 MB según cuál elijas), que tu navegador guarda en caché para las siguientes veces.
¿Cuánto tarda?
Depende del navegador. Chrome y Edge en escritorio usan WebGPU y tardan una fracción de la duración de la grabación. Safari y los navegadores antiguos recurren a un modo más lento, donde la transcripción tarda más o menos lo mismo que la grabación. El modelo pequeño es bastante más rápido si solo necesitas un borrador.
¿Indica quién habla en cada momento?
No. La transcripción es un texto continuo, sin separación por hablante. Distinguir voces requiere un segundo modelo distinto y no forma parte de esta herramienta — conviene saberlo antes de usarla en una entrevista con varias personas.
¿Puedo transcribir un vídeo?
Directamente no: esta herramienta acepta archivos de audio. Extrae antes la pista con el Conversor de vídeo a MP3 y transcribe eso. Las marcas de tiempo siguen coincidiendo con el vídeo original, así que los subtítulos encajan.