Transcribir audio

Pasa la voz a texto con IA (Whisper)

Sin base de datos: AIMRAN no guarda tus archivos, textos ni resultados

¿Qué es Transcribir audio?

Esta herramienta convierte lo que se dice en un audio o un vídeo en texto escrito: entrevistas, clases, reuniones, notas de voz o vídeos para los que necesitas subtítulos.

Usa Whisper, un modelo de inteligencia artificial de reconocimiento de voz. Puedes elegir entre un modo rápido y otro más preciso, y descargar el resultado como texto o como archivo de subtítulos con los tiempos de cada frase.

Cómo se usa

  1. Sube el audio o vídeo que quieres transcribir.
  2. Elige el modelo: Rápido o Preciso.
  3. Elige el idioma: Automático, Español o Inglés.
  4. Pulsa Transcribir y espera a que termine.
  5. Copia o descarga el texto, o descarga los subtítulos en SRT o VTT.

Ventajas

Detalles técnicos

La transcripción usa los modelos Whisper tiny (unos 45 MB) y Whisper base (unos 80 MB) de onnx-community, cuantizados a 8 bits y ejecutados con Transformers.js, con aceleración WebGPU cuando está disponible y CPU (WASM) en caso contrario. El modelo se descarga solo la primera vez. El audio se decodifica, se mezcla a mono y se remuestrea a 16 kHz, que es la entrada que espera Whisper. El idioma puede detectarse automáticamente o fijarse a español o inglés. Se obtienen el texto completo y segmentos con inicio y fin, exportables a TXT, SubRip (.srt) y WebVTT (.vtt). Audios de menos de 0,3 s no se procesan. Límite de 300 MB por archivo; los audios largos pueden tardar varios minutos.

Preguntas frecuentes

¿Cómo pasar un audio a texto gratis?

Sube el audio, elige el modelo y el idioma y pulsa Transcribir. Al terminar podrás copiar el texto o descargarlo en TXT.

¿Puedo crear subtítulos para un vídeo?

Sí. Sube el vídeo, transcríbelo y descarga el archivo SRT o VTT, que incluye los tiempos de cada frase.

¿Qué diferencia hay entre el modelo Rápido y el Preciso?

Rápido usa Whisper tiny: descarga más pequeña y resultado antes, con algo menos de precisión. Preciso usa Whisper base: tarda más, pero se equivoca menos.

¿En qué idiomas funciona?

Puedes fijar español o inglés, o dejarlo en Automático para que el modelo detecte el idioma.

¿Por qué tarda la primera vez?

Porque se descarga el modelo de IA (45 u 80 MB). Las siguientes veces ya está disponible y empieza antes.

Más herramientas de Audio