Transcribir audio
Pasa la voz a texto con IA (Whisper)
Sin base de datos: AIMRAN no guarda tus archivos, textos ni resultados
¿Qué es Transcribir audio?
Esta herramienta convierte lo que se dice en un audio o un vídeo en texto escrito: entrevistas, clases, reuniones, notas de voz o vídeos para los que necesitas subtítulos.
Usa Whisper, un modelo de inteligencia artificial de reconocimiento de voz. Puedes elegir entre un modo rápido y otro más preciso, y descargar el resultado como texto o como archivo de subtítulos con los tiempos de cada frase.
Cómo se usa
- Sube el audio o vídeo que quieres transcribir.
- Elige el modelo: Rápido o Preciso.
- Elige el idioma: Automático, Español o Inglés.
- Pulsa Transcribir y espera a que termine.
- Copia o descarga el texto, o descarga los subtítulos en SRT o VTT.
Ventajas
- Reconocimiento de voz con Whisper, en dos tamaños según prefieras rapidez o precisión.
- Subtítulos SRT y VTT con marcas de tiempo listos para vídeo.
- Acepta audio y vídeo en los formatos habituales.
- Gratis, sin registro y sin límite de usos.
Detalles técnicos
La transcripción usa los modelos Whisper tiny (unos 45 MB) y Whisper base (unos 80 MB) de onnx-community, cuantizados a 8 bits y ejecutados con Transformers.js, con aceleración WebGPU cuando está disponible y CPU (WASM) en caso contrario. El modelo se descarga solo la primera vez. El audio se decodifica, se mezcla a mono y se remuestrea a 16 kHz, que es la entrada que espera Whisper. El idioma puede detectarse automáticamente o fijarse a español o inglés. Se obtienen el texto completo y segmentos con inicio y fin, exportables a TXT, SubRip (.srt) y WebVTT (.vtt). Audios de menos de 0,3 s no se procesan. Límite de 300 MB por archivo; los audios largos pueden tardar varios minutos.
Preguntas frecuentes
¿Cómo pasar un audio a texto gratis?
Sube el audio, elige el modelo y el idioma y pulsa Transcribir. Al terminar podrás copiar el texto o descargarlo en TXT.
¿Puedo crear subtítulos para un vídeo?
Sí. Sube el vídeo, transcríbelo y descarga el archivo SRT o VTT, que incluye los tiempos de cada frase.
¿Qué diferencia hay entre el modelo Rápido y el Preciso?
Rápido usa Whisper tiny: descarga más pequeña y resultado antes, con algo menos de precisión. Preciso usa Whisper base: tarda más, pero se equivoca menos.
¿En qué idiomas funciona?
Puedes fijar español o inglés, o dejarlo en Automático para que el modelo detecte el idioma.
¿Por qué tarda la primera vez?
Porque se descarga el modelo de IA (45 u 80 MB). Las siguientes veces ya está disponible y empieza antes.
Más herramientas de Audio
- Convertir audio · MP3, WAV, OGG, M4A y FLAC
- Comprimir audio · Reduce el peso ajustando el bitrate
- Recortar audio · Con forma de onda visual
- Unir audios · Junta varias pistas en una
- Volumen y normalizar · Sube, baja o normaliza el nivel
- Grabadora de voz · Graba desde el micrófono y descarga