1.Graba o sube
Graba una nota de voz o elige un archivo de audio o vídeo compatible desde tu dispositivo.

Sube un archivo de audio o vídeo, o graba una nota de voz, y obtén una transcripción editable. Prueba grabaciones de hasta 5 minutos sin una cuenta.
Admite MP3, WAV, M4A, MP4 y más
MP3, WAV, M4A, FLAC, OGG, AAC, MP4, MOV, AVI, MKV, WebM
Hasta 5 minutos sin cuenta; las cuentas gratuitas reciben 15 minutos al día. Los archivos se cargan de forma segura en el servicio remoto de transcripción para su procesamiento. Detalles de privacidad
Actualizar a Pro →Graba una nota de voz o elige un archivo de audio o vídeo compatible desde tu dispositivo.

Después de grabar o subir el archivo, envíalo al servicio de transcripción y sigue el progreso.

Revisa y edita la transcripción; después, cópiala o expórtala en el formato que necesites.

La tecnología de voz a texto convierte el habla grabada en lenguaje escrito. Esta herramienta utiliza un flujo de trabajo basado en archivos: graba o acepta un archivo completo de audio o video, envía ese archivo al servicio de transcripción y devuelve un texto que puedes revisar y editar.
Comienza con una grabación que contenga habla audible. Puedes grabar una nota de voz en el espacio de trabajo o subir un archivo existente desde un teléfono, computadora, aplicación de mensajería, plataforma de reuniones o cámara.
Después de elegir Transcribir, el servicio analiza la señal de audio y predice las palabras que mejor coinciden con los sonidos hablados y el contexto. También puede devolver un idioma detectado e información de tiempo cuando esos detalles están disponibles.
La transcripción devuelta se abre en un espacio de trabajo editable. Corrige palabras inciertas, añade formato, copia el texto, expórtalo o usa la transcripción como fuente para las herramientas de asistente, resumen y traducción.
El control de carga acepta contenedores comunes de audio y video, incluyendo MP3, WAV, M4A, FLAC, OGG, AIFF, WMA, OPUS, AAC, MP4, MOV, AVI, MKV y WebM. Elegir un flujo de trabajo específico para el formato puede ayudarte a preparar el archivo fuente correcto y exportar.
MP3 es útil para entrevistas, conferencias y grabaciones compartidas porque es ampliamente compatible y generalmente más pequeño que un archivo sin comprimir. La transcripción aún necesita revisión cuando la compresión, el ruido o el volumen bajo oscurecen el habla.
Para detalles de preparación y revisión adaptados a este formato, usa la guía de conversión de MP3 a texto antes de enviar una grabación importante.
M4A, AAC, OGG y OPUS son comunes en teléfonos y aplicaciones de mensajería. Puedes subir la grabación guardada directamente cuando su extensión de archivo sea aceptada; no es necesario convertir cada nota de voz a MP3 primero.
Las grabaciones guardadas por dispositivos Apple pueden seguir el flujo de trabajo de M4A a texto para verificaciones específicas del formato.
Los archivos WAV y AIFF a menudo preservan más de la señal original, aunque un archivo más grande por sí solo no garantiza una mejor transcripción. La colocación del micrófono, el recorte, la superposición y el ruido de fondo siguen siendo importantes.
Para grabaciones sin pérdida o estilo estudio, revisa la guía de WAV a texto y su lista de verificación de calidad.
Se pueden enviar archivos MP4, MOV, AVI, MKV y WebM cuando la pista hablada es la información que necesitas. El servicio transcribe el habla audible del medio en lugar de describir lo que aparece visualmente en cada cuadro.
Para entrevistas, presentaciones y grabaciones de cámara, el flujo de trabajo de MP4 a texto explica cómo preparar el audio de video para revisión.
Una transcripción editable es útil para leer, mientras que los subtítulos también necesitan datos de tiempo y una estructura de archivo de subtítulos. Las cuentas Pro pueden exportar SRT y VTT después de que la transcripción haya sido revisada.
Si los subtítulos son el entregable final, sigue la guía de audio a subtítulos SRT para revisar el tiempo y los saltos de línea.
Una extensión familiar no prueba que un archivo contenga audio reproducible. Confirma que la grabación se abra, contenga habla y no esté vacía antes de subirla. Si un dispositivo produjo un formato inusual, exporta una copia compatible sin recomprimirla repetidamente.
El servicio de transcripción puede detectar y transcribir múltiples idiomas hablados, pero el resultado aún depende del idioma, acento, calidad del audio y claridad de la grabación. La interfaz del sitio web está localizada en 13 idiomas, y el espacio de trabajo de traducción activo ofrece actualmente 13 opciones de idioma destino.
No tienes que hacer una suposición universal de precisión basada en una etiqueta de idioma. Envía la grabación, verifica el idioma detectado que se muestra con el resultado cuando esté disponible, y revisa si los nombres, frases en idiomas mixtos y expresiones locales fueron interpretados correctamente.
Para un ejemplo bilingüe enfocado, consulta la guía de transcripción de audio en español y sus criterios de revisión.
La interfaz está disponible en inglés, alemán, español, francés, italiano, portugués, ruso, chino, árabe, japonés, polaco, neerlandés y vietnamita. El idioma de la interfaz cambia etiquetas y guías; no obliga a que la grabación subida use el mismo idioma.
Después de que existe una transcripción, la herramienta de traducción ofrece inglés, alemán, español, francés, italiano, portugués, ruso, chino, árabe, japonés, polaco, neerlandés y vietnamita. El menú de destino es una función separada de la detección automática del idioma de la grabación.
Una vez que la transcripción está lista, el espacio de trabajo puede usar ese texto como contexto para tres tareas separadas. Estas herramientas no reemplazan la transcripción; te ayudan a cuestionarla, condensarla o crear una versión traducida para trabajar.
Usa el panel de chat de IA para hacer preguntas basadas en la transcripción, como qué decisiones se tomaron, qué fechas se mencionaron o qué tareas de seguimiento aparecen en la conversación. Verifica la sustancia citada contra la transcripción antes de actuar.
La herramienta de resumen condensa la transcripción para que puedas escanear las ideas principales antes de leer pasajes importantes completos. Un resumen puede omitir matices, calificaciones o puntos de vista minoritarios, por lo que debe usarse como ayuda de navegación y no como reemplazo de la revisión.
Elige un idioma destino después de la transcripción para crear una versión traducida del texto. La calidad de la traducción varía con el contexto y la terminología; nombres, cifras, lenguaje legal, médico y términos técnicos deben ser revisados por un revisor fluido o calificado.
Los mensajes de voz son fáciles de enviar pero difíciles de buscar, citar o leer en silencio. Guarda o comparte el archivo de audio real en tu dispositivo, súbelo en el espacio de trabajo, espera el procesamiento y luego revisa la transcripción editable.
Los mensajes de voz de WhatsApp comúnmente usan audio OGG u OPUS. Guarda o comparte el archivo de la nota de voz desde el teléfono, luego selecciona ese archivo en el cargador. Si el sistema operativo cambia el contenedor durante el envío, confirma que el archivo resultante aún se reproduce antes de enviarlo.
Para mensajes grabados en teléfono y clips guardados, la guía de transcripción de memos de voz cubre un flujo completo de móvil a texto.
Apple Voice Memos suele producir audio M4A, mientras que las apps de grabación de Android pueden crear M4A, AAC, OGG u otro formato compatible. Sube la grabación original clara cuando sea posible, porque reenviar y comprimir repetidamente puede dificultar el reconocimiento del habla baja.
Si necesitas capturar un nuevo mensaje en el navegador, usa el flujo de trabajo de transcripción de grabadora de voz desde la grabación hasta la revisión.
Exporta o guarda el audio del buzón de voz en lugar de reproducirlo en otro micrófono cuando el dispositivo permita esa opción. El audio directo usualmente evita eco de sala y una segunda capa de compresión, aunque nombres y números de devolución de llamada aún necesitan revisión cuidadosa.
Para detalles de devolución de llamada y clasificación de mensajes, sigue la guía de transcripción de buzón de voz antes de confiar en el texto.
La transcripción crea un documento de trabajo buscable a partir de material hablado. El flujo de trabajo más útil depende de si necesitas encontrar evidencia, preparar contenido, capturar decisiones, hacer subtítulos o crear una versión en texto para accesibilidad y revisión.
Una transcripción ayuda a los productores a encontrar citas, esbozar episodios, redactar notas del programa e identificar segmentos que necesitan corrección. Los nombres de los hablantes, marcas y afirmaciones sensibles al tiempo deben verificarse con el audio antes de la publicación.
Para preparación de episodios y revisiones editoriales, usa el flujo de trabajo de transcripción de podcasts como referencia específica del formato.
El texto buscable puede facilitar la localización de decisiones, preguntas y temas más que rebobinar una grabación larga. Confirma el consentimiento y las reglas institucionales antes de grabar, luego distingue declaraciones textuales de cualquier resumen generado por IA posterior.
Los pensamientos grabados pueden convertirse en un borrador más fácil de editar que una página en blanco. Una transcripción también puede proporcionar una alternativa en texto para material hablado, pero la publicación accesible puede requerir identificación de hablantes, señales sonoras, tiempos y corrección manual más allá de la transcripción cruda.
No existe un porcentaje único honesto de precisión para cada grabación. Los resultados cambian según el idioma hablado, calidad del micrófono y códec, ruido de fondo, hablantes superpuestos, distancia al micrófono, pronunciación y vocabulario usado.
Usa la grabación original cuando sea posible, mantén el habla a un nivel audible constante y evita el recorte. Si controlas la grabación, coloca el micrófono lo suficientemente cerca para un habla clara y reduce música, eco, viento y conversaciones competidoras.
Nombres, números telefónicos, direcciones de correo, fechas, precios, medidas, citas y términos especializados pueden cambiar de significado si un carácter o palabra está mal. Compara estos detalles directamente con el audio antes de compartir o usar la transcripción.
La transcripción es una representación generada por modelo de la grabación, no una prueba de que cada palabra sea correcta. Un resumen o respuesta de chat añade otra capa interpretativa. Mantén el audio, la transcripción corregida y la salida derivada de IA conceptualmente separadas para que los lectores sepan qué fuente usan.
Puedes probar una grabación de hasta 5 minutos sin cuenta. Una cuenta gratuita incluye 15 minutos de transcripción por día y 10 llamadas de IA por día. Los archivos se suben de forma segura al servicio remoto de transcripción para su procesamiento.
El uso anónimo está pensado para pruebas cortas. Una cuenta gratuita proporciona las asignaciones diarias indicadas de transcripción y IA. Pro cuesta $9 al mes o $84 al año y está pensado para quienes necesitan el flujo de trabajo y opciones de exportación pagadas.
Puedes editar y copiar el resultado en el espacio de trabajo. Las cuentas gratuitas pueden exportar TXT y JSON. Las cuentas Pro pueden además exportar SRT, VTT, PDF y DOCX, por lo que la elección correcta depende de si necesitas texto plano, datos estructurados, subtítulos o un documento.
La grabación se envía a un servicio remoto; no se transcribe completamente dentro de tu navegador. Antes de subir audio confidencial, regulado o de terceros, confirma que tienes permiso y que el flujo de trabajo cumple con las reglas de privacidad, retención, contractuales y organizacionales aplicables al material.
Respuestas claras sobre grabación, archivos soportados, idiomas, edición, herramientas de IA, límites de cuenta, exportaciones y procesamiento remoto.