Mascota rana de Transcribbit examinando una transcripción con una lupa
Investigación
9 min read

Precisión de la transcripción con IA en 2026: lo que dice realmente la investigación

Por Kyle RProduct

Precisión de la transcripción con IA en 2026: qué es el WER, rangos reales de benchmarks y dónde falla el reconocimiento de voz con acentos, ruido y nombres.

La precisión de la transcripción con IA en 2026 suele rondar entre el 95 y el 98 por ciento en audio limpio y de un solo interlocutor, lo que suena casi perfecto. El panorama real es más complicado. La precisión cae bruscamente con los acentos, el ruido de fondo, los hablantes que se solapan y la jerga técnica, y la investigación publicada muestra que los errores no se reparten por igual entre todos los grupos de hablantes.

Esa brecha entre la cifra principal y el rendimiento real importa. Si estás decidiendo si confiar en una transcripción automática para una reunión, una entrevista, una nota médica o un registro legal, la pregunta correcta no es "¿es precisa la transcripción con IA?", sino "¿para quién es precisa, en qué condiciones y para qué resulta lo bastante precisa?". Este artículo repasa lo que realmente mide la investigación, qué significan las cifras y dónde la tecnología todavía se queda corta.


¿Qué es la Tasa de Error de Palabras (WER)?

La Tasa de Error de Palabras (WER, por sus siglas en inglés) es la medida estándar de precisión de los sistemas de voz a texto. Cuenta cuántas palabras transcribe incorrectamente un sistema frente a una transcripción de referencia correcta y luego divide ese total entre el número total de palabras pronunciadas. Captura tres tipos de error.

  • Sustituciones: el sistema cambia una palabra por otra ("their" en lugar de "there").
  • Eliminaciones: el sistema omite una palabra que sí se pronunció.
  • Inserciones: el sistema añade una palabra que nunca se dijo.

La fórmula suma esos tres valores y los divide entre el número de palabras del texto de referencia:

> WER = (Sustituciones + Eliminaciones + Inserciones) / Total de palabras

Un ejemplo resuelto lo deja claro. Supongamos que alguien dice, en inglés, "I'll send the contract to Sarah on Friday afternoon." Son nueve palabras. Si el sistema produce "I'll send the contract to Sara on Friday after noon," hay una sustitución ("Sarah" se convirtió en "Sara") y una inserción ("afternoon" se dividió en "after noon", lo que añade una palabra). Dos errores en nueve palabras dan un WER de aproximadamente 0,22, o 22 por ciento. La precisión, la cifra que prefieren los equipos de marketing, se reportaría como aproximadamente 78 por ciento.

Conviene tener presentes algunas cosas. Un WER más bajo es mejor, y un WER de cero significa una transcripción perfecta. El WER puede técnicamente superar el 100 por ciento si un sistema inserta muchas palabras de más. Y trata cada palabra por igual, así que equivocarse con una muletilla como "um" cuenta lo mismo que equivocarse con el nombre de una persona o una dosis. Como señala el equipo de benchmarks de MLCommons, incluso pequeñas decisiones de formato, como escribir "Dr." en vez de "doctor", pueden registrarse como errores a menos que el texto se normalice primero.


Qué muestran los benchmarks en 2026

El reconocimiento automático de voz (ASR) moderno es realmente bueno en el tipo de audio para el que fue diseñado. Whisper Large-v3 de OpenAI es uno de los sistemas abiertos más utilizados, y es un punto de referencia útil porque su rendimiento se ha medido de forma independiente.

En 2025, MLCommons eligió Whisper Large-v3 como el modelo de voz a texto para su benchmark MLPerf Inference. En el conjunto de datos "dev-all" de LibriSpeech, que combina audio leído en voz alta más limpio y más ruidoso, la implementación de referencia alcanzó una exactitud por palabra de aproximadamente 97,9 por ciento, lo que corresponde a un WER cercano al 2 por ciento. El mismo informe señala que Whisper redujo la tasa de error del modelo de referencia anterior en más de un 72 por ciento, una mejora generacional real.

Esa cifra viene con una advertencia importante. LibriSpeech es habla leída de audiolibros: un solo hablante, un buen micrófono, pronunciación clara, sin solapamiento de voces. Se acerca al escenario ideal. Las reuniones reales, las llamadas telefónicas y las notas de voz no se parecen en nada a eso.

Para hacerse una idea de lo que es posible, investigadores de Microsoft midieron a transcriptores humanos profesionales en habla telefónica conversacional usando el conjunto de pruebas estándar del NIST. Los humanos entrenados obtuvieron un WER del 5,9 por ciento en la parte de Switchboard (desconocidos hablando sobre un tema asignado) y del 11,3 por ciento en la parte de CallHome (amigos y familiares en una conversación abierta). Así que incluso los humanos expertos cometen aproximadamente un error cada 17 palabras en una conversación relativamente formal, y algo más cerca de uno cada nueve en una charla informal. La afirmación muy repetida de que "los humanos están en el 4 por ciento" se remonta a una comunicación personal sin datos que la respalden, y el mismo estudio sostiene que una única cifra de precisión humana es engañosa porque la dificultad varía mucho según la grabación.

La conclusión práctica: un WER del 2 por ciento en audio de audiolibro y un WER de entre el 10 y el 15 por ciento en una llamada grupal ruidosa pueden ser ambos ciertos para el mismo modelo.


Precisión por condición: una guía aproximada

La siguiente tabla resume el patrón general observado en los benchmarks y estudios publicados. Trata estos datos como rangos indicativos, no como garantías, porque las cifras exactas dependen del modelo, el conjunto de datos y cómo se puntúa el texto.

CondiciónRango típico de WERQué significa en términos sencillos
Limpio, un solo hablante, leído en voz alta~2 a 5%Precisión casi profesional, errores poco frecuentes
Habla conversacional clara, un solo hablante~5 a 10%Muy utilizable, algún desliz ocasional con nombres o términos
Inglés con acento o no nativo~10 a 25%+Notablemente peor, varía mucho según el acento
Ruido de fondo o micrófono deficiente~10 a 30%+Cae rápido a medida que aumenta el ruido
Varios hablantes solapados~15 a 40%+El solapamiento y los turnos de palabra provocan errores grandes
Jerga especializada, nombres, siglasVariable, a menudo altoLos términos especializados que quedan fuera de los datos de entrenamiento no se reconocen

La cifra de audio limpio se basa en el benchmark de Whisper de MLCommons, y el rango conversacional es coherente con el trabajo de paridad entre humanos y máquinas sobre habla telefónica.


Dónde la transcripción con IA todavía falla

Acentos y dialectos

El acento es uno de los puntos débiles más estudiados. Un estudio de 2024 en JASA Express Letters de Calbert Graham y Nathan Roll evaluó Whisper en una variedad de acentos del inglés del Speech Accent Archive. Encontraron que el modelo reconocía el inglés estadounidense con más precisión, con el inglés británico y australiano rindiendo peor y el inglés canadiense más o menos comparable al estadounidense. En general, los acentos nativos del inglés se transcribían con más precisión que los acentos no nativos.

No es una rareza de un solo modelo. Refleja cómo se construyen estos sistemas: aprenden a partir de grandes colecciones de habla grabada, y si esas colecciones se inclinan mucho hacia ciertos acentos, el modelo rinde mejor con esos acentos y peor con todos los demás. El error está incorporado en los datos de entrenamiento, no en quien habla.

Ruido de fondo y calidad del audio

El ruido afecta a todos por igual, y no para bien. Una cafetería, un coche, un teléfono con altavoz en una sala grande o un micrófono de baja calidad hacen subir el WER con rapidez. El equipo de MLCommons incluyó deliberadamente conjuntos de audio más ruidosos precisamente porque los benchmarks con audio limpio exageran el rendimiento en el mundo real. Si tú mismo apenas distingues una palabra en una grabación, el modelo normalmente tampoco puede.

Varios hablantes y solapamiento

Dos personas hablando a la vez es difícil tanto para las máquinas como para los humanos. La mayoría de los modelos ASR están diseñados para transcribir un único flujo de voz, así que cuando los hablantes se solapan el sistema tiene que adivinar. El estudio de Microsoft lo ilustra directamente: los dos hablantes peor transcritos en sus datos eran voces secundarias que compartían uno de los lados de la conversación con un hablante dominante, con tasas de error del 37,5 y el 64,7 por ciento, muy por encima de la media. Determinar quién dijo qué, lo que se llama diarización de hablantes, es una tarea relacionada que aún es imperfecta, y sus errores se suman a los errores de transcripción.

Jerga, nombres y siglas

Un modelo solo puede transcribir con confianza palabras que efectivamente haya visto antes. El vocabulario especializado, como nombres de medicamentos, términos legales, códigos de producto o nombres personales poco comunes, a menudo queda fuera de la distribución de entrenamiento, así que el sistema sustituye una palabra más común que suena parecida. Por eso una transcripción puede leerse con fluidez y aun así estar equivocada justo en los lugares que más importan: el nombre de una persona, una empresa, un medicamento o un número.


El problema documentado de sesgo en el ASR

El hallazgo más citado en esta área trata sobre equidad. En 2020, Allison Koenecke y sus colegas de Stanford publicaron "Racial disparities in automated speech recognition" en Proceedings of the National Academy of Sciences (PNAS). El equipo puso a prueba cinco de los principales sistemas comerciales, de Amazon, Apple, Google, IBM y Microsoft.

En los cinco sistemas, la tasa media de error de palabras fue de 0,35, o 35 por ciento, para hablantes negros, frente a 0,19, o 19 por ciento, para hablantes blancos. En términos sencillos, los sistemas entendieron mal alrededor del 35 por ciento de las palabras de los hablantes negros, pero solo el 19 por ciento de las de los hablantes blancos, incluso cuando los hablantes coincidían en edad y género y decían exactamente las mismas palabras. Las tasas de error fueron más altas entre los hombres afroamericanos, y la brecha se ampliaba en los hablantes que usaban más el inglés vernáculo afroamericano.

El estudio también analizó los fallos catastróficos, aquellos casos en los que una transcripción estaba tan equivocada que resultaba prácticamente inútil. Eso ocurrió en más del 20 por ciento de las muestras de hablantes negros, frente a menos del 2 por ciento de las muestras de hablantes blancos. Los investigadores atribuyen la disparidad a datos de entrenamiento que infrarrepresentan el habla de los estadounidenses negros, y sostienen que la solución pasa por audio de entrenamiento más representativo junto con auditorías independientes.

Dos advertencias honestas. Las pruebas se realizaron en 2019, y las empresas han actualizado sus sistemas desde entonces, así que las cifras exactas reflejan ese momento concreto. Y el estudio se centró específicamente en el inglés estadounidense y en la comparación entre hablantes negros y blancos. La conclusión de ese hallazgo, que los errores del ASR no se distribuyen por igual, se ha mantenido en investigaciones posteriores sobre acentos. La lección principal se mantiene: una única cifra de precisión oculta para quién funciona bien el sistema y para quién falla.


Entonces, ¿qué tan precisa es realmente la transcripción con IA?

Uniendo toda la evidencia:

  • En audio limpio y de un solo hablante, los sistemas modernos alcanzan aproximadamente entre el 95 y el 98 por ciento de precisión, cerca de un humano cuidadoso.
  • En habla conversacional clara y en buenas condiciones, espera más errores que en audio de audiolibro, pero aun así dentro del amplio rango de un transcriptor humano profesional, entre el 6 y el 12 por ciento de WER.
  • En habla con acento, audio ruidoso, hablantes solapados o vocabulario especializado, la precisión puede caer mucho, a veces a la mitad o más.
  • Los errores no se distribuyen de manera uniforme, y las disparidades documentadas significan que algunos hablantes obtienen de forma sistemática resultados peores que otros.

Para usos de bajo riesgo, como un borrador rápido de un podcast, un archivo con capacidad de búsqueda o una nota de voz personal, la transcripción con IA actual es rápida, barata y suficientemente buena. Para usos de alto riesgo, cualquier cosa médica, legal o financiera, o vinculada a un nombre, un número o una decisión, la investigación apunta a un consejo consistente: trata la transcripción de la IA como un buen primer borrador, no como un registro final, y verifica las partes que importan.

Esa es también la posición honesta que adoptamos. Transcribbit convierte una nota de voz de WhatsApp reenviada en texto limpio y legible en segundos, y una transcripción es mejor que volver a escuchar el audio porque puedes leerla rápidamente, buscar en ella y comprobar un nombre o una cifra de un vistazo, en lugar de rebobinar la grabación. Sigue mereciendo la pena revisar esos detalles críticos en vez de dar por hecho que una transcripción de aspecto limpio es correcta, que es exactamente por qué las notas de voz son más fáciles de gestionar como texto. El plan gratuito cubre 50 transcripciones al mes y tu audio se elimina justo después. Pruébalo gratis.


Preguntas frecuentes

¿Qué es una buena Tasa de Error de Palabras para una transcripción?

En audio limpio, un WER inferior al 5 por ciento aproximadamente se considera generalmente muy bueno y cercano a la calidad humana profesional. En audio más difícil, con ruido, acentos o varios hablantes, incluso un sistema bien construido puede situarse en el rango del 10 al 25 por ciento o más, así que lo que es "bueno" depende mucho de las condiciones de la grabación.

¿Es la transcripción con IA más precisa que la transcripción humana?

En audio limpio y de un solo hablante, los mejores sistemas de IA ya son competitivos con los humanos expertos, a veces ligeramente mejores en el WER puro. Los humanos todavía tienen ventaja en audio desordenado, hablantes solapados, nombres poco familiares y comprensión del contexto, que es exactamente donde la IA tiende a fallar.

¿Por qué la transcripción con IA se equivoca con los acentos?

Porque estos sistemas aprenden a partir de habla grabada, y si los datos de entrenamiento sobrerrepresentan algunos acentos, el modelo rinde mejor con esos y peor con otros. Los estudios han documentado menor precisión en acentos no nativos y grandes disparidades entre grupos de hablantes. El error refleja los datos con los que se entrenó el modelo, no a quien habla.

¿Se puede confiar en la transcripción con IA para registros médicos o legales?

Puede ser un primer borrador útil, pero la investigación desaconseja tratarla como un registro final y sin verificar en entornos de alto riesgo. El WER trata cada palabra por igual, así que un sistema puede obtener una buena puntuación general y aun así transcribir mal el único nombre, dosis o cifra que importa. La revisión humana de los detalles críticos sigue siendo la práctica segura.

¿Qué tan precisa es la transcripción con IA para una nota de voz de WhatsApp?

Depende por completo de la grabación. Una nota de voz clara de una persona en una habitación silenciosa se sitúa cerca de la parte alta del rango, mientras que una nota grabada con prisas en una calle con viento, con un acento marcado o con música de fondo puede caer muy por debajo. Como tantas notas de voz son exactamente esas grabaciones desordenadas y hechas sobre la marcha, leer la transcripción y comprobar cualquier dirección, hora o número es el hábito seguro.


Reflexiones finales

La transcripción con IA en 2026 es realmente impresionante y realmente desigual. El mismo modelo que borda un audiolibro puede tropezar gravemente con una llamada grupal ruidosa, un acento marcado o un nombre que nunca ha visto, y la investigación deja claro que esos tropiezos golpean con más fuerza a algunos hablantes que a otros.

Así que la respuesta útil a "¿qué tan precisa es la transcripción con IA?" es: lo bastante precisa para ahorrarte tiempo de verdad, no lo bastante precisa para confiar en ella a ciegas en lo que de verdad importa. Lee la transcripción, presta atención a los nombres y las cifras, y deja que la máquina haga la parte tediosa. Transcribbit convierte tus notas de voz de WhatsApp en texto con capacidad de búsqueda en más de 50 idiomas, con un plan gratuito de 50 transcripciones al mes y sin conservar el audio después, en transcribbit.io.


Referencias

  1. Whisper: An MLPerf Inference Benchmark for Automatic Speech Recognition (MLCommons, 2025) - mlcommons.org
  2. Comparing Human and Machine Errors in Conversational Speech Transcription (Stolcke and Droppo, Microsoft, 2017) - arxiv.org
  3. Evaluating OpenAI's Whisper ASR: Performance across diverse accents and speaker traits (Graham and Roll, JASA Express Letters, 2024) - pubs.aip.org
  4. Racial disparities in automated speech recognition (Koenecke et al., PNAS, 2020) - pnas.org