Tasa de error de palabras (WER): conceptos clave, fórmula y usos
- Escrito por
- Jack Limebear
- Publicado
- Última actualización
EscucharEscucha este artículo
En teoría, la tasa de error de palabras (WER) es una métrica para determinar la precisión de una herramienta de Reconocimiento Automático de Voz (ASR). Un WER bajo significa que tu transcripción final es más precisa, mientras que una tasa de error alta indica información mal transcrita.
En la práctica, el WER puede marcar la diferencia entre un software de transcripción médica que escribe que un paciente necesita 'quince miligramos' o 'cincuenta miligramos' de una receta. Es la diferencia entre una herramienta de soporte que transcribe correctamente las necesidades de un cliente y otra que deja al usuario frustrado.
En este artículo, vamos a explicar qué es el WER, cómo calcularlo y cómo usarlo para comparar tu proveedor de ASR.
Resumen
- La tasa de error de palabras cuenta tres tipos de errores: sustituciones, omisiones e inserciones, y los divide por el número de palabras en la transcripción de referencia.
- La fórmula del WER es WER = (S + D + I) / N.
- Cuanto más bajo sea el WER, más precisa será la transcripción final.
- Un WER por debajo del 5% es una buena referencia, aunque las transcripciones legales o médicas pueden requerir una tasa aún menor.
- El WER trata todos los errores por igual, por lo que no es una métrica perfecta para la comprensión contextual. Están surgiendo nuevas métricas, como la Tasa de Error Semántico de Palabras (SWER), que intentan medir si se ha conservado el significado de una frase.
¿Qué es la tasa de error de palabras?
La tasa de error de palabras (WER) es la métrica estándar para medir la precisión del reconocimiento de voz en modelos de Voz a Texto. Representa un valor entre 0 y 1 (0,8 sería un 80% de error) de lo que un sistema STT transcribe mal, teniendo en cuenta las sustituciones, omisiones e inserciones.
Una sustitución es cuando una palabra se reemplaza por otra incorrecta. Una omisión es cuando falta una palabra por completo. Por último, una inserción es cuando la transcripción añade una palabra que no se dijo. El WER utiliza estos tres componentes y los divide por el número de palabras en la transcripción correcta, dando un valor que puedes comparar entre diferentes proveedores.
Aquí tienes la fórmula del WER escrita:
WER = (S + D + I) / N
Donde:
- S: Sustituciones (la palabra es incorrecta)
- D: Omisiones (falta la palabra)
- I: Inserciones (hay una palabra adicional)
- N: Total de palabras en la transcripción de referencia
Puedes expresar el WER como decimal o porcentaje. Cuanto más bajo sea el WER, mejor, ya que el modelo ha cometido menos errores al transcribir.
En la práctica, un WER del 10% significa que aproximadamente 1 de cada 10 palabras de la transcripción de tu reunión necesita ser revisada.
¿Por qué importa la tasa de error de palabras en los sistemas de reconocimiento de voz?
La tasa de error de palabras ofrece una métrica objetiva que los equipos pueden usar para comparar diferentes proveedores. Elimina el ruido del marketing y da una visión clara de la precisión de un modelo de reconocimiento de voz. Así, cualquier empresa que esté evaluando opciones puede ver fácilmente qué modelos son los más avanzados.

Fuente: Artificial Analysis consultado el 10 de julio de 2026.
A julio de 2026, una investigación independiente de Artificial Analysis sitúa a Scribe v2 de ElevenLabs como el modelo con menor WER del sector en el dataset AA-AgentTalk para modelos de transcripción no streaming, con un WER del 1,5%.
Más allá de comparar proveedores, el WER tiene un impacto real en el producto. Un software de transcripción médica con un WER del 12% podría introducir errores críticos en los historiales de pacientes. Los errores de transcripción en una llamada de soporte pueden provocar fallos posteriores, como un análisis de sentimiento incorrecto o una mala categorización.
Más allá de estos problemas específicos, cuando los sistemas ASR fallan, las personas más afectadas suelen ser quienes dependen de la transcripción para acceder al contenido hablado. El World Wide Web Consortium ofrece documentación detallada sobre los estándares mínimos que exigen las iniciativas de accesibilidad para más contexto.
Cómo calcular la tasa de error de palabras: fórmula y ejemplo
Calcular la tasa de error de palabras es sencillo una vez conoces los pasos. Como hemos visto antes, la fórmula que vas a usar es WER = (S + D + I) / N. Todos los términos se han explicado arriba, pero para referencia rápida: sustituciones, omisiones, inserciones y N para el total de palabras en la transcripción.
Así se calcula el WER:
- Crea una transcripción de referencia: Usa transcripción y verificación humana para obtener una transcripción precisa de un audio.
- Utiliza tu herramienta STT: Usa una plataforma ASR para transcribir el audio y obtener una transcripción IA que usarás como prueba.
- Alinea las dos versiones: Utiliza programación dinámica (concretamente el algoritmo de Levenshtein) para encontrar el número mínimo de ediciones. Más adelante explicamos este algoritmo.
- Aplica la fórmula: Cuenta el número total de errores en la versión generada por IA frente a la copia verificada por humanos y usa WER = (S + D + I) / N para calcular el WER exacto.
Puede parecer técnico sobre el papel, pero en la práctica es mucho más sencillo. Aquí tienes un ejemplo para que lo veas claro.
Transcripción de referencia: Mrs. Dalloway said she would buy the flowers herself.
Salida ASR: Miss Dalloway said she would buy flowers herself.
Si calculamos los errores totales, tenemos 1 S y 1 D de un total de 9 palabras.
Usando la fórmula, obtenemos: WER = 2 / 9 = 0,222 = 22,2%.
Cómo calcular la tasa de error de palabras con Python
Aunque el método manual funciona bien, puedes ahorrar tiempo calculando el WER con python. La librería jiwer lo gestiona todo de forma automática.
Siguiendo la documentación de jiwer, puedes instalar el paquete, que está pensado para evaluar un sistema ASR y obtener métricas clave como el WER. Una vez descargado, puedes usar el siguiente código para calcular rápidamente el WER con python:
Fíjate cómo, en este ejemplo, la salida ASR difiere de la referencia original en dos puntos. La palabra 'jumps' se transcribió incorrectamente como 'leaps' (una sustitución) y 'last' se insertó antes de 'lazy' (una inserción). Con dos errores en las nueve palabras de la transcripción de referencia, esto da una tasa de error de palabras (WER) de 0,222 o 22,2%.
Comparando la tasa de error de palabras con otras métricas de reconocimiento
Aunque el WER es la métrica estándar para calcular la precisión en un ASR, hay otras herramientas que puedes usar. Por ejemplo:
- Tasa de error de caracteres (CER): Al igual que el WER, mide la precisión de la transcripción pero a nivel de carácter en vez de palabra. Es útil para idiomas sin separación clara de palabras (scriptio continua) o tareas sensibles a la ortografía.
- Tasa de error de coincidencias (MER): Mide la proporción de errores de transcripción tratando las sustituciones, inserciones y omisiones de forma ligeramente diferente al WER. Se centra en la proporción de errores que son incorrectos en una frase.
- Palabras con información perdida (WIL): Una estimación de cuánta información original se perdió durante la transcripción, ofreciendo una medida de inteligibilidad en vez de un simple recuento de errores como el WER.
- Tasa de error de embedding (EmbER): Ofrece un análisis semántico entre las transcripciones. Va más allá del WER y da información sobre la distancia semántica entre la palabra correcta y la transcripción incorrecta.
Cada una de estas métricas es útil en un escenario diferente. Aquí tienes una tabla de referencia:
Ejemplos de distancia de Levenshtein: las matemáticas detrás del WER
La tasa de error de palabras mide realmente la distancia entre el original y la hipótesis de salida. Para entender esa diferencia matemáticamente, usamos la distancia de Levenshtein.
La distancia de Levenshtein cuenta el número mínimo de ediciones de una sola unidad necesarias para transformar una secuencia en otra. Para el WER, esto significa concretamente las ediciones de sustituciones, inserciones y omisiones. Por ejemplo, si queremos transformar Cat en Mat, hay que cambiar la letra 'C' por 'M', lo que da una distancia de Levenshtein de 1.
Aunque esto se usa más en cálculos de CER, el WER toma la distancia de Levenshtein y la aplica a nivel de palabra. Cada unidad es una palabra entera en vez de un carácter, y la distancia real mide cuántas ediciones de palabras harían falta para transformar la salida ASR en el original correcto.
Se construye una matriz donde cada celda representa la distancia total entre la transcripción original y la transcripción ASR. La distancia de Levenshtein rellena la matriz de arriba a la izquierda hasta abajo a la derecha, y la celda final te da el número total de ediciones a nivel de palabra. Dividir ese número por N es tu WER.
Aunque normalmente esta matriz se calcula con caracteres individuales, aquí tienes una versión ampliada de nuestro ejemplo anterior para simplificar.

Errores y conceptos erróneos comunes sobre la tasa de error de palabras
Especialmente ahora que las APIs STT son más accesibles y el software ASR es cada vez más habitual en los flujos de trabajo de agentes, vamos a ver muchas comparaciones entre diferentes herramientas.
Antes de calcular tu propio WER, hay algunos errores y conceptos erróneos comunes que deberías conocer.
- Todos los errores son iguales: El WER trata cada error como igual de importante. Aunque en muchos contextos esto puede ser suficiente, en algunos casos no es aceptable. Por ejemplo, en un hospital, un 5% de error, que sería un buen WER, puede ser incomprensible, ya que uno o dos errores pueden poner en riesgo a un paciente. Esta limitación ha llevado al desarrollo de nuevas métricas, como la Tasa de Error Semántico de Palabras (SWER), que intenta medir si se ha conservado el significado de una frase en vez de si cada palabra coincide exactamente.
- El WER puede superar el 100%: Aunque antes dijimos que el WER va de 0 a 1, también puedes encontrar un WER superior al 100%. Esto ocurre porque el error de inserción puede generar más palabras que las que había en la transcripción original. Un ejemplo típico es transcribir 'I'm' como 'I am', donde una palabra se convierte en dos.
- Un WER más bajo no siempre es mejor, técnicamente: Un WER del 5% es, en teoría, mejor que uno del 10%. Pero si los errores que forman ese 5% cambian mucho el contexto de una frase y los del 10% no, entonces la historia no está completa. El contexto sigue siendo clave, y por eso se han desarrollado métricas como SWER para captar este impacto semántico.
En 2024, Apple publicó un estudio interesante sobre el punto anterior. Cuando humanos evaluaron un WER del 9,4% comprobando si la transcripción ASR era legible, dieron a ese mismo texto un WER de solo 2,2%. En el ejemplo que analizaron, los humanos consideraron que muchos de los 'errores' no eran importantes, produciendo un WER humano más de 4 veces más permisivo que el de las máquinas.
Referencias del sector para el WER
El WER ideal depende mucho del sector o del caso de uso en el que utilices la tecnología ASR. Aunque <5% es una referencia en el sector, áreas como la transcripción médica o legal necesitan tasas mucho más bajas.
En el estudio de Artificial Analysis de julio de 2026, Scribe v2 de ElevenLabs obtuvo un WER del 1,5%. Sin embargo, es importante recordar que estas estadísticas suelen hacerse en inglés como idioma principal. La tecnología STT en otros idiomas puede no ser tan eficaz.
La documentación de ElevenLabs detalla las bandas generales de WER en todos los idiomas que soportan Scribe v1 y Scribe v2.
Empieza con ElevenAPI para mejorar la precisión del reconocimiento
Si estás creando una app o producto donde la calidad de la transcripción importa, la diferencia entre una API ASR bien elegida y una mediocre se nota primero en tu WER y después en la experiencia de tus usuarios.
ElevenLabs Scribe es la capa de Voz a Texto accesible a través de ElevenAPI. Además de 90+ idiomas y un WER líder en el sector, ofrece funciones como diarización de hablantes, marcas de tiempo a nivel de palabra, prompts de palabras clave y detección de entidades.
Explora la documentación de ElevenLabs para saber más sobre ElevenAPI o empieza registrándote hoy mismo.
.webp&w=3840&q=80)


.webp&w=3840&q=80)
