por | 11 de Jul de 2026 | Blogs & Redes, Ortodoncia

¿Qué tan confiable es el reconocimiento automático de voz para registros de ortodoncia?

Los registros médicos electrónicos son ahora una rutina para el mantenimiento de registros clínicos. Muchos de nosotros todavía usamos un teclado para ingresar datos de pacientes. Sin embargo, con el desarrollo del reconocimiento automático de voz (ASR), varios paquetes están disponibles para su uso en el sector sanitario. Sin embargo, existen desafíos a la hora de interpretar el discurso clínico en texto. Este nuevo artículo examinó la precisión del reconocimiento automático del habla en los registros clínicos de ortodoncia. Es relevante para todos los proveedores de atención dental.

Esta no es una publicación sobre un tema clínico; Un equipo de investigación de ortodoncia establecido realizó este estudio. Por lo tanto, pensé que era relevante para mi blog y ciertamente suponía un cambio respecto a mirar artículos sobre «vías respiratorias».

Un equipo con base en el hermoso sur de Inglaterra y Zurich llevó a cabo este estudio. El Journal of Dental Research publicó el artículo. Este documento es de acceso abierto.

Tengo un conflicto de intereses porque conozco bien a este equipo de investigación. Martyn Cobourne y yo venimos de un pequeño pueblo en el condado rural de Worcestershire y íbamos a las mismas escuelas y jugábamos en el mismo parque cuando éramos niños.

¿Qué preguntaron?

Hicieron este estudio para responder a esta pregunta.

«¿Cuál es la precisión transcripcional de los sistemas ASR en odontología utilizando registros clínicos de ortodoncia narrados?»

¿Qué hicieron?

Realizaron un estudio transversal con las siguientes etapas:

Identificaron 10 sistemas distintos de reconocimiento automático del habla para registros clínicos de ortodoncia. Cuatro de ellos eran sistemas disponibles comercialmente. Por ejemplo, Dragón médico 1.

La segunda categoría eran los sistemas independientes de conversión de voz a texto que proporcionaban acceso directo a modelos de reconocimiento automático de voz ampliamente disponibles. Ejemplos incluidos Transcripción GPT-4.0 y Susurro OpenAI.

La tercera categoría fue un ASR experimental, aumentado por procesamiento de lenguaje natural y modelos de lenguaje grande (LLM) que utilizan corrección de errores generativa. Esto se llamó GPT40Transcribe corregido.

Luego dictaron a partir de registros clínicos de ortodoncia preparados, incluidos diagnósticos y tratamientos, para generar transcripciones utilizando varios sistemas ASR.

Curiosamente, evaluaron todos los sistemas en presencia o ausencia de ruido de fondo y a través de variaciones en los acentos del narrador.

Luego evaluaron la precisión transcripcional, léxica y semántica de cada sistema utilizando métricas validadas de error de palabras y caracteres. El resultado primario fue la Tasa de Error de Palabras de Dominio (DWER), que evalúa la precisión de la transcripción con respecto a la terminología clínica.

¿Qué encontraron?

Produjeron una gran cantidad de datos. Hubo diferencias significativas entre los sistemas en términos de DWER.

Descubrieron que GPT4o TranscribeCorrected superó a todos los demás sistemas, logrando un DWER de sólo el 3,47%. GTP40 Transcribe y Heidi Salud ocuparon consistentemente el segundo y tercer lugar, con DWER del 7,6% y 6,1%, respectivamente.

Curiosamente, los sistemas disponibles comercialmente no funcionaron tan bien. Por ejemplo, Dragon Professional Anywhere ocupó el peor lugar en todas las métricas de error de transcripción, con un DWER del 48 %, y Dragon Medical One ocupó el segundo peor lugar, con un DWER del 29 %.

Con la excepción de GPT4o y Transcribe Corrected, los sistemas tuvieron dificultades considerables para reconocer palabras de dominios específicos. También descubrieron que el ruido de fondo aumentaba la tasa de error de palabras. Sin embargo, este efecto dependía del sistema, siendo las dos variantes GPT4o y Heidi Health las que mostraron la mayor resiliencia. También descubrieron que el acento del hablante tenía sólo una influencia menor.

Los autores destacaron varios términos de ortodoncia que se transcribieron mal en todos los sistemas. Los incluyeron en una tabla muy útil. No tengo espacio para incluirlos todos en esta publicación. Sin embargo, fue interesante ver que términos como “retenedor de Essix” se transcribían consistentemente como “Essex”, el condado, y que términos como “mesialmente” se transcribían como “nasalmente”, “fácilmente” y “miserable”, con una tasa de transcripción errónea del 75% en todos los sistemas. (¡Esto es exactamente lo que sucedió cuando estaba dictando esta publicación en Whispr Flow!)

Su conclusión final fue

«Hubo una variabilidad significativa en el rendimiento entre los sistemas ASR probados. Todos fueron capaces de introducir errores de transcripción clínicamente significativos. Necesitamos ser cautelosos al utilizar esta tecnología en este momento, ya que requiere una verificación considerable».

¿Qué pensé?

Siempre he jugado con las computadoras y su tecnología desde los primeros días de la computadora personal. En el pasado, probé muchos sistemas de dictado y todos fueron fracasos estrepitosos. Recientemente, he estado usando WISPR Flow para dictar este blog y parece ser un paquete excelente. Por lo tanto, estaba muy interesado en ver este estudio.

Los autores hicieron bien el estudio y escribieron un artículo claro. El Journal of Dental Research publicó el artículo. Esta es una revista difícil para conseguir que se acepte un artículo. Nunca he logrado lograrlo.

Los hallazgos me parecieron interesantes y nos indicaron el uso de varios paquetes.

Claramente este será un campo que evolucionará muy rápidamente. No estoy seguro de qué paquete usar; sin embargo, es importante señalar que los paquetes no clínicos fueron sorprendentemente eficaces en comparación con los desarrollados para uso clínico.

También debemos considerar cuál es una tasa de error aceptable. Esto es bastante difícil porque es probable que las consecuencias de diferentes errores varíen. Por ejemplo, identificar erróneamente un diente para extracción probablemente tenga mayores consecuencias que un error al registrar la relación molar.

Los autores del artículo también destacaron el riesgo de «alucinaciones». Los explicaron como «un tipo de error de salida en el que el modelo genera un texto fluido y coherente que no tiene ninguna relación o conexión con la entrada de audio de origen». Las transcripciones inventadas a menudo parecen convincentes pero no coinciden con el contenido hablado real. En este estudio, encontraron alucinaciones que incluían discusiones inventadas sobre restauraciones dentales o tratamientos alternativos. Es fundamental que los identifiquemos, ya que tienen el potencial de causar confusión o daño”.

Este es un documento importante para todos los médicos. Espero con interés otros avances en este campo en rápida evolución.

Traducido automáticamente
Publicación Original