¿Cómo se evalúa la calidad de la traducción en GPT, Claude y DeepL?

Respuesta rápida

Comparar la calidad de traducción entre motores como GPT-4o, Claude 3.5 Sonnet y DeepL requiere tres componentes: un conjunto de pruebas representativo extraído de tus tipos de contenido y pares de idiomas reales, puntaje automatizado estandarizado usando métricas como BLEU, MetricX o COMET, y un marco de evaluación consistente aplicado de forma idéntica en todos los motores. Ningún motor único gana en todos los pares de idiomas y tipos de contenido. El objetivo práctico del benchmarking es identificar qué motor funciona mejor para tu contenido específico a gran escala, y luego enrutar automáticamente los trabajos de producción a ese motor. El AI Hub de Smartling evalúa el rendimiento del motor de forma continua y enruta cada cadena al motor de mayor rendimiento según su par de idiomas y tipo de contenido.

Por qué hacer benchmarking de motores de traducción no es sencillo

El rendimiento del motor de traducción varía significativamente según el par de idiomas, el tipo de contenido y el dominio. Un motor que produzca un buen texto de marketing en español puede rendir por debajo de la documentación técnica japonesa. Un benchmark basado únicamente en conjuntos de pruebas públicos puede no reflejar el contenido real de tu organización, lo que significa que el ganador en una evaluación estandarizada puede no ser el ganador en producción.

Los tres errores más comunes en la evaluación comparativa de traducciones son emplear un conjunto de datos de prueba demasiado pequeño, aplicar diferentes criterios de evaluación a diferentes motores de traducción y tratar una prueba comparativa como una decisión puntual en lugar de una medición continua. La calidad de traducción de LLM cambia con cada actualización del modelo, lo que significa que un motor que ocupaba el tercer puesto hace seis meses ahora puede superar al líder anterior.

 

Qué medidas medidas de puntaje automatizado realmente

 
BLEU (Suplente de Evaluación Bilingüe)

Los puntajes BLEU miden la superposición entre una salida traducida por máquina y una traducción de referencia humana, expresada como un valor entre 0 y 1. BLEU es rápida y se emplea ampliamente como referencia, pero recompensa las coincidencias superficiales de palabras más que la precisión semántica, lo que significa que una alucinación fluida puede obtener un bueno puntaje mientras que una traducción correcta pero redactada de forma diferente tiene un malo puntaje. Para benchmarking empresarial, BLEU es útil como filtro de primer paso, pero insuficiente como señal de calidad independiente.

 
MetricX y COMET

MetricX (Google) y COMET (Unbabel) son métricas de evaluación neuronal que emplean modelos de lenguaje para evaluar la calidad de la traducción comparando el texto original, la salida de la máquina y las traducciones de referencia en diferentes dimensiones semánticas. Ambos se correlacionan más fuertemente con el juicio humano que BLEU, particularmente para detectar errores fluidos y cambios de significado. Para los programas empresariales queevalúan la traducción de LLM a gran escala, MetricX y COMET proporcionan una señal más fiable que BLEU por sí solo.

 
Evaluación humana como capa de validación

Las métricas automatizadas miden la calidad de la traducción en relación con una referencia. Los evaluadores humanos valoran si una traducción funciona en contexto, mantiene la identidad de la marca y suena natural para un hablante nativo. Para los tipos de contenido de alto riesgo, la evaluación comparativa automatizada reduce el número de opciones y la evaluación humana valida al ganador antes de tomar una decisión sobre la ruta de producción.

 

Cómo ejecutar un benchmark de traducción que produzca resultados accionables

  • Construye un conjunto de pruebas representativo. Selecciona entre 200 y 500 cadenas de código fuente de tu contenido real de producción, cubriendo los pares de lenguaje, tipos de contenido y dominios que más te importan. Un benchmark basado en datos públicos genéricos de prueba no predecirá cómo se comporta un motor con tu texto de marketing, artículos del centro de ayuda o cadenas de interfaz de producto.
  • Haz que las cuerdas sean idénticas en cada motor. Envía las mismas cadenas de código fuente a GPT-4o, Claude 3.5 Sonnet, DeepL y cualquier otro motor bajo evaluación sin diferencias de preprocesamiento entre ellos. Las condiciones controladas son la única forma de aislar el rendimiento del motor de otras variables.
  • Puntua con MetricX o COMET como métricas principales. Aplica el mismo puntaje a todas las salidas. Haz un seguimiento de los puntajes por par de idiomas y tipo de contenido en lugar de promediar todos los resultados, ya que los puntajes agregados pueden ocultar una variación significativa por idioma.
  • Aplica tu memoria de traducción y glosario antes de comparar. La calidad de la traducción empresarial depende en parte de lo bien que un motor se integre con tus activos lingüísticos existentes. Compara motores bajo condiciones que incluyan tu glosario y TM en lugar de evaluar la producción bruta del motor de forma aislada.
  • Planea la medición continua. Las capacidades de traducción de los LLM cambian con cada lanzamiento de modelo. Una ejecución de benchmark es una instantánea en el tiempo. Los equipos que enrutan trabajos basar en datos de rendimiento continuos en lugar de una única decisión de benchmark mantienen mejor calidad con el tiempo.

Cuando la comparación de traducción es la prioridad adecuada

Programas empresariales que evalúan qué motor LLM o MT usar por defecto para la traducción en producción y necesitan datos objetivos y repetibles para respaldar la decisión.
Equipos que notaron variaciones de calidad entre pares de idiomas y quieren entender si enrutar diferentes pares a diferentes motores mejoraría la calidad general de la salida.
Organizaciones que están incorporando un nuevo motor y necesitan validar su rendimiento frente a su línea base de producción existente antes de cambiar.
Programas que quieren reducir el tiempo de edición humana identificando qué motor produce la salida de primera pasada más poderosa para sus tipos de contenido específicos.

Cuando puede no ser necesario un punto de referencia formal

⚠️

Programas en las primeras etapas de la adopción de traducción por IA, donde establecer flujos de trabajo básicos, glosarios y MT es la prioridad inmediata y la selección del motor puede posponer hasta que el volumen justifique la inversión en benchmarking.

⚠️

Equipos que usan una plataforma con enrutamiento de motor integrado que evalúa y enruta automáticamente, donde el benchmarking lo gestiona la plataforma en lugar de hacerlo manualmente por el equipo de localización.

¿Cómo gestiona Smartling el benchmarking y el enrutamiento del motor?

El centro de IA de Smartling evalúa la calidad de la traducción en más de 20 modelos lógicos de lenguaje (LLM) y motores de traducción automática (MT), incluidos GPT-4o, Claude 3.5 Sonnet, DeepL, Amazon Bedrock, Google Vertex y otros. El equipo de IA de Smartling realiza pruebas comparativas periódicas empleando MetricX, COMET y BLEU para evaluar el rendimiento del motor en diferentes tipos de contenido y pares de idiomas. Los resultados sirven de base para el enrutamiento de selección automática de Smartling, que asigna cada cadena al motor de mayor rendimiento para su par de idiomas y tipo de contenido específicos, en lugar de aplicar un único motor de forma universal.

Para los equipos empresariales que quieren hacer sus propias comparaciones, la plataforma de Smartling soporta perfiles LLM configurables que permiten a los equipos probar diferentes configuraciones de motores en contenido de producción antes de establecer una regla de enrutamiento por defecto.

 

Documento de ayuda: Smartling Auto Select MT

Documento de ayuda: Smartling Auto Select LLM

Calidad de traducción de benchmarks en GPT, Claude y DeepL

El AI Hub de Smartling evalúa la calidad de la traducción en más de 20 LLMs y motores de traducción automática y enruta cada cadena al motor de mayor rendimiento según su par de idiomas y tipo de contenido. Observa cómo los equipos empresariales usan Auto Select para eliminar las dudas en la selección del motor.