Avant de pouvoir développer ses activités d’entraînement de modèles d’IA dans plusieurs langues et marchés, ce client devait pouvoir se fier à ses données multilingues. Sans cela, les risques étaient réels : qualité inégale entre les paires de langues, cadres d’annotation appliqués différemment selon les fournisseurs et pipeline d’entraînement nécessitant des corrections coûteuses ultérieurement.
Une analyse comparative formelle constituait la première étape logique, mais uniquement si tous les fournisseurs appliquaient les mêmes règles. Dans le cas d’un pipeline d’entraînement d’IA, cela signifie une cohérence au niveau des segments pour chaque dimension d’annotation. Les exigences étaient les suivantes :
-
Alignement précis des horodatages
-
Séparation des locuteurs fiable, y compris lorsque les voix se chevauchent
-
Classification des accents cohérente et non dépendante de l’interprète
-
Annotation des émotions avec des scores d’intensité étalonnés, et non des catégories subjectives
-
Marqueurs normalisés pour les éléments non verbaux appliqués de manière identique par tous les annotateurs
De petites variations de cohérence dans ces facteurs auraient une incidence énorme, rendant les ensembles de données inutilisables pour l’entraînement ultérieur de modèles IA.
Grâce à une comparaison mesurable basée sur ces indicateurs, le client pouvait évaluer de manière fiable les fournisseurs les mieux à même de l’aider à développer son entraînement IA à grande échelle.

