Avant que ce client puisse étendre son opération d'entraînement de l'IA à plusieurs langues et marchés, il avait besoin d’être sûr de la qualité de ses données multilingues. Sans cela, les risques étaient réels : une qualité incohérente entre les différentes paires de langues, des cadres d’annotation appliqués différemment par différents fournisseurs et un pipeline d'entraînement qui nécessiterait des remédiations coûteuses à terme.
Une comparaison formelle était la première étape appropriée, mais seulement si chaque fournisseur travaillait selon les mêmes règles. Pour un pipeline d'entraînement d’IA, cela signifie une cohérence au niveau des segments dans toutes les dimensions d’annotation. Ils ont exigé :
-
Un alignement précis des horodatages
-
Une séparation des locuteurs même lorsque les discours qui se chevauchent
-
Une classification des accents cohérente, indépendante de l'interprète
-
L'annotation des émotions avec des scores d'intensité calibrés, pas d'étiquettes subjectives
-
Des marqueurs non verbaux standardisés appliqués de manière identique par tous les annotateurs
De petites variations de ces facteurs auraient un impact énorme, rendant les ensembles de données inutilisables pour l'entraînement ultérieur de l’IA.
Grâce à une comparaison mesurable de ces indicateurs, le client serait en mesure d’évaluer de manière fiable les fournisseurs qui seraient les mieux à même de l’aider à étendre l'entraînement de l'IA à grande échelle.

