Før denne klient kunne skalere deres AI-træning på tværs af sprog og markeder, havde de brug for tillid til deres flersprogede data. Uden det var risiciene reelle: inkonsistent kvalitet på tværs af sprogpar, annoteringsrammer, der anvendes forskelligt af forskellige leverandører, og en træningsforberedelse, der ville kræve dyr afhjælpning senere i forløbet.
En formel benchmark var det rigtige første skridt – men kun hvis alle leverandører arbejdede efter de samme regler. For forberedelsen af en AI-træning betyder det konsistens på segmentniveau på tværs af alle annoteringsdimensioner. De krævede:
-
Præcis tilpasning af tidsstempler
-
Adskillelse af talere, der holder på tværs af overlappende tale
-
Accentklassificering, der er konsistent og ikke afhængig af tolken
-
Emotionsmærkning med kalibrerede intensitetspoint, ikke subjektive klassificeringer
-
Standardiserede nonverbale markører, der anvendes identisk af alle annotatorer
Små variationer i konsistensen af disse faktorer ville have en enorm indflydelse – og gøre datasæt ubrugelige til efterfølgende AI-træning.
Med en målbar sammenligning på tværs af disse standarder ville kunden være i stand til pålideligt at evaluere leverandører, der bedst kunne hjælpe dem med at udvide AI-træning i stor skala.

