Ennen kuin asiakas pystyi laajentamaan tekoälyn koulutustoimintaansa eri kielille ja markkina-alueille, sen oli saatava varmuus monikielisen datansa luotettavuudesta. Ilman sitä riskit olivat todellisia: vaihteleva laatu kieliparien välillä, eri toimittajien eri tavoin käyttämät annotointikehykset ja koulutusprosessi, joka vaati myöhemmissä vaiheissa kalliiksi käyviä korjaustoimenpiteitä.
Virallinen vertailuanalyysi oli oikea ensimmäinen askel – mutta vain, jos kaikki toimittajat noudattaisivat samoja sääntöjä. Tekoälyn koulutusprosessin kannalta tämä tarkoittaa segmenttitason johdonmukaisuutta jokaisessa annotointiulottuvuudessa. Asiakkaan vaatimukset:
-
aikaleimojen tarkka kohdistus
-
puhujien erottelu, joka säilyy myös päällekkäisessä puheessa
-
johdonmukainen aksenttien luokittelu, joka ei riipu tulkista
-
tunteiden merkintä kalibroiduilla voimakkuuspisteillä, ei subjektiivisilla merkinnöillä
-
yhdenmukaiset puheeseen liittymättömät merkit, joita kaikki merkitsijät käyttävät samalla tavalla
Pienilläkin näiden tekijöiden vaihteluilla olisi merkittäviä vaikutuksia, jolloin tietojoukot eivät olisi enää käyttökelpoisia myöhemmässä tekoälykoulutuksessa.
Kun näitä mittareita verrataan toisiinsa mitattavalla tavalla, asiakas pystyy arvioimaan luotettavasti, mitkä toimittajat pystyvät auttamaan sitä tekoälykoulutuksen laajamittaisessa laajentamisessa parhaiten.

