Benchmarking van meertalige datatranscriptie voor een internationaal AI-bedrijf

In het kader van zijn ontwikkeling van AI-modellen heeft een internationaal AI-bedrijf een formele benchmark voor datatranscriptie uitgevoerd, waarbij leveranciers in vier talen werden getest. Acolad behaalde een foutpercentage van 0–1% en eindigde op de eerste plaats, waardoor onze klant in staat werd gesteld om schaalbare, meertalige AI te ontwikkelen. Hier leest u hoe dat in zijn werk ging.

 


Industrie en diensten

Over de klant
Een internationaal technologiebedrijf dat producten aangestuurd door AI ontwikkelt die voor het trainen van modellen afhankelijk zijn van hoogwaardige meertalige audiogegevens.

Omdat het bedrijf op meerdere markten actief is, had het behoefte aan een gestructureerde, meetbare vergelijking van leveranciers om er zeker van te zijn dat het over het beste meertalige datatranscriptieproces beschikte voor vier talen - Frans, Duits, Spaans en Portugees - ter ondersteuning van de training van zijn AI-model.

De uitdaging

Hoe trainingsgegevens voor audio-AI met vertrouwen opschalen naar verschillende talen

Voordat deze klant zijn AI-trainingsactiviteiten naar verschillende talen en markten kon uitbreiden, moest hij eerst vertrouwen hebben in zijn meertalige gegevens. Zonder dit waren de risico’s reëel: wisselende kwaliteit tussen de verschillende talencombinaties, annotatiekaders die door verschillende leveranciers op uiteenlopende wijze werden toegepast, en een trainingspijplijn die op termijn kostbare corrigerende maatregelen zou vereisen.

Een formele benchmark was de juiste eerste stap - maar alleen als alle leveranciers zich aan dezelfde regels zouden houden. Voor een AI-trainingspijplijn betekent dit consistentie op segmentniveau voor elke annotatiedimensie. Ze eisten:

  • Nauwkeurige afstemming van tijdstempels

  • Spreker-isolatie die ook bij overlappende spraak behouden blijft

  • Een accentclassificatie die consistent is en niet afhankelijk is van de tolk

  • Emotie-tagging met gekalibreerde intensiteitsscores, in plaats van subjectieve labels

  • Gestandaardiseerde niet-spraakgerelateerde markers die door alle annotatoren op identieke wijze worden toegepast

Zelfs kleine variaties in deze factoren zouden enorme gevolgen hebben - waardoor datasets onbruikbaar worden voor verdere AI-training.

Door deze metrieken met elkaar te vergelijken, kan de klant op betrouwbare wijze beoordelen welke leveranciers het best in staat zijn om te helpen bij het uitbreiden van AI-training op grote schaal.

concept of fingers typing on keyboard with data streaming as abstract red orange waves

"Het is niet alleen onze taak om gegevens te leveren, maar ook om klanten het vertrouwen te geven om op te schalen. Wanneer een klant de transcriptie in vier talen tegelijk vergelijkt, moet kwaliteit vanaf het begin in de productieomgeving geïntegreerd worden, en niet pas achteraf worden beoordeeld."

 

Jennifer Nacinelli, programmamanager AI-gegevens, Acolad

Voed uw AI met hoogwaardige, meertalige data op schaal

Acolad levert gerichte, nauwkeurige en betrouwbare datasets om de best mogelijke prestaties op het gebied van AI en machine learning te garanderen.

square-56
De oplossing

Een op maat gemaakte workflow voor gegevensannotatie, tot stand gebracht volgens specifieke richtlijnen

Acolad heeft voor dit project een op maat gemaakte module voor transcriptie en tagging ontwikkeld, waarbij de richtlijnen van de klant rechtstreeks in de productieomgeving zijn geïntegreerd. Elke functie was gericht op een specifieke storingsmodus:

  • Door de tijdstempels op segmentniveau te regelen, werd de afwijking bij de bron verholpen

  • Spreker-isolatie en het classificeren van accenten gebeurt binnen dezelfde interface, waardoor fouten bij het doorgeven worden verminderd

  • Emotie-tagging met intensiteitsbeoordeling via gestructureerde invoervelden, niet via vrije tekst

  • Geautomatiseerde kwaliteitscontroles die tijdens de verwerking worden geactiveerd, voordat een menselijke review plaatsvindt

  • Laatste validatieronde vóór levering, met gedocumenteerde bevindingen ten behoeve van de benchmarkanalyse van de klant

De voorlopige transcriptie op basis van automatische spraakherkenning (ASR = automatic speech recognition) werd gecombineerd met AI-ondersteunde post-editing volgens de projectrichtlijnen - en menselijk toezicht in elke fase waarin de interpretatie van de richtlijnen een beoordeling vereiste.

De klant ontving niet alleen de gegevens, maar ook het auditspoor om deze onder dezelfde voorwaarden te kunnen vergelijken met die van alle concurrerende leveranciers.

De resultaten in een oogopslag

Nr. 1

Acolad scoorde beter dan alle concurrerende leveranciers

4

Talen die gelijktijdig worden aangeleverd

0-1%

Algemeen foutenpercentage

Alle cijfers zijn afkomstig uit een benchmarkreview van de eigen aanbieder van de klant.
De resultaten

Een betrouwbare, meertalige gegevensbasis voor schaalbare AI

Acolad scoorde beter dan alle concurrerende aanbieders in de benchmarkgroep. Uit de eigen analyse van de klant bleek een foutenpercentage van 0–1% over de volledige geëvalueerde dataset.

De bevindingen met betrekking tot het taalniveau werden op transparante wijze vastgelegd: er werden geen fouten gemeld in het Spaans en het Portugees, en slechts enkele kleine fouten in het Frans en het Duits.

De klant beschikt nu over een leveranciersselectie die is gebaseerd op feiten, en niet op veronderstellingen. En een productieworkflow die schaalbaar is binnen een gereguleerde annotatieomgeving - met dezelfde kwaliteitscontroles die ervoor zorgden dat de benchmark succesvol was.

Nu hebben ze de mogelijkheid om hun AI-modellen te trainen op basis van betrouwbare meertalige gegevens - en hun meertalige AI-trainingsactiviteiten op productieschaal uit te voeren.

freelancer-avatars-centered 1

Op zoek naar betrouwbare datatranscriptie op grote schaal?