Snelle opschaling van de evaluatie van AI-captions in 45 talen

Als uw AI-captiontool klaar is om wereldwijd te worden ingezet, hoe zorgt u er dan voor dat uw model in elke taal kwaliteit levert? Acolad heeft in amper twee weken tijd een op maat gemaakt evaluatieproces opgezet. Hier leest u hoe dat in zijn werk ging.


Industrie en diensten

Over de klant
Een wereldwijde leverancier van creatieve software die AI-gestuurde tools ontwikkelt voor de internationale consumenten- en professionele markten.

Toen het bedrijf zijn AI-functie voor het genereren van captions bij afbeeldingen internationaal uitbreidde, moest het de kwaliteit van de output in tientallen talen beoordelen.

De uitdaging

Ervoor zorgen dat uw AI-captions in 45 talen de juiste betekenis overbrengen

Een caption kan grammaticaal correct zijn en toch volledig de plank misslaan. Een culturele verwijzing die niet aanslaat, een idiomatische uitdrukking die in de verkeerde stijl wordt gebruikt, een beschrijving van visuele content die een moedertaalspreker nooit op die manier zou formuleren – dit zijn de misstappen die de geloofwaardigheid van een product op een markt ondermijnen, en ze zijn onzichtbaar voor iemand die die taal niet spreekt.

Door het product zonder gevalideerde gegevens over de kwaliteit van de captions te lanceren, ontstaat het risico op fouten die pas aan het licht zouden komen nadat het product al aan internationale gebruikers was voorgesteld.

Er was een tweede risico: governance. Beoordelingsgegevens die zijn verzameld aan de hand van inconsistente beoordelingscriteria in 45 talen zijn niet vergelijkbaar – en inconsistente gegevens kunnen niet bijdragen aan de verbetering van het model. De waarde van de evaluatie hing volledig af van het feit dat alle reviewers dezelfde criteria hanteerden.

person editing video on two monitors

"Als je pas na de lancering ontdekt dat uw AI-captions in een bepaalde markt niet werken, is dat een heel ander probleem dan wanneer u dat al eerder ontdekt. De kosten – zowel op het vlak van reputatie als op operationeel vlak – zijn niet vergelijkbaar. Daarom moet de evaluatie plaatsvinden voordat het product bij de gebruikers terechtkomt, en niet daarna."

 

Jennifer Nacinelli, programmamanager AI-gegevens, Acolad

Voed uw AI met hoogwaardige, meertalige data op schaal

Acolad levert gerichte, nauwkeurige en betrouwbare datasets om de best mogelijke prestaties op het gebied van AI en machine learning te garanderen.

square-62
De oplossing

Een compleet meertalig evaluatieprogramma - ontwikkeld en uitgevoerd in twee weken

Acolad heeft op maat gemaakte evaluatierichtlijnen en beoordelingsschema’s voor het project ontworpen en de klant geadviseerd over kwaliteitscriteria en culturele aspecten die per taal en regio verschillen. Elke reviewer was:

  • Een moedertaalspreker, geen gevorderde leerling

  • Geïnformeerd over de specifieke kwaliteitsaspecten die van belang zijn voor visuele captions gegenereerd door AI

  • Consistente beoordelingscriteria hanteren - en niet op basis van persoonlijk taalgevoel

Alle contacten met de reviewers werden via één aanspreekpunt afgehandeld, waardoor een consistente briefing en kwaliteitscontroles gedurende het hele traject werden gewaarborgd.

De levering vond gefaseerd plaats, afgestemd op de prioritaire markten van de klant:

  • Week 1: 10 prioritaire talen - Frans, Italiaans, Duits, Spaans en een aantal Aziatische talen

  • Week 2: de overige 35 talen

Het workflowbeheer was afgestemd op de bestaande processen van de klant en uitgevoerd in op Excel gebaseerde workflows om overhead bij het in gebruik nemen van het platform te vermijden en ervoor te zorgen dat de toewijzing van reviewers en de kwaliteitscontrolepunten tijdens het hele proces voor de klant zichtbaar blijven.

De resultaten in een oogopslag

45 talen

Beoordeeld met oog voor culturele nuances

Klaar voor lancering

Snel geleverde AI-captions

Risico tot een minimum beperkt

Voor wereldwijde uitbreiding van nieuwe AI-captiontools

De resultaten

De wereldwijde lancering van een AI-captiontool zonder zorgen over de kwaliteit

Alle 45 talen zijn binnen een termijn van twee weken geleverd. De klant ontving evaluaties die taalkundig correct en cultureel onderbouwd waren - opgesteld door moedertaalsprekers die in alle onderzochte markten dezelfde criteria hanteerden.

In plaats van op basis van aannames over te gaan tot een internationale uitrol, beschikte het productteam over door mensen geverifieerde gegevens waaruit bleek op welke punten de AI-captiontool aan de standaard voldeed en op welke punten aanpassingen nodig waren vóór de lancering. Dat is het verschil tussen een op gegevens gebaseerde beslissing over de uitrol en een reactieve beslissing.

Met deze opdracht heeft Acolad zich geprofileerd als voorkeurspartner van de klant voor grootschalige AI-evaluatieprojecten, wat werd bevestigd door de voortzetting van de samenwerking na de eerste oplevering.

freelancer-avatars-centered 1

Op zoek naar betrouwbare diensten voor evaluatie van AI-data op grote schaal?