RIVM: Een update van de WHO-termbase versnellen met veilige AI en validatie door deskundigen

Hoe het RIVM en Acolad de ICD-11 van de WHO naar het Nederlands hebben vertaald met behulp van een speciale AI-engine en onder toezicht van deskundige vertalers.


Over het RIVM

RIVM (Rijksinstituut voor Volksgezondheid en Milieu) is een onderzoeksinstituut van de Nederlandse overheid dat valt onder het Ministerie van Volksgezondheid, Welzijn en Sport. Het instituut verricht onderzoek en geeft onafhankelijk wetenschappelijk advies op het gebied van volksgezondheid, gezondheidszorg en milieubescherming. 

In het kader van deze werkzaamheden onderhoudt het RIVM de Nederlandstalige versie van internationale gezondheidsclassificaties, waaronder de Internationale Classificatie van Ziekten (ICD) van de WHO – een taak die zich uitstrekt over Nederland, het Caribisch Nederland en andere Nederlandstalige gebieden, waar een consistente classificatie de basis vormt voor vergelijkbare gezondheidsstatistieken. 

De uitdaging

Een nationale ziekteclassificatie aanpassen aan een wereldwijde standaard

De ICD is de wereldwijde standaard voor het registreren en classificeren van ziekten, gezondheidstoestanden en doodsoorzaken. Deze standaard, die door de WHO wordt beheerd, stelt landen in staat om gezondheidsstatistieken op te stellen die internationaal vergelijkbaar zijn. De WHO heeft eind 2027 vastgesteld als de datum waarop de lidstaten moeten beginnen met het rapporteren van sterfte- en ziektecijfers volgens de nieuwste versie, ICD-11.

De overgang van ICD-10 naar ICD-11 is ingrijpend: naast ongeveer 1,5 miljoen woorden aan nieuwe en herziene inhoud brengt deze ook structurele veranderingen en nieuwe hoofdstukken met zich mee. Eerdere revisies werden gedurende lange perioden handmatig door specialisten vertaald – een aanpak die nog steeds werkt, maar die wordt beperkt door de beschikbare capaciteit van deskundigen. Met een vaste deadline en een vastomlijnd budget moest het RIVM een afweging maken tussen snelheid en nauwkeurigheid, waarbij nauwkeurigheid voorop stond: aangezien de ICD een classificatiesysteem is en geen gewone tekst, kan één verkeerde term ertoe leiden dat een diagnose onder de verkeerde code wordt geschaard, waardoor de daaruit voortvloeiende statistieken een vertekend beeld geven.

Een betrouwbare Nederlandse versie is ook buiten Nederland van belang. Zorgverleners leggen gegevens vast en communiceren in het Nederlands, en het RIVM is verantwoordelijk voor de classificatie in alle Nederlandstalige regio’s – waardoor het de basis vormt waarop vergelijkbare gezondheidsgegevens berusten. 

doctor on tablet during clinical research study
square-60
De aanpak

Ontwikkeling van een speciale RIVM-AI-engine, met menselijke expertise

Het RIVM en Acolad zagen de update van de ICD-11 als een kans om AI op grote schaal toe te passen voor een project met zeer gespecialiseerde terminologie, waarbij geautomatiseerde vertaling werd gecombineerd met beoordeling door deskundigen om de nauwkeurigheid, consistentie en bruikbaarheid te waarborgen.

Een speciale, veilige AI-engine. We hebben een projectspecifieke engine ontwikkeld, die is getraind op basis van de bestaande terminologie van het RIVM en draait binnen de eigen beveiligde omgeving van Acolad, om zo de beveiliging te bieden die vereist is voor de overheid.

Een schaalbare workflow. Eerst getest op een steekproef van de termen waarvan het RIVM verwachtte dat ze het moeilijkst zouden zijn, voordat de methode op de volledige classificatie werd toegepast.

Beoordeling door deskundigen. Taalkundigen met expertise op het gebied van vakspecifieke terminologie hebben de AI-output beoordeeld op taalkundige kwaliteit – een extra waarborg die automatische scoring alleen niet kon bieden. 

1,5 miljoen woorden

Vertaald uit het Engels naar het Nederlands

100.000 synoniemen

Door AI gegenereerd ter ondersteuning van zoekopdrachten

2 jaar

Beoordeling door deskundigen is momenteel aan de gang
De resultaten

Een eerste Nederlandse conceptversie is ingediend, en daarmee is de basis gelegd voor een beoordeling door deskundigen

Het project heeft een volledig eerste concept van de Nederlandse versie van de bijgewerkte classificatie opgeleverd, dat op taalkundige kwaliteit is beoordeeld en klaar is voor validatie door de deskundigen van het RIVM.

Het RIVM had behoefte aan een degelijke basisvertaling van goede kwaliteit – geen kant-en-klaar eindproduct, maar een betrouwbare basis voor de deskundige beoordeling die een classificatie van dit belang vereist. Dat is wat het project heeft opgeleverd. Het instituut geeft duidelijk aan dat het volledige beeld van de efficiëntie zich nog aan het ontwikkelen is: aangezien kwaliteit voorop staat, wordt de output grondig geëvalueerd, en de uiteindelijke nettobesparing zal afhangen van dat onderzoek.

Waardevolle AI-ervaring voor beide organisaties

Zowel voor het RIVM als voor Acolad betekende het project een belangrijke stap in de toepassing van AI bij grootschalige terminologiewerkzaamheden. Het gaf een duidelijk inzicht in hoe veilige automatisering en deskundige menselijke validatie hand in hand kunnen gaan: AI zorgt voor snelheid en schaalgrootte, terwijl menselijke expertise de nauwkeurigheid, de context en de integriteit van de classificatie waarborgt.

Twee lessen sprongen eruit. Ten eerste bleek menselijke beoordeling van onschatbare waarde voor een project dat zo veeleisend was, aangezien geautomatiseerde kwaliteitsbeoordeling niet altijd optimaal werkt bij inhoud zoals termbases. Ten tweede verloopt een door AI ondersteund vertaalproces anders dan een vaststaand handmatig vertaalproces. De eerste fase verloopt wat trager en begint met voorbereidende werkzaamheden: het leggen van de basis door middel van gegevensverzameling en -opschoning, het opzetten van een vertaalgeheugen, het ontwikkelen van prompts en het bouwen van een op maat gemaakte vertaalmachine. Zodra dat is geregeld, verloopt de workflow sneller en op grotere schaal, waarbij een grondige evaluatie de essentiële volgende stap is.

Vooruitzichten

De omvang van het project komt tot uiting in de volgende fase: De beoordeling door de deskundigen van het RIVM is inmiddels van start gegaan en zal naar verwachting ongeveer twee jaar in beslag nemen. Een onderdeel van dat werk bestaat uit het verfijnen van de door AI gegenereerde synoniemen: sommige zijn weliswaar taalkundig correct, maar moeten binnen de hiërarchie worden herschikt, zodat aandoeningen op de juiste plaats worden gecodeerd en geteld, zoals een statistische classificatie vereist.

Voor het RIVM is de ervaring die het project zelf oplevert een belangrijk resultaat: een duidelijker beeld van waar AI helpt en waar menselijke expertise onmisbaar is, en waardevolle inzichten in hoe beide het beste kunnen samenwerken.

“Elke organisatie maakt steeds meer gebruik van AI, en hoe meer projecten je uitvoert, hoe meer je leert en hoe meer ervaring je opdoet. Het is iets wat je kunt delen, en je leert er als instelling ook van.”

Joost Wammes
Projectleider, RIVM
freelancer-avatars-centered 1

Wilt u bij uw volgende project de schaalbaarheid van AI combineren met een deskundige menselijke beoordeling?