DeepL AI Labs

En modell för översättning, en modell för utvärdering: Hur vi utvecklar systemet för kvalitetsbedömning av översättningskvalitet hos DeepL

Problemet med AI-översättningar är att de ser perfekta ut, även när de inte är det. Eftersom felen inte är uppenbara vid första anblicken måste man lita på AI-modellens ord om att allt är korrekt. Det enda alternativet är att be språkexperter att gå igenom arbetet, rad för rad, och leta efter fel, ofullständiga översättningar och subtila betydelseförändringar som en icke-expert sannolikt skulle missa.

Detta oändliga behov av granskning är ett av de vanligaste klagomålen som översättningsteam har när det gäller AI-översättningar. Det väcker en grundläggande fråga för alla som bedriver AI-forskning inom språk. Hur kan maskinöversättningar vinna förtroendet hos de organisationer som förlitar sig på dem? Hur kan de undvika att be mänskliga granskare att gå igenom det arbete de redan har utfört, bara för att vara på den säkra sidan?

Att bygga en oberoende TQE-AI-modell för DeepL

Det visar sig att AI kan lösa detta problem, men det går inte att göra det med samma AI-modell som skapade översättningen från början. Kvalitetstester har visat att när stora språkmodeller (LLM) granskar översättningar, gynnar de resultaten från sin egen modell och missar dess potentiella svagheter. När det gäller AI kan man inte vinna förtroende genom att be en modell att kontrollera sitt eget arbete. Däremot kan man göra det genom att bygga och träna en annan modell som är helt inriktad på att identifiera eventuella fel eller missförstådda betydelser.

Det är just vad DeepL:s senior produktchef Marta Danylenko, seniorforskaren Martin Berger och resten av teamet bakom vårt verktyg för kvalitetsbedömning av översättningskvalitet (TQE) har arbetat med. De har utvecklat en oberoende TQE-AI-modell med ett specifikt syfte: att stresstesta översättningar och kategorisera eventuella fel eller potentiella fel som kunderna bör känna till.

Så här fungerar TQE i praktiken

TQE:s expertredaktör går igenom översättningarna segment för segment och visar källtexten och den översatta texten sida vid sida. I en separat kolumn markeras eventuella potentiella problem med översättningen, med en allvarlighetsgrad i kategorierna ”Kritisk”, ”Större” eller ”Mindre”. Mänskliga granskare kan hoppa till varje potentiellt problem, granska segmentet, redigera översättningen direkt, markera det som löst eller alternativt bara bortse från flaggan.

Detta väcker en uppenbar fråga, som Marta och Martin ofta får svara på:  Om TQE vet att felen finns där, varför kan det inte bara gå vidare och rätta till dem? Varför involvera mänskliga granskare överhuvudtaget? Anledningen handlar om felens natur. Och det är en direkt följd av AI:s natur.

AI vinner mest förtroende genom att identifiera de fel som den inte kan åtgärda

AI-modeller är i grunden probabilistiska. De gör mycket aggregerade, statistiska gissningar med otrolig noggrannhet, men det är fortfarande bara gissningar – och ibland har de fel. När avgörande sammanhang saknas ökar sannolikheten för detta. En annan modell kan upptäcka avvikelsen och den potentiella tvetydigheten, men kan inte åtgärda den utan att göra en ny gissning. Det är mycket bättre att involvera en människa.

Ibland beror bristen på sammanhang som leder till felaktiga gissningar på implicit kunskap: något som AI:n inte kan veta men som en mänsklig översättare skulle veta. Ibland beror det på källtextens egen karaktär. Den kan innehålla grammatiska fel som förvirrar AI-modellen. Den kan till och med innehålla avsiktliga grammatiska fel som är ett val av stil. En AI-översättare måste fylla i luckorna genom att gissa sig till avsikt och innebörd. En modell som är specialutvecklad för kvalitetsbedömning kan upptäcka denna avvikelse från originalet och markera den.

Avvägningen mellan precision och återhämtning: Hur strikt bör en TQE-modell vara?

För Martin, Marta och teamet började de riktigt intressanta diskussionerna med frågan om hur man ska kategorisera dessa ”fel” i översättningen och hur allvarliga de olika felen ska betraktas. De började med att använda det sedan länge etablerade ramverket Multi-dimensional Quality Metrics (MQM) för översättningskvalitet, som fokuserar på områden som grammatik, stavning och läsbarhet, samt på huruvida en översättning exakt stämmer överens med källtexten. 

I samarbete med språkexperter insåg teamet dock snabbt att typerna av fel förändras när det gäller en översättning som skapats av AI istället för av en människa. Det finns inga stavfel i maskinöversättningar. Däremot finns det många tillfällen då bristen på implicit kunskap blir uppenbar.

Därför har målet med TQE aldrig varit att ersätta mänskliga granskare. Genom att kombinera en översättningsmodell med en utvärderingsmodell säkerställer vi att AI kan upptäcka sina egna begränsningar och koppla in granskarna där det behövs, vilket sparar dem värdefull tid. De förblir en väsentlig del av processen. Målet är att göra det möjligt för dem att arbeta med AI på ett mer tillfredsställande sätt.

Detta kräver en balans: mellan att flagga alla typer av potentiella fel, vilket skapar mer arbete för granskarna, och att endast utfärda varningar för de fel som har allvarliga konsekvenser. Därför var diskussionerna kring vad som utgör ett kritiskt, större eller mindre översättningsfel några av de mest intressanta under utvecklingen av TQE. 

Att samarbeta med kunderna för att skapa den bästa versionen av TQE

Att kalibrera hur strikt TQE ska vara är ett av många områden där vi samarbetar med kunderna för att förfina modellen. Vi integrerar DeepL:s anpassningsfunktioner, såsom ordlistor och stilregler, för att ge modellen mer kontextuell kunskap. Vi har gjort TQE tillgängligt som ett API, och vi lägger även till förslag på hur man kan åtgärda fel samt alternativ för att godkänna och avvisa dem i bulk.

Många av dessa utvecklingar bygger på insikter som delats av kunder som arbetar med vårt TQE-testverktyg. Om du vill vara med och utveckla detta nästa steg inom AI-översättning är du välkommen att kontakta oss för att begära åtkomst till testmiljön. Vi vill gärna höra hur TQE fungerar för dig.

Är du intresserad av att få tillgång till vår TQE-testmiljö? Skicka ett e-postmeddelande till marta.danylenko@deepl.com.

Dela

Håll kontakten

Få en förhandsvisning av våra senaste AI-innovationer.