2025-05-21 · Baduno toimetus · 6 blog.readMin · Blogi ja teadmised
Masintõlke äratundmine: Seitse tüüpilist veamustrit
AI-tõlked on muutunud heaks – ka nende vead: harvemad, kuid peenemad. Kuidas kontrollijad need ära tunnevad enne, kui kliendid seda teevad.
Silmatorkavad neli
Valed sõbrad ('eventuell' muutub 'eventually'), ebajärjekindlad erialaterminid samas tekstis, sõnasõnalised väljendid ja kõnetluse katkestused 'sina' ja 'teie' vahel: need klassikud leiab harjunud silm minutitega.
Peened kolm
Enesekindlalt valed numbrid ja pärisnimed, kultuuriliselt vildakad näited ja liiga sile ühtlane toon, mis silub iga brändivärvi. Ohtlik, kuna tekst näeb veatu välja – see lihtsalt pole õige.

Süstemaatiline kontroll
Masinad kontrollivad struktuuri (numbrid, kohaotsijad, täielikkus, terminoloogia), inimesed kontrollivad tähendust ja mõju – selles järjekorras, dokumenteeritud tulemusega. Valimud ei asenda süstemaatilisust rahalehtedel.
Mõju ostjatele
Ärge küsige teenusepakkujatelt, kas nad kasutavad AI-d – küsige, kuidas nad selle vigu leiavad. Kes ei suuda kontrolliprotsessi kirjeldada, sellel seda pole. Meie vastus on avalikult sellel veebisaidil.
Eksitavad idioomid ja metafoorid
Masintõlked ebaõnnestuvad sageli idioomide puhul, mida ei saa üks-ühele üle kanda. Näiteks muutub 'to kick the bucket' saksa keeles kiiresti 'den Eimer treten', kuigi õige väljend on 'den Löffel abgeben'. Ka metafoore nagu 'the ball is in your court' tuleks kohandada vastavalt sihtturule, näiteks 'Sie sind am Zug'. Kontrollijad peavad siin tuvastama mitte ainult sõnasõnalise tähenduse, vaid ka soovitud mõju. Tüüpiline näide: 'break a leg' tõlgitakse tihti kui 'brich dir ein Bein', mida saksa keeles mõistetakse halva soovina – õige on 'Hals- und Beinbruch'. Turundustekstides võivad sellised vead olla piinlikud ja moonutada sõnumit. Seetõttu peaksid kontrollijad otsima lähtetekstist levinud idioome ja kontrollima nende sihtkeele vastet käsitsi. Hea töövoog: AI tõlgib, kontrollija märgistab kõik idioomid ja valideerib need referentsandmebaasi või emakeelekõneleja tundepõhja abil.
Vead numbrite, kuupäevade ja vormingutega
AI-tõlked käsitlevad numbreid sageli õigesti, kuid mitte alati – eriti tuhandete eraldajate, kümnendike eraldajate ja kuupäevavormingute puhul. USA kuupäev '03/04/2024' võib tähendada 3. aprilli või 4. märtsi. Valuutad: '$1.50' muutub saksa keeles '1,50 $', kuid mõned AI-d jätavad koma ära või panevad punkti. Ka mõõtühikud: '10 miles' peaks olema '16 kilometer', mitte '10 Meilen'. Veel keerulisemad on protsendimäärad kultuuriliste erinevustega: 'a 50% increase' võib tähendada 'kasv 50 % võrra' või '150 %-ni'. Seetõttu peaksid kontrollijad süstemaatiliselt võrdlema kõiki numbreid, kuupäevi, ühikuid ja valuutasid lähtetekstiga. Kontrollnimekiri aitab: kontrollige kümnendike eraldajaid, kuupäevavormingut (PP.KK.AAAA vs. KK/PP/AAAA), valuutasümboleid (€ vs. $) ja ühikuid (km vs. miilid). Eriti oluline veebipoodide hindade puhul – vale koma võib hinna kümnekordistada. Dokumenteerige iga kõrvalekalle ja korrigeerige vorming vastavalt sihtkeele reeglitele.
Valed pärisnimed ja kaubamärgid
Pärisnimesid, kaubamärke ja tootenimetusi ei tohiks reeglina tõlkida. Kuid tehisintellekt kipub neid siiski tõlkima: 'Apple' saab 'Apfeliks', 'Microsoft' saab 'Mikrosoftware'ks. Veel kriitilisem: erialased terminid nagu 'SAP' või 'CRM' asendatakse mõnikord oletatavate vastega ('Sotsialistlik Töölispartei' asemel süsteemid). Ka akronüüme nagu 'NASA' ei tohiks lahti kirjutada, välja arvatud juhul, kui sihtkultuur kasutab tõlget. Kontrollijad peavad seega haldama terminibaasi, mis määrab, millised nimed säilitatakse. Kontrollimisel tuleks kõik pärisnimed, ettevõtete nimed, tootenimetused ja akronüümid märgistada ja võrrelda selle andmebaasiga. Sage viga: 'Köln Bonn Airport' muutub 'Cologne Bonn Airport'iks – olenevalt sihtkeelest võib mõlemad olla õiged, kuid järjepidevus on otsustav. Dokumenteerige iga otsus, et hilisemates tõlgetes käsitletakse sama nime ühtselt.
AI-tõlked on muutunud heaks – ka nende vead: harvemad, kuid peenemad. Kuidas kontrollijad need ära tunnevad enne, kui kliendid seda teevad.
Pikaajalise konteksti ja uuendamise puudumine
Masintõlked arvestavad enamasti ainult praegust lauset või lõiku, mitte kogu teksti või varasemaid sama kliendi tõlkeid. See toob kaasa ebakõlasid korduvate mõistete, fraaside või sõnumite puhul. Näide: Ettevõte muudab oma sloganit 'Quality first' asemel 'Quality & Speed'. AI tõlgib uue teksti õigesti, kuid kõik vanad tõlked jäävad alles – külastajad näevad erinevatel lehtedel erinevaid väiteid. Ka tootelansside puhul: üks versioon kannab nime 'Pro 2024', järgmine 'Pro 2025'. Ilma pikaajalise kontekstita tõlgib AI võib-olla 'Pro 2024' kui 'Pro 2024' ja 'Pro 2025' kui 'Pro 2025', kuid kui klient soovib, et kaubamärgi nimi jääks alati tõlkimata, peab see kehtima globaalselt. Kontrollijad peaksid seetõttu enne tööd tutvuma kliendi stiilijuhistega ja kontrollima olemasolevaid tõlkeid järjepidevuse suhtes. Veel parem: kasutada masintõlkesüsteeme, millel on tõlkemälu (TM), mis tunneb ära varasemad tõlked. Siiski jääb inimkontroll asendamatuks, et tagada kaubamärgi identiteedi ühtsus kõigis kanalites.
Vead URL-ides, metaandmetes ja hreflang-märgendites
Masintõlked keskenduvad enamasti nähtavale tekstile ja eiravad tehnilisi elemente nagu URL-id, metaandmed ja hreflang-märgendid. Ometi on need mitmekeelse otsingumootori optimeerimise (SEO) jaoks hädavajalikud. Tüüpilised vead: AI tõlgib URL-i sluget, kuigi need peaksid enamasti muutmata jääma – "/de/produkte" muutub ekslikult "/en/products", mis viib surnud linkideni. Ka meta-pealkirju ja -kirjeldusi tõlgitakse sageli automaatselt, arvestamata märgipiiranguid: 160 märgiga saksakeelsed meta-kirjeldused on inglise keelde tõlgituna sageli liiga pikad ja lõigatakse ära. Eriti kriitilised on hreflang-märgendid: need HTML-märgendid näitavad otsingumootoritele lehe keeleversioone. AI võib kogemata seada hreflang="de" ingliskeelsele lehele või suunata kanoonilise URL-i valele keeleversioonile. Tagajärg: otsingumootorid indekseerivad valed lehed või karistavad dubleeritud sisu eest. Seetõttu peaksid kontrollijad pärast tõlget süstemaatiliselt läbi vaatama kõik lingid, metaandmed ja hreflang-märgendid. Kasutage tööriistu nagu Screaming Frog või tehke käsitsi valikuid. Jälgige, et URL-i struktuurid jääksid järjepidevaks (nt /de/, /en/ keelerajadena) ja metaandmed oleksid keelepõhiselt optimeeritud. Dokumenteerige iga kohandus, et säilitada tulevaste tõlgete tehniline raamistik.
Õigustekstide ja ohutusjuhiste lokalisatsioon
Õigustekstid, nagu üldised tingimused, privaatsusteated või teabelehed, sisaldavad sageli standardiseeritud sõnastust, mida AI tõlgib küll sõnasõnalt õigesti, kuid õiguslikult ebapiisavalt. Nii saab saksakeelsest „Einwilligung gemäß Art. 6 DSGVO” inglise keeles tihti üldise „consent according to law”, ilma konkreetset õiguslikku alust nimetamata. See võib kaasa tuua hoiatuskirju. Ka toodete ohutusjuhised on eriti haavatavad: hoiatusi nagu „Nicht in die Hände von Kindern gelangen lassen” nõrgendab AI mõnikord („Keep out of reach” asemel „Keep out of reach of children”). Euroopas on täpsed hoiatused seadusega ette nähtud; ebatäpsused ohustavad tootevastutust. Seetõttu peaksid kontrollijad õigustekste kontrollima mitte ainult keelelise õigsuse, vaid ka õigusliku samaväärsuse osas. Tõestatud meetod: looge glossaar kohustuslike tõlgetega klauslite, paragrahvide ja õigusmõistete jaoks. Tehke koostööd emakeelse kõnelejaga, kes tunneb sihtriigi õigussüsteemi. Laske lõpuks üle vaadata juristil. AI võib töövoogu kiirendada, kuid vastutus jääb ettevõttele – seetõttu on süstemaatiline inimkontroll hädavajalik.
Hreflang-märgendid ja SEO: nähtamatud komistuskivid
Kuigi keelevead torkavad kohe silma, kahjustavad nähtamatud vead lähtekoodis teie mitmekeelse veebisaidi leitavust. Masintõlked annavad sageli korrektse teksti, kuid unustavad hreflang-märgendite, metaandmete ja URL-struktuuride kohandamise. Tüüpiline näide: AI tõlgib sisu, kuid hreflang-atribuut viitab endiselt algsele lehele – otsingumootorid kuvavad siis otsingutulemustes vale keeleversiooni. Samuti jäetakse sageli tähelepanuta meta-pealkirjade ja -kirjelduste tõlkimine, nii et teie leht on küll saksakeelne, kuid kuvatakse ingliskeelsete lõikudena. Veel kriitilisem: kui AI tõlgib lehe pealkirja, kuid jätab URL-i muutmata, tekivad dubleeritud sisu probleemid. Seetõttu peaksid kontrollijad süstemaatiliselt iga lehte kontrollima SEO-elementide täieliku lokalisatsiooni osas: hreflang, canonical, meta-kirjeldus, alt-tekstid ja URL-id. Viga on lähtekoodis: puuduv keelekood või vale regioon (de-DE asemel de-AT) võib teie rahvusvahelise nähtavuse rikkuda. Meie kontroll hõlmab seetõttu mitte ainult nähtavat teksti, vaid ka lokalisatsiooni tehnilist infrastruktuuri. Ainult nii tagate, et teie sisu leitakse kõigil sihturgudel – ilma masinliku hooletusest tingitud reitingukaotusteta.
Terminoloogiahaldus kui kvaliteediankur
Üks suurimaid väljakutseid masintõlke puhul on erialaterminite ebajärjekindel kasutamine. Kuigi üksik tekst võib tunduda veatu, ilmneb võrdlusel sama kliendi varasemate tõlketega sageli tõsiseid lahknevusi. Tehisintellektil puudub mälu ettevõtte enda sõnavara jaoks – see tõlgib iga esinemise uuesti, arvestamata väljakujunenud sõnavaraga. Seetõttu on keskne terminoloogiahaldus hädavajalik. Enne tõlkimist koostage siduvad glossaarid, mis määravad eelistatud terminid, keelatud sünonüümid ja kontekstist sõltuvad variandid. See glossaar tuleb integreerida nii tehisintellekti keskkonda kui ka kontrollkeskkonda. Kontrollija peaks seejärel süstemaatiliselt võrdlema iga erialaterminit sihttekstis glossaariga. Eriti kriitilised on neologismid, tootenimed ja juriidilised sõnastused. Ilma glossaarita riskite, et sama terminit tõlgitakse eri väljaannetes erinevalt – see on kasutamata võimalus brändi järjepidevuseks ja teie klientidele pahameeleks. Investeerige seega oma terminoloogiavaru haldamisse; see on kõige tõhusam hoob masintõlgete kvaliteedi tõstmiseks professionaalsele tasemele.
blog.faqT
Kuidas käituda valesti tõlgitud pärisnimedega?
Looge siduv terminoloogiaandmebaas, mis määrab iga pärisnime õige kirjaviisi sihtkeeles. Kontrollijad peaksid kõik pärisnimed märgistama ja neid selle andmebaasiga võrdlema. Kõrvalekalded parandatakse ja andmebaasi uuendatakse uute juhtumite korral. Nii tagate, et kaubamärkide ja tootenimed jäävad järjepidevaks.
Millised tööriistad toetavad numbri- ja vorminguvigade kontrolli?
Kasutage QA-tööriistu nagu Xbench või Verifika, mis kontrollivad automaatselt tuhandike eraldajaid, kuupäevavorminguid ja valuutasid. Need tööriistad loetlevad kõrvalekalded, mis tuleb seejärel käsitsi valideerida. Teise võimalusena saavad regulaaravaldised teostada kohandatud kontrolle. Tulemused registreeritakse kontrolliprotokollis.