NVIDIA Nemotron 3.5 ASR (Automatic Speech Recognition) modelis jau iš karto pasižymi galimybe transkribuoti iki 40 kalbų‑lokalių, įskaitant arabų kalbą, tačiau realiame diegime dažnai susiduriama su regioninių dialektų ir vietinių įrašų sąlygomis, kurios nėra pakankamai atstovaujamos pradiniuose mokymo duomenyse. Ši problema ypač ryški Saudo Arabijoje, kur kalbama tiek Modern Standard Arabic, tiek specifiniais dialektais, tokiais kaip Najdi ir Hijazi. Šiame straipsnyje apžvelgiame, kaip NVIDIA naudojant NeMo platformą atliko tikslų fine‑tuningą, kad pagerintų modelio našumą šiuose dialektuose, ir kokios išvados gali būti pritaikytos kitoms kalbų grupėms.
Kodėl reikia dialektų adaptacijos?

Automatinė kalbos atpažinimo sistema turi atpažinti ne tik standartinę kalbą, bet ir tai, kaip žmonės iš tikrųjų kalba. Regioniniai dialektai ir vietinės įrašų sąlygos dažnai yra nepakankamai atstovaujamos didelių, daugiakalbių modelių mokymo duomenyse. Dėl to modelis, nors ir gerai veikia plačiuose benchmarkuose, gali nesugebėti tiksliai transkribuoti vietinių akcentų ar specifinių fonetinių ypatybių. Saudo Arabijos atveju tai reiškia, kad modelis gali gerai atpažinti Modern Standard Arabic arba anglų kalbą, bet susiduria su sunkumais atpažįstant Najdi ir Hijazi kalbą.
Fine‑tuning proceso pagrindai

NVIDIA komanda pasirinko „low‑resource“ korpusą – tai yra ribotas, bet kruopščiai paruoštas duomenų rinkinys, kuriame buvo 103 559 iš 125 490 įrašų, sudarantys 133,7 valandos (≈ 82,5 % pradinio rinkinio). Ši filtracija nebuvo skirta pašalinti sunkiai suprantamus akcentus, o tik struktūrinius trūkumus, pavyzdžiui, netinkamai susietus garso ir teksto fragmentus. Automatinių kokybės įvertinimų (UTMOS, SIGMOS) pagalba buvo nustatyti korpuso specifiniai slenkstiai: UTMOS ≥ 1,25, SIGMOS triukšmo ≥ 1,5 ir bendras SIGMOS ≥ 1,5, kurie leido išsaugoti apie 85 % tinkamų įrašų.
Po duomenų paruošimo sekė modelio adaptavimas naudojant NVIDIA NeMo framework ir ASR fine‑tuning receptą. Svarbiausi žingsniai buvo:
- Weighted replay mix – senų, gerai išmokytų kalbų duomenų įtraukimas į mokymo ciklą, kad fine‑tuningas nepašalintų jau įgytų žinių.
- Efficient batching – optimizuotas paketų dydis, leidžiantis efektyviai naudoti GPU atmintį.
- Partial unfreezing – tik dalies modelio sluoksnių atlaisvinimas, kad būtų galima prisitaikyti prie naujų duomenų, bet išlaikant bazinį žinių pagrindą.
Rezultatai ir įžvalgos
Pradiniame SADA (Saudi Arabic Dialect Adaptation) eksperimentui, prieš fine‑tuningą, Nemotron 3.5 ASR modelis pasiekė 49,5 % WER (Word Error Rate) validacijos rinkinyje ir 59 % WER visame mokymo korpuse. Po pirmų 10 epochų WER sumažėjo iki 47,8 %, o tolesnių epochų metu šis rodiklis išliko stabilus. Tai rodo, kad tikslus fine‑tuningas gali suteikti pastebimą našumo pagerėjimą, nors didesnių patobulinimų gali reikėti papildomų eksperimentų ir hiperparametrų derinimo.
Svarbu pabrėžti, kad šis darbo procesas nėra universali priemonė visiems arabų dialektams ar kitoms kalbų grupėms. Replay mechanizmas apsaugo tik tuos duomenis, kurie yra įtraukti į mokymo rinkinį, o dalinis sluoksnių atlaisvinimas gali pareikalauti pakartotinio derinimo, kai pasikeičia duomenų mišinys. Taip pat, nors šis metodas gerai veikia Saudo Arabijos dialektus, kitose regioninėse aplinkose gali prireikti skirtingų filtravimo slenksčių ar kitų duomenų paruošimo priemonių.
Praktiniai patarimai kitiems projektams
- Pasirinkite tikslinį dialektą – pradėkite nuo vieno aiškiai apibrėžto kalbos varianto, kaip tai buvo daroma su Najdi ir Hijazi.
- Kokybės filtravimas – naudokite automatinius įrankius (UTMOS, SIGMOS), bet visada patikrinkite jų skirstymo charakteristikas, kad nesugadintumėte vertingų duomenų.
- Replay mix – įtraukite senų kalbų duomenis, kad išlaikytumėte modelio universalumą.
- Paprasčiausias bazinis eksperimentas – pradėkite nuo pilno fine‑tuning proceso su vienu duomenų rinkiniu ir fiksuotu vertinimo rinkiniu, kad galėtumėte matuoti pokyčius.
Išvados
NVIDIA Nemotron 3.5 ASR modelio adaptavimas Saudo Arabijos dialektams parodė, kad tikslus fine‑tuningas, paremtas kruopščiu duomenų paruošimu ir atitinkamais mokymo metodais, gali pagerinti kalbos atpažinimo tikslumą regioninėse aplinkose. Nors šis procesas nebus tiesiogiai perkeliamas į kiekvieną kalbų variantą, jo principai – duomenų kokybės kontrolė, weighted replay ir dalinis sluoksnių atlaisvinimas – suteikia aiškią gaires kitiems tyrėjams ir įmonėms, siekiantiems pritaikyti didelius kalbos modelius specifinėms rinkoms.
CTA: Jei norite sužinoti, kaip dirbtinis intelektas gali padėti jūsų organizacijai automatizuoti kalbos atpažinimą, susisiekite su Krikis IT.






