NVIDIA paskelbė naujausią CUDA Toolkit 13.4 versiją, kuri ne tik išplečia platformų palaikymą, bet ir suteikia kūrėjams išsamias priemones valdyti bendrinamus GPU išteklius. Pagrindinis naujovių akcentas – oficialus Windows on Arm (WoA) palaikymas, kuris iki šiol buvo prieinamas tik per Linux aplinką. Ši galimybė leidžia kūrėjams pradėti portuoti CUDA programas į Windows Arm64 įrenginius, patikrinti priklausomybes ir testuoti CUDA programų eigą jau egzistuojančiose WoA sistemose. Tai svarbus žingsnis artėjant NVIDIA RTX Spark platformai, kurios išleidimas planuojamas artimiausiu metu.
Be platformų plėtros, CUDA Toolkit 13.4 pristato ankstyvąją „Vera Rubin“ GPU architektūros (compute capability 107) palaikymo versiją. Ši architektūra, kurią NVIDIA apibūdina kaip kitą kartą skatinančią agentinį AI, dabar yra prieinama kūrėjams kaip peržiūros funkcija. Tai leidžia programuotojams pradėti optimizuoti ir perkelti savo programas į Rubin architektūrą dar prieš oficialų jos palaikymą ateities CUDA versijose.
Windows on Arm palaikymas – ką tai reiškia kūrėjams?

NVIDIA teigia, kad CUDA programos jau seniai veikia Arm platformose per Linux, tačiau 13.4 versija išplečia šią galimybę į Windows on Arm. Tai svarbu ne tik dėl didėjančio Windows Arm įrenginių rinkos dalies, bet ir dėl artėjančių RTX Spark PC, kurie remsis šia architektūra. Kūrėjai dabar gali naudoti NVIDIA įrankius, kad patikrintų, ar jų algoritmai veikia efektyviai, ir atliktų reikiamus našumo patobulinimus dar prieš galutinį produktų išleidimą.
MPS V3 – modernizuotas bendrinamų GPU valdymas

CUDA Toolkit 13.4 pristato trečiąją „Multi‑process server“ (MPS) versiją – MPS V3. Ši nauja kontrolės sluoksnis supaprastina automatizuotą bendrinamų GPU išteklių valdymą. Svarbiausios funkcijos:
- Scriptable CLI – komandų eilutės įrankis, leidžiantis automatizuoti MPS konfigūraciją.
- Serverio instancijos ir vardų erdvės (namespaces) – leidžia organizuoti lygiagrečius darbus ir atskirti juos logiškai.
- TOML konfigūracijos palaikymas – supaprastina konfigūracijos failų kūrimą ir valdymą.
- SM (Streaming Multiprocessor) skaidymo kontrolė – leidžia programiškai nustatyti, kiek SM vienetų skiriama konkrečiam procesui.
- cgroup‑integruoti GPU atminties limitai – suteikia galimybę apriboti GPU atminties naudojimą konteineriuose.
Šios galimybės leidžia tiksliai apibrėžti GPU skaidymo politiką: kompiuterinis našumas, atminties ribos ir vykdymo prioritetas gali būti nustatomi programiškai. Be to, MPS V3 integruojamas į konteinerizuotas aplinkas, užtikrinant maksimalų aparatinės įrangos išnaudojimą ir griežtą procesų izoliaciją.
CUDA Compute Fabric Transport (CFT) – naujas duomenų perkėlimo modelis
Nauja funkcija – CUDA Compute Fabric Transport (CFT) – suteikia transporto‑centrinį būdą perkelti duomenis per NVIDIA NVLink audinį. Vietoje tradicinio nuotolinio GPU atminties žemėlapio į proceso virtualų adresų erdvę, CFT leidžia programoms naudoti loginius galinius taškus (endpoint ID) ir atlikti asinchroninius „put“, „get“ bei redukcijos veiksmus tiesiogiai iš GPU. Tai sumažina virtualaus adreso spaudimą didelėse multi‑GPU sistemose, palaiko unicast ir multicast komunikacijos modelius bei suteikia klaidų ir užbaigimo būsenų ataskaitas, leidžiančias programoms aptikti, pakartoti arba perkelti nepavykusius perdavimus.
CFT prieinama tik per CUDA Driver API ir skirta komunikacijos bibliotekų kūrėjams, kuriems reikia specifinių funkcijų, neprieinamų aukštesnio lygio bibliotekų, tokių kaip NCCL ar NVSHMEM.
Lokalumo domenų ir vieningos atminties patobulinimai
CUDA Toolkit 13.4 taip pat atveria programišką prieigą prie „lokalumo domenų“ – GPU dalių, kuriose yra SM ir įrenginio atmintis. Programos gali alokuoti atmintį konkrečiame domenų ir sukurti „žalią kontekstą“ su SM ištekliais tame pačiame domenų, taip sumažindamos duomenų perkėlimo laiką ir pagerindamos našumą. Be to, įdiegta API, leidžianti užklausti vieningos atminties rezidencijos informaciją, suteikia bibliotekoms galimybę priimti informuotus sprendimus dėl duomenų vietos ir judėjimo.
Kiti patobulinimai ir diegimo pakeitimai
Naujoje versijoje NVIDIA nebeįtraukia NVIDIA tvarkyklės į CUDA SDK diegimo paketą – vartotojai turi atskirai įdiegti „nvidia‑open“ tvarkyklę arba naudoti pageidaujamą paketų tvarkyklę. Be to, koherentinėse platformose, tokiose kaip NVIDIA Grace Hopper, Grace Blackwell ir Vera Rubin, numatytoji tvarkyklė dabar veikia su Coherent Driver‑based Memory Management (CDMM) vietoje tradicinio NUMA režimo, nors NUMA vis dar palaikomas ir gali būti aktyvuojamas per branduolio modulio parametrą.
Visos šios naujovės rodo, kad NVIDIA stengiasi ne tik išplėsti CUDA ekosistemos pasiekiamumą, bet ir suteikti kūrėjams gilesnę kontrolę bei lankstumą valdyti modernias GPU architektūras ir išteklius.
Išvados
CUDA Toolkit 13.4 atneša reikšmingus patobulinimus: Windows on Arm palaikymą, ankstyvą Rubin GPU architektūros prieigą, patobulintą MPS V3 valdymą ir naują CFT duomenų transportą. Šios funkcijos suteikia kūrėjams galimybę efektyviau kurti, testuoti ir optimizuoti programas ateities platformoms, įskaitant RTX Spark ir agentinį AI. NVIDIA taip pat pabrėžia atvirą ir modulinią diegimo strategiją, leidžiančią naudoti atskiras tvarkykles ir pasirinkti atminties valdymo modelius pagal poreikius.
Kūrėjams, kurie jau dirba su CUDA, šios naujovės suteiks naujų galimybių išnaudoti modernias GPU architektūras ir geriau valdyti bendrinamus išteklius tiek fizinėse, tiek konteinerizuotose aplinkose.
Šaltiniai
- Nvidia.com – CUDA Toolkit 13.4 Adds Windows on Arm Support and Greater Control over Shared GPUs
- Wccftech – NVIDIA CUDA 13.4 Packs CUDA Support For Windows-on-Arm Ahead of RTX Spark Launch, While Giving Devs Early Access To Vera Rubin Too
- ABC News (AU) – Airlines call for air traffic control boss to quit over UK airport chaos






