NVIDIA predstavlja kompresovani AI model Nemotron-Labs-3-Puzzle-75B-A9B
NVIDIA je smanjio veličinu moćnog Nemotron-3-Super modela sa 120.7B na 75.3B parametara, uz značajno poboljšanje performansi. Evo šta to znači za praktičnu primenu.
NVIDIA AI tim je objavio kompresovanu verziju svog velikog hibridnog MoE modela Nemotron-3-Super, nazvanu Nemotron-Labs-3-Puzzle-75B-A9B. Originalni model ima ukupno 120.7 milijardi parametara, od kojih je 12.8 milijardi aktivno, dok nova verzija smanjuje ove brojke na 75.3 milijarde ukupnih i 9.3 milijarde aktivnih parametara.
Ključna prednost ovog pristupa je u poboljšanju performansi bez gubitka funkcionalnosti. Model zadržava istu strukturu od 88 blokova (40 Mamba, 40 MoE i 8 attention blokova), ali sa optimizovanim kapacitetom unutar tih blokova. Posebno je interesantno da su istraživači sačuvali kapacitete u srednjim i kasnim slojevima, dok su druge delove modela agresivnije prskali.
Kada je reč o praktičnim rezultatima, novi model pokazuje impresivne brojke. Na 8xB200 čvorovima, ukupni protok porastao je 1.60x do 2.14x u odnosu na originalni model pri istom NVFP4 kvantizacionom formatu. Još upečatljivije je poboljšanje na jednom H100 GPU-u gde se konkurentnost za 1M-token zahteve povećala sa samo 1 na čak 8 istovremenih zahteva.
Kompresija je postignuta kroz tri glavne tehnike: redukciju kanala unutar eksperata, smanjenje broja eksperata na koje se token rutira (do k=22), i smanjenje SSM stanja u Mamba slojevima sa 128 na 96 kanala. Posebno je zanimljiv iterativni pristup nazvan Puzzle, koji kombinuje kompresiju sa kratkim ciklusima distilacije znanja, što je donelo dodatnih 0.57 poena u proseku na benchmark testovima.
Međutim, nije sve savršeno. Model pokazuje određene padove performansi, posebno na Arena-Hard-V2 (-4.2 poena) i SWE-Bench (-2.6 poena). Istraživači su pokušali da ublaže ove gubitke kroz RL trening fokusiran na softversko inženjerstvo, ali efekat je bio ograničen.
Za praktičnu primenu, ovo otvara neke zanimljive mogućnosti. Dokument analiza sa 1M konteksta sada može da podrži 8 istovremenih zahteva umesto samo 1, sa agregatnim protokom dekodiranja oko 4x većim. Interaktivni kod asistenti mogu da opslužuju 2.16x više zahteva u minutnom intervalu pri istom hardverskom kapacitetu.
Model je dostupan u tri verzije: BF16, FP8 i NVFP4, što daje fleksibilnost u izboru između preciznosti i performansi. NVFP4 verzija je posebno optimizovana za Blackwell arhitekturu, dok FP8 cilja Hopper platformu.
Iako kompresovani model nije savršena zamena za original u svim scenarijima, NVIDIA je pokazala da je moguće značajno smanjiti resurse potrebne za serviranje velikih AI modela bez prevelikih žrtava u kvalitetu. Ovo bi moglo biti ključno za širu primenu ovakvih modela u produkcijskim okruženjima.