AI[kutak]
Veliki modeli

NVIDIA predstavlja kompresovani AI model Nemotron-Labs-3-Puzzle-75B-A9B

NVIDIA je smanjio veličinu moćnog Nemotron-3-Super modela sa 120.7B na 75.3B parametara, uz značajno poboljšanje performansi. Evo šta to znači za praktičnu primenu.

Uredio: Stevan K.06:34, 11. jul 2026.1 min čitanja
NVIDIA predstavlja kompresovani AI model Nemotron-Labs-3-Puzzle-75B-A9B
Ilustracija je generisana veštačkom inteligencijom.

NVIDIA AI tim je objavio kompresovanu verziju svog velikog hibridnog MoE modela Nemotron-3-Super, nazvanu Nemotron-Labs-3-Puzzle-75B-A9B. Originalni model ima ukupno 120.7 milijardi parametara, od kojih je 12.8 milijardi aktivno, dok nova verzija smanjuje ove brojke na 75.3 milijarde ukupnih i 9.3 milijarde aktivnih parametara.

Ključna prednost ovog pristupa je u poboljšanju performansi bez gubitka funkcionalnosti. Model zadržava istu strukturu od 88 blokova (40 Mamba, 40 MoE i 8 attention blokova), ali sa optimizovanim kapacitetom unutar tih blokova. Posebno je interesantno da su istraživači sačuvali kapacitete u srednjim i kasnim slojevima, dok su druge delove modela agresivnije prskali.

Kada je reč o praktičnim rezultatima, novi model pokazuje impresivne brojke. Na 8xB200 čvorovima, ukupni protok porastao je 1.60x do 2.14x u odnosu na originalni model pri istom NVFP4 kvantizacionom formatu. Još upečatljivije je poboljšanje na jednom H100 GPU-u gde se konkurentnost za 1M-token zahteve povećala sa samo 1 na čak 8 istovremenih zahteva.

Kompresija je postignuta kroz tri glavne tehnike: redukciju kanala unutar eksperata, smanjenje broja eksperata na koje se token rutira (do k=22), i smanjenje SSM stanja u Mamba slojevima sa 128 na 96 kanala. Posebno je zanimljiv iterativni pristup nazvan Puzzle, koji kombinuje kompresiju sa kratkim ciklusima distilacije znanja, što je donelo dodatnih 0.57 poena u proseku na benchmark testovima.

Međutim, nije sve savršeno. Model pokazuje određene padove performansi, posebno na Arena-Hard-V2 (-4.2 poena) i SWE-Bench (-2.6 poena). Istraživači su pokušali da ublaže ove gubitke kroz RL trening fokusiran na softversko inženjerstvo, ali efekat je bio ograničen.

Za praktičnu primenu, ovo otvara neke zanimljive mogućnosti. Dokument analiza sa 1M konteksta sada može da podrži 8 istovremenih zahteva umesto samo 1, sa agregatnim protokom dekodiranja oko 4x većim. Interaktivni kod asistenti mogu da opslužuju 2.16x više zahteva u minutnom intervalu pri istom hardverskom kapacitetu.

Model je dostupan u tri verzije: BF16, FP8 i NVFP4, što daje fleksibilnost u izboru između preciznosti i performansi. NVFP4 verzija je posebno optimizovana za Blackwell arhitekturu, dok FP8 cilja Hopper platformu.

Iako kompresovani model nije savršena zamena za original u svim scenarijima, NVIDIA je pokazala da je moguće značajno smanjiti resurse potrebne za serviranje velikih AI modela bez prevelikih žrtava u kvalitetu. Ovo bi moglo biti ključno za širu primenu ovakvih modela u produkcijskim okruženjima.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...