NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

Šta ako bi istraživači umesto da se bore sa složenim infrastrukturama za učenje sa pojačanjem (RL) mogli da imaju ceo sistem u glavi? NVIDIA-ov tim NeMo upravo je objavio Molt, PyTorch-nativni okvir za agentičko RL koji ima upravo tu ambiciju.
Sa samo 8.600 linija koda specifičnih za RL, Molt je sedam puta kompaktniji od popularnog okvira verl (62.000 linija) i blizu minimalističkom OpenRLHF (7.200 linija). Ova minimalistička filozofija omogućava ne samo ljudima već i AI asistentima za kodiranje da razumeju ceo sistem.
Ali Molt nije samo akademski eksperiment. Okvir je potpuno operativan i dostupan pod Apache 2.0 licencom, sa gotovim skriptama za Slurm i kontejnerom. Međutim, hardverski zahtevi su ozbiljni - standardna konfiguracija zahteva 2 čvora sa po 8 H100 GPU-a, što ga čini dostupnim samo najbolje opremljenim istraživačkim grupama i kompanijama.
Ključna inovacija je u dizajnu koji kombinuje tri komponente - Ray za raspoređivanje, vLLM za izvršavanje i NVIDIA AutoModel sa FSDP2 za obuku - bez ikakvog forkovanja originalnih projekata. To znači da unapređenja u osnovnim komponentama automatski postaju dostupna u Molt-u.
Za razliku od mnogih RL okvira, agenti u Molt-u su obični Python programi. Okvir podržava dva moda rada: tradicionalni RL sa kontrolisanim okruženjem (Env) i fleksibilniji ChatAgent pristup gde korisnik kontroliše petlju kroz standardne OpenAI ili Anthropic SDK-je.
Tri invarijante osiguravaju korektnost sistema: identitet tokena, semantika verzije politike i konzistentnost između obuke i izvršavanja. Ovo poslednje je posebno kritično za modele sa mešavinom eksperata (MoE), gde Molt koristi tehniku "replay" rutiranja da spreči nesaglasnosti.
Dok NVIDIA ističe da je protok uporediv sa Megatron-baziranim sistemima, prava vrednost Molt-a leži u njegovoj jednostavnosti i modularnosti. Isti osnovni kod može da pokreće i male dense modele od 4B parametara i ogromne MoE modele od 700B parametara, samo promenom konfiguracione zastavice.
Za sada, Molt ostaje alat za istraživanje, a ne za produkciju. Ali njegova sposobnost da smanji kognitivno opterećenje istraživača može ubrzati razvoj novih RL algoritama - što je vredna truda investicija za NVIDIA, čiji čipovi će svakako biti potrebni za pokretanje ovih modela.