AMD predstavlja Instella-MoE-16B-A3B: Otvoreni AI model sa 16 milijardi parametara
AMD je objavio potpuno otvoren Mixture-of-Experts (MoE) model sa impresivnim performansama, ali ograničenom komercijalnom upotrebom. Da li je ovo korak ka nezavisnim AI rešenjima?

Dok veliki igrači poput OpenAI i Anthropica drže svoje modele zatvorenim, AMD pokazuje drugi pristup. Njihov najnoviji Instella-MoE-16B-A3B je potpuno otvoren model sa 16 milijardi parametara, ali aktivira samo 2,8 milijardi po tokenu, što ga čini efikasnijim od konkurencije.
Model je treniran od nule na AMD-ovim Instinct MI300X i MI325X GPU-ovima, a kompanija je objavila sve detalje – od težina do konfiguracija treninga i inference koda. Dve ključne inovacije su Gated Multi-head Latent Attention i FarSkip-Collective veze, koje donose 12,7% brži trening i do 39,2% brže generisanje prvog tokena.
Ali tu je i ograničenje. Model je dostupan pod ResearchRAIL licencom, što znači da se može koristiti samo u akademske i istraživačke svrhe. Za komercijalnu upotrebu potrebno je tražiti posebnu dozvolu. Ipak, trening kod je MIT licenciran, što ga čini značajnim resursom za zajednicu.
Performanse su impresivne. Osnovna verzija postiže prosek od 76,7 poena na standardnim benchmarkovima, što je najbolji rezultat među potpuno otvorenim modelima. Posebno se ističe na WinoGrande testu (86,5) i dugim kontekstima (79,4 na RULER-u). Nakon dodatnog treninga, model dostiže 73,22 poena, nadmašujući konkurente poput Gemma-4-E4B i Qwen3.5-4B.
Za razliku od mnogih modernih modelova, Instella-MoE koristi Multi-Token Prediction tokom pretreninga i srednje faze treninga. Struktura modela uključuje 27 slojeva sa 2048 skrivenih jedinica i 16 attention head-ova. Svaki MoE sloj koristi 2 zajednička eksperta plus 6 odabranih od ukupno 64, što omogućava efikasnu raspodelu resursa.
Trening je obuhvatio 7,1 triliona tokena iz otvorenih korpusa kao što su Nemotron-CC-v2 i MegaMath. Poseban akcenat je stavljen na dugi kontekst, koji se kroz faze treninga proširuje sa 4K na 64K tokena.
AMD-ov potez može biti ključan za istraživače koji žele da istražuju MoE arhitekture bez oslanjanja na zatvorene platforme. Ali pitanje ostaje – da li će kompanije i dalje koristiti ovaj model kao osnovu za svoje komercijalne proizvode, ili će ResearchRAIL ograničenja biti prevelika prepreka?