AI[kutak]
Veliki modeli

Ling-3.0-Flash: Manji model, veća efikasnost od konkurencije

Ant Bailing predstavio Ling-3.0-Flash, model koji sa 124B parametara nadmašuje veće modele u ključnim zadacima, uz smanjene troškove i brži odziv.

Uredio: Stevan K.17:33, 27. jul 2026.1 min čitanja
Ling-3.0-Flash: Manji model, veća efikasnost od konkurencije
Ilustracija je generisana veštačkom inteligencijom.

Šta ako vam kažemo da manji AI model može biti pametniji od većih konkurenata? Ling-3.0-Flash, novi hibridni model za zaključivanje od Ant Bailinga, upravo to dokazuje. Sa svega 124 milijarde parametara i aktivacijom od 5,1 milijarde po jednoj obradi, on ne samo da smanjuje troškove računanja već i nadmašuje modele sa dva do tri puta više parametara u ključnim zadacima poput osnovnog zaključivanja, praćenja instrukcija i obrade dužih tekstova.

Model je posebno razvijen za praktične scenarije korišćenja, sa više od 10.000 stvarnih interakcija u procesu treninga. Ling-3.0-Flash pokazuje impresivne sposobnosti u pisanju koda, razbijanju kompleksnih zadataka i istraživanju iz više izvora informacija, rešavajući problem tradicionalnih modela koji često "izlaze iz koloseka" pri velikim zadacima.

Ključ uspeha leži u redizajniranoj arhitekturi modela. Umesto prostog povećanja parametara, Ling-3.0-Flash koristi hibridnu pažnju koja kombinuje KDA linearne slojeve i MLA slojeve u odnosu 5:1. Ovaj pristup omogućava bolju ravnotežu između efikasnosti u dugim kontekstima i sposobnosti modela.

Dodatne optimizacije uključuju nadogradnju Lightning Attention na KDA (Kimi Delta Attention), što omogućava preciznije pamćenje ključnih informacija pri obradi dugih dokumenata i kodova. Takođe, ekspertna aktivacija po tokenu smanjena je sa 1/32 na 1/64, što dalje povećava efikasnost.

Za brže i stabilnije izvršavanje, Bailing je uveo hijerarhijski sistem keširanja na nivou klastera, smanjujući kašnjenje prvog karaktera odgovora za 60-80% u dugim razgovorima. Nadogradnjom arhitekture za saradnju više agenata, rizik od grešaka pojedinačnog modela je značajno smanjen, što čini Ling-3.0-Flash pogodnim za visokofrekventne online usluge i stvarne poslovne aplikacije.

Model je dostupan besplatno tokom prve nedelje na OpenRouteru, nakon čega će biti otvoren kao open source. Da li će Ling-3.0-Flash postati novi standard za praktične AI aplikacije? Vreme će pokazati, ali izgledi su obećavajući.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...