AI[kutak]
Veliki modeli

Robbyant predstavlja LingBot-World-Infinity: Interaktivni simulator sveta koji generiše video u realnom vremenu

Novi model od Robbyant-a omogućava generisanje video zapisa u 720p rezoluciji sa 60 fps, uz mogućnost interakcije sa virtuelnim svetom kroz tekstualne upite i akcije.

Uredio: Stevan K.15:29, 11. jul 2026.1 min čitanja
Robbyant predstavlja LingBot-World-Infinity: Interaktivni simulator sveta koji generiše video u realnom vremenu
Ilustracija je generisana veštačkom inteligencijom.

Šta ako možete da kreirate virtuelni svet koji se menja u realnom vremenu, samo unosom tekstualnih upita ili pokretima kamere? Robbyant, divizija Ant Group-a fokusirana na embodied intelligence, upravo je predstavio LingBot-World-Infinity (LingBot-World 2.0), model koji omogućava upravo to. Ovaj interaktivni simulator sveta generiše video zapise frame po frame, uz mogućnost interakcije korisnika kroz akcije kao što su napad, streljaštvo ili čak bacanje čini.

Model je zasnovan na arhitekturi MoBA (Mixture of Bidirectional and Autoregressive) Attention Mask, koja rešava problem dugoročnog odstupanja (long-horizon drift) i omogućava konzistentnu kvalitetu izlaza. LingBot-World-Infinity koristi dvoetapni proces obuke: pre-training optimizuje uslovni flow-matching cilj, dok post-training kompresuje multi-step učitelja u nekoliko koraka učenika. Ova kombinacija omogućava modelu da generiše video zapise u 720p rezoluciji sa 60 fps, što ga čini idealnim za primene u igrama, simulacijama i stvaranju sintetičkih podataka.

Jedna od ključnih karakteristika modela je njegova "agentička uprta" (agentic harness), koja se sastoji od dva agenta: Directora (VLM - Vision-Language Model) i Pilota (Diffusion Transformer video generator). Director upravlja makroskopskim semantičkim pravilima i uzročnim zaključivanjem, dok Pilot simulira niskonivojske fizikalne dinamike i renderuje tranzicije. Ova kombinacija omogućava dva načina interakcije: direktnu semantičku interakciju gde VLM generiše event kartice na osnovu trenutnog frejma, i tracking-asistiranu interakciju sa objektima koja koristi SAM (Segment Anything Model) za praćenje objekata kroz video sekvence.

Za one koji žele da isprobaju model, dostupan je 14B checkpoint na GitHub-u, mada trenutno zahteva osam GPU-a za pokretanje u rezoluciji 480×832. Model takođe podržava interakciju preko WASD kontrola za kretanje, IJKL za kontrolu pogleda, i različitih tastera za akcije kao što su skok, letenje i okidanje događaja.

Šta ovo znači za budućnost simulacija i generativnih modela? LingBot-World-Infinity ne samo što omogućava brzo prototipisanje virtuelnih svetova, već otvara vrata za nove načine interakcije sa AI-om. Kako će ova tehnologija evoluirati i koje nove aplikacije će omogućiti, ostaje pitanje za buduće istraživanje.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...