Robbyant predstavlja LingBot-World-Infinity: Interaktivni simulator sveta koji generiše video u realnom vremenu
Novi model od Robbyant-a omogućava generisanje video zapisa u 720p rezoluciji sa 60 fps, uz mogućnost interakcije sa virtuelnim svetom kroz tekstualne upite i akcije.
Šta ako možete da kreirate virtuelni svet koji se menja u realnom vremenu, samo unosom tekstualnih upita ili pokretima kamere? Robbyant, divizija Ant Group-a fokusirana na embodied intelligence, upravo je predstavio LingBot-World-Infinity (LingBot-World 2.0), model koji omogućava upravo to. Ovaj interaktivni simulator sveta generiše video zapise frame po frame, uz mogućnost interakcije korisnika kroz akcije kao što su napad, streljaštvo ili čak bacanje čini.
Model je zasnovan na arhitekturi MoBA (Mixture of Bidirectional and Autoregressive) Attention Mask, koja rešava problem dugoročnog odstupanja (long-horizon drift) i omogućava konzistentnu kvalitetu izlaza. LingBot-World-Infinity koristi dvoetapni proces obuke: pre-training optimizuje uslovni flow-matching cilj, dok post-training kompresuje multi-step učitelja u nekoliko koraka učenika. Ova kombinacija omogućava modelu da generiše video zapise u 720p rezoluciji sa 60 fps, što ga čini idealnim za primene u igrama, simulacijama i stvaranju sintetičkih podataka.
Jedna od ključnih karakteristika modela je njegova "agentička uprta" (agentic harness), koja se sastoji od dva agenta: Directora (VLM - Vision-Language Model) i Pilota (Diffusion Transformer video generator). Director upravlja makroskopskim semantičkim pravilima i uzročnim zaključivanjem, dok Pilot simulira niskonivojske fizikalne dinamike i renderuje tranzicije. Ova kombinacija omogućava dva načina interakcije: direktnu semantičku interakciju gde VLM generiše event kartice na osnovu trenutnog frejma, i tracking-asistiranu interakciju sa objektima koja koristi SAM (Segment Anything Model) za praćenje objekata kroz video sekvence.
Za one koji žele da isprobaju model, dostupan je 14B checkpoint na GitHub-u, mada trenutno zahteva osam GPU-a za pokretanje u rezoluciji 480×832. Model takođe podržava interakciju preko WASD kontrola za kretanje, IJKL za kontrolu pogleda, i različitih tastera za akcije kao što su skok, letenje i okidanje događaja.
Šta ovo znači za budućnost simulacija i generativnih modela? LingBot-World-Infinity ne samo što omogućava brzo prototipisanje virtuelnih svetova, već otvara vrata za nove načine interakcije sa AI-om. Kako će ova tehnologija evoluirati i koje nove aplikacije će omogućiti, ostaje pitanje za buduće istraživanje.