AI[kutak]
Veliki modeli

Robbyant predstavlja LingBot-World-Infinity: Interaktivni simulator sveta koji generiše video u realnom vremenu

Novi model od Robbyant-a omogućava generisanje video zapisa u 720p rezoluciji sa 60 fps, uz mogućnost interakcije sa virtuelnim svetom kroz tekstualne upite i akcije.

Stevan K. • 15:29, 11. jul 2026.1 min čitanja
Robbyant predstavlja LingBot-World-Infinity: Interaktivni simulator sveta koji generiše video u realnom vremenu

Šta ako možete da kreirate virtuelni svet koji se menja u realnom vremenu, samo unosom tekstualnih upita ili pokretima kamere? Robbyant, divizija Ant Group-a fokusirana na embodied intelligence, upravo je predstavio LingBot-World-Infinity (LingBot-World 2.0), model koji omogućava upravo to. Ovaj interaktivni simulator sveta generiše video zapise frame po frame, uz mogućnost interakcije korisnika kroz akcije kao što su napad, streljaštvo ili čak bacanje čini.

Model je zasnovan na arhitekturi MoBA (Mixture of Bidirectional and Autoregressive) Attention Mask, koja rešava problem dugoročnog odstupanja (long-horizon drift) i omogućava konzistentnu kvalitetu izlaza. LingBot-World-Infinity koristi dvoetapni proces obuke: pre-training optimizuje uslovni flow-matching cilj, dok post-training kompresuje multi-step učitelja u nekoliko koraka učenika. Ova kombinacija omogućava modelu da generiše video zapise u 720p rezoluciji sa 60 fps, što ga čini idealnim za primene u igrama, simulacijama i stvaranju sintetičkih podataka.

Jedna od ključnih karakteristika modela je njegova "agentička uprta" (agentic harness), koja se sastoji od dva agenta: Directora (VLM - Vision-Language Model) i Pilota (Diffusion Transformer video generator). Director upravlja makroskopskim semantičkim pravilima i uzročnim zaključivanjem, dok Pilot simulira niskonivojske fizikalne dinamike i renderuje tranzicije. Ova kombinacija omogućava dva načina interakcije: direktnu semantičku interakciju gde VLM generiše event kartice na osnovu trenutnog frejma, i tracking-asistiranu interakciju sa objektima koja koristi SAM (Segment Anything Model) za praćenje objekata kroz video sekvence.

Za one koji žele da isprobaju model, dostupan je 14B checkpoint na GitHub-u, mada trenutno zahteva osam GPU-a za pokretanje u rezoluciji 480×832. Model takođe podržava interakciju preko WASD kontrola za kretanje, IJKL za kontrolu pogleda, i različitih tastera za akcije kao što su skok, letenje i okidanje događaja.

Šta ovo znači za budućnost simulacija i generativnih modela? LingBot-World-Infinity ne samo što omogućava brzo prototipisanje virtuelnih svetova, već otvara vrata za nove načine interakcije sa AI-om. Kako će ova tehnologija evoluirati i koje nove aplikacije će omogućiti, ostaje pitanje za buduće istraživanje.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi
Veliki modeli

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?

21. jul 2026.

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu
Veliki modeli

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu

Kineski gigant osvaja tržište tekst-u-govor tehnologije sa modelom koji je prestigao sve konkurente po kvalitetu, a po ceni je tri puta jeftiniji.

21. jul 2026.

Meta otvara Astryx, dizajn sistem za ljude i AI agente
Open Source

Meta otvara Astryx, dizajn sistem za ljude i AI agente

Meta je pustila u javnu beta verziju Astryx, svoj najkorišćeniji interni dizajn sistem sa 150+ komponenti, optimizovan za saradnju ljudi i veštačke inteligencije.

21. jul 2026.

Komentari (0)

Učitavanje komentara...