AI[kutak]
Veliki modeli

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?

Uredio: Stevan K.14:28, 21. jul 2026.1 min čitanja
Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi
Ilustracija je generisana veštačkom inteligencijom.

Šta ako bi jedan AI model mogao da razume vizuelni svet na isti način kao ljudsko oko i mozak? Google DeepMind upravo je napravio značajan korak ka tome sa GenCeption modelom, koji revolucionarno objedinjuje pet ključnih vizuelnih zadataka u jednu celinu.

Za razliku od tradicionalnih modela koji rade segmentaciju, procenu dubine ili 3D poziciju posebno, GenCepton sve ovo obavlja istovremeno. Korisnik samo unese tekstualni prompt, a model generiše dubinske mape, maske segmentacije, trajektorije kretanja kamere i druge informacije u jednom prolazu.

Najimpresivnije je što je model treniran na svega 7.500 sintetičkih snimaka jedne osobe, renderovanih u Blenderu. Ipak, pokazuje izuzetnu sposobnost generalizacije - bez problema radi sa snimcima više ljudi u stvarnom svetu, ali i sa životinjama ili robotima. Detalji poput mačjih brkova ili pojedinačnih vlasi kose ostaju očuvani bolje nego na originalnim sintetičkim slikama korišćenim za trening.

U pogledu performansi, mali model obradi 81 frejm za oko 6 sekundi, dok veliki model sa 14 milijardi parametara za to treba oko 10 sekundi. Ove brzine su značajno poboljšanje u odnosu na tradicionalne pristupe gde bi svaki zadatak zahtevao poseban model.

GenCeption je razvijen na osnovu Alibabinog open source okvira Tongyi Wanxiang Wan2.1. Ova tehnologija može imati široku primenu - od unapređenja augmented reality, preko robotike, do napredne video analize.

Ključno pitanje sada je: da li će ova integrisana pristup vizuelnom razumevanju postati novi standard u industriji, ili će specijalizovani modeli i dalje dominirati? Odgovor će možda dati brzina usvajanja ove tehnologije u stvarnim aplikacijama tokom narednih godina.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...