Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi
Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?
Šta ako bi jedan AI model mogao da razume vizuelni svet na isti način kao ljudsko oko i mozak? Google DeepMind upravo je napravio značajan korak ka tome sa GenCeption modelom, koji revolucionarno objedinjuje pet ključnih vizuelnih zadataka u jednu celinu.
Za razliku od tradicionalnih modela koji rade segmentaciju, procenu dubine ili 3D poziciju posebno, GenCepton sve ovo obavlja istovremeno. Korisnik samo unese tekstualni prompt, a model generiše dubinske mape, maske segmentacije, trajektorije kretanja kamere i druge informacije u jednom prolazu.
Najimpresivnije je što je model treniran na svega 7.500 sintetičkih snimaka jedne osobe, renderovanih u Blenderu. Ipak, pokazuje izuzetnu sposobnost generalizacije - bez problema radi sa snimcima više ljudi u stvarnom svetu, ali i sa životinjama ili robotima. Detalji poput mačjih brkova ili pojedinačnih vlasi kose ostaju očuvani bolje nego na originalnim sintetičkim slikama korišćenim za trening.
U pogledu performansi, mali model obradi 81 frejm za oko 6 sekundi, dok veliki model sa 14 milijardi parametara za to treba oko 10 sekundi. Ove brzine su značajno poboljšanje u odnosu na tradicionalne pristupe gde bi svaki zadatak zahtevao poseban model.
GenCeption je razvijen na osnovu Alibabinog open source okvira Tongyi Wanxiang Wan2.1. Ova tehnologija može imati široku primenu - od unapređenja augmented reality, preko robotike, do napredne video analize.
Ključno pitanje sada je: da li će ova integrisana pristup vizuelnom razumevanju postati novi standard u industriji, ili će specijalizovani modeli i dalje dominirati? Odgovor će možda dati brzina usvajanja ove tehnologije u stvarnim aplikacijama tokom narednih godina.