AI[kutak]
Veliki modeli

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?

Stevan K. • 14:28, 21. jul 2026.1 min čitanja
Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Šta ako bi jedan AI model mogao da razume vizuelni svet na isti način kao ljudsko oko i mozak? Google DeepMind upravo je napravio značajan korak ka tome sa GenCeption modelom, koji revolucionarno objedinjuje pet ključnih vizuelnih zadataka u jednu celinu.

Za razliku od tradicionalnih modela koji rade segmentaciju, procenu dubine ili 3D poziciju posebno, GenCepton sve ovo obavlja istovremeno. Korisnik samo unese tekstualni prompt, a model generiše dubinske mape, maske segmentacije, trajektorije kretanja kamere i druge informacije u jednom prolazu.

Najimpresivnije je što je model treniran na svega 7.500 sintetičkih snimaka jedne osobe, renderovanih u Blenderu. Ipak, pokazuje izuzetnu sposobnost generalizacije - bez problema radi sa snimcima više ljudi u stvarnom svetu, ali i sa životinjama ili robotima. Detalji poput mačjih brkova ili pojedinačnih vlasi kose ostaju očuvani bolje nego na originalnim sintetičkim slikama korišćenim za trening.

U pogledu performansi, mali model obradi 81 frejm za oko 6 sekundi, dok veliki model sa 14 milijardi parametara za to treba oko 10 sekundi. Ove brzine su značajno poboljšanje u odnosu na tradicionalne pristupe gde bi svaki zadatak zahtevao poseban model.

GenCeption je razvijen na osnovu Alibabinog open source okvira Tongyi Wanxiang Wan2.1. Ova tehnologija može imati široku primenu - od unapređenja augmented reality, preko robotike, do napredne video analize.

Ključno pitanje sada je: da li će ova integrisana pristup vizuelnom razumevanju postati novi standard u industriji, ili će specijalizovani modeli i dalje dominirati? Odgovor će možda dati brzina usvajanja ove tehnologije u stvarnim aplikacijama tokom narednih godina.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu
Veliki modeli

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu

Kineski gigant osvaja tržište tekst-u-govor tehnologije sa modelom koji je prestigao sve konkurente po kvalitetu, a po ceni je tri puta jeftiniji.

21. jul 2026.

Meta otvara Astryx, dizajn sistem za ljude i AI agente
Open Source

Meta otvara Astryx, dizajn sistem za ljude i AI agente

Meta je pustila u javnu beta verziju Astryx, svoj najkorišćeniji interni dizajn sistem sa 150+ komponenti, optimizovan za saradnju ljudi i veštačke inteligencije.

21. jul 2026.

YouTube pooštava pravila za AI-generisane videe: Šta neće moći da se monetizuje
Veliki modeli

YouTube pooštava pravila za AI-generisane videe: Šta neće moći da se monetizuje

YouTube sada jasno definiše koje AI-generisane sadržaje neće dozvoliti u svom partner programu, fokusirajući se na generičke, uznemirujuće i osetljive teme.

20. jul 2026.

Komentari (0)

Učitavanje komentara...