AI[kutak]
Istraživanje

Perplexity predstavlja WANDR: Prvi benchmark za AI agente koji rade dubinska istraživanja

Novi open source benchmark od Perplexity testira sposobnost AI sistema da prikupe i potvrde ogromne količine podataka, što je ključno za analitičke i istraživačke poslove.

Uredio: Stevan K.11:38, 19. jul 2026.1 min čitanja
Perplexity predstavlja WANDR: Prvi benchmark za AI agente koji rade dubinska istraživanja
Ilustracija je generisana veštačkom inteligencijom.

Dok tradicionalni AI benchmarkovi mere tačnost pojedinačnih odgovora, stvarni poslovi zahtevaju mnogo više - prikupljanje stotina dokaza za svaku tvrdnju. Perplexity je upravo objavio WANDR, prvi open source benchmark specijalizovan za testiranje AI agenata u kompleksnim istraživačkim zadacima.

WANDR (Wide ANd Deep Research) sadrži 500 realističnih zadataka koji simuliraju profesionalne scenarije poput analize tržišta, due diligence procesa ili pregleda naučne literature. Za razliku od većine testova, ovde se ne traži samo tačan odgovor, već i dokaz za svaku tvrdnju. "Polirana priča bazirana na nepotpunim istraživanjima ovde neće proći", objašnjava Perplexity.

Jedan od konkretnih primera je zadatak "ceo_cfo_appointments" koji traži minimum 70 američkih kompanija koje su imenovale novog CEO ili CFO između marta i aprila 2026. Za svaku kompaniju, agent mora pronaći autoritativni izvor koji potvrđuje imenovanje, plus dodatnu potvrdu sa liste rukovodstva. Ukupno se traži 140 dokazanih podataka.

Kako se ocenjuje? Sistem sam ponovo preuzima navedene izvore i proverava da li tekst zaista podržava tvrdnju. "Čak 57,5% citata koje je naš AI pronašao nisu u potpunosti podržavale tvrdnju", priznaje Perplexity. Njihov Search as Code sistem trenutno vodi na rang listi sa skorom od samo 0,363 - što pokazuje koliko je ovakav rad još uvek izazovan za AI.

Zašto je ovo bitno? Zato što kompanije već delegiraju AI agentima zadatke poput analize konkurencije, due diligence istraživanja ili pregleda akademskih radova. WANDR omogućava precizno merenje performansi i identifikaciju slabih tačaka - da li sistem ne može da pronađe dovoljno izvora, ili ne ume da izvuče sve potrebne informacije iz njih?

Iako Perplexity vodi na rang listi, nijedan sistem nije blizu rešenja kompletnog benchmarka. Najveći izazovi su pronalaženje svih relevantnih entiteta (discovery) i pravilno citiranje dokaza - čak 41,4% pronađenih stranica nije zadovoljilo sve kriterijume. Ovo otvara pitanje: Da li će sledeća generacija AI modela moći da savlada kompleksne istraživačke zadatke sa visokom tačnošću, ili će ljudi i dalje morati da proveravaku svaki korak?

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...