AI[kutak]
Istraživanje

Perplexity predstavlja WANDR: Prvi benchmark za AI agente koji rade dubinska istraživanja

Novi open source benchmark od Perplexity testira sposobnost AI sistema da prikupe i potvrde ogromne količine podataka, što je ključno za analitičke i istraživačke poslove.

Stevan K. • 11:38, 19. jul 2026.1 min čitanja
Perplexity predstavlja WANDR: Prvi benchmark za AI agente koji rade dubinska istraživanja

Dok tradicionalni AI benchmarkovi mere tačnost pojedinačnih odgovora, stvarni poslovi zahtevaju mnogo više - prikupljanje stotina dokaza za svaku tvrdnju. Perplexity je upravo objavio WANDR, prvi open source benchmark specijalizovan za testiranje AI agenata u kompleksnim istraživačkim zadacima.

WANDR (Wide ANd Deep Research) sadrži 500 realističnih zadataka koji simuliraju profesionalne scenarije poput analize tržišta, due diligence procesa ili pregleda naučne literature. Za razliku od većine testova, ovde se ne traži samo tačan odgovor, već i dokaz za svaku tvrdnju. "Polirana priča bazirana na nepotpunim istraživanjima ovde neće proći", objašnjava Perplexity.

Jedan od konkretnih primera je zadatak "ceo_cfo_appointments" koji traži minimum 70 američkih kompanija koje su imenovale novog CEO ili CFO između marta i aprila 2026. Za svaku kompaniju, agent mora pronaći autoritativni izvor koji potvrđuje imenovanje, plus dodatnu potvrdu sa liste rukovodstva. Ukupno se traži 140 dokazanih podataka.

Kako se ocenjuje? Sistem sam ponovo preuzima navedene izvore i proverava da li tekst zaista podržava tvrdnju. "Čak 57,5% citata koje je naš AI pronašao nisu u potpunosti podržavale tvrdnju", priznaje Perplexity. Njihov Search as Code sistem trenutno vodi na rang listi sa skorom od samo 0,363 - što pokazuje koliko je ovakav rad još uvek izazovan za AI.

Zašto je ovo bitno? Zato što kompanije već delegiraju AI agentima zadatke poput analize konkurencije, due diligence istraživanja ili pregleda akademskih radova. WANDR omogućava precizno merenje performansi i identifikaciju slabih tačaka - da li sistem ne može da pronađe dovoljno izvora, ili ne ume da izvuče sve potrebne informacije iz njih?

Iako Perplexity vodi na rang listi, nijedan sistem nije blizu rešenja kompletnog benchmarka. Najveći izazovi su pronalaženje svih relevantnih entiteta (discovery) i pravilno citiranje dokaza - čak 41,4% pronađenih stranica nije zadovoljilo sve kriterijume. Ovo otvara pitanje: Da li će sledeća generacija AI modela moći da savlada kompleksne istraživačke zadatke sa visokom tačnošću, ili će ljudi i dalje morati da proveravaku svaki korak?

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

OpenAI ulaže 750 milijardi dolara u infrastrukturu do 2030.
Veliki modeli

OpenAI ulaže 750 milijardi dolara u infrastrukturu do 2030.

Ogromna investicija OpenAI-ja u podatkovne centre uključuje i novi kampus u Džordžiji, ali pitanje je po kojoj ceni za životnu sredinu.

23. jul 2026.

Samsung pametne naočare: 9 sati baterije i AI funkcije uz Google i Bixby
Veliki modeli

Samsung pametne naočare: 9 sati baterije i AI funkcije uz Google i Bixby

Samsung otvara predstavu svojih pametnih naočara, sa impresivnom baterijom od 9 sati i saradnjom sa Google-om i brendovima Gentle Monster i Warby Parker.

22. jul 2026.

Simulacije postaju ključni alat za razvoj fizičke inteligencije
Veliki modeli

Simulacije postaju ključni alat za razvoj fizičke inteligencije

Dok AI modeli za jezik i viziju koriste ogromne online skupove podataka, roboti moraju da uče iz fizičkog sveta – što je sporo i skupo. Rešenje? Realistične simulacije.

22. jul 2026.

Komentari (0)

Učitavanje komentara...