Anthropic lansira Claude Opus 5: Dvostruko brži od prethodnika, cena ostaje ista
Novi flagship model kompanije Anthropic donosi impresivne performanse u agentičkim zadacima i bezbednosna poboljšanja, dok zadržava istu cenu kao prethodnik.
Claude Opus 5 postigao je zlatni medaljski rezultat na Međunarodnoj matematičkoj olimpijadi (IMO 2026), rešivši sve zadatke sa savršenim skorom. Ovo je samo jedan od impresivnih rezultata novog flagship modela kompanije Anthropic, koji sada postaje dostupan korisnicima bez povećanja cene.
Na FrontierBench v0.1 testu, Opus 5 pokazuje dramatičan skok u performansama - sa 18,7% na 43,3% u odnosu na prethodnu verziju 4.8. Što je još impresivnije, model je dostigao 44,4% na postavci xhigh effort, koristeći 25% manje tokena nego na maksimalnom podešavanju. U praktičnim agentičkim zadacima, poput OSWorld 2.0, model je porastao sa 55,7% na 70,57%.
Cene su ostale iste - $5 po milionu ulaznih tokena i $25 po milionu izlaznih tokena, što čini Opus 5 dvostruko jeftinijim u odnosu na Claude Fable 5 sa sličnim performansama. Kontekstni prozor ostaje 1M tokena kao podrazumevano i maksimalno, sa izlazom do 128k tokena na standardnom API-ju.
Bezbednost je bila ključni fokus. Stopa uspeha u prompt injection napadima pala je sa 5,5% na samo 2,0%, a u browser okruženjima sa 31,5% na samo 3,70%. Štaviše, sa uključenim automatskim režimom, model je postigao 0% uspešnih napada u svih 129 testiranih okruženja.
U kibernetičkoj bezbednosti, Anthropic je delimično olabavio zaštite - dozvoljavajući modelu da pronalazi ranjivosti u izvornom kodu, ali i dalje blokirajući generisanje eksploatacija. Opus 5 je proizveo 99 eksploatacija za izvršavanje proizvoljnog koda, što je znatno manje od Mythos 5 sa 132.
Za developere, najveće promene su uključivanje "thinking" moda podrazumevano i nove restrikcije - sada vraća grešku 400 ako pokušate da onemogućite thinking na visokim nivoima efforta. Takođe, preporučuje se brisanje verifikacionih promptova jer model sada samostalno proverava svoj rad.
Da li je ovo krajnji model za kompleksne zadatke? Rezultati na ARC-AGI-3 testu (30,16%) koji je četiri puta bolji od prethodnih vodećih rezultata sugerišu da Opus 5 ozbiljno napreduje ka AGI, iako kompanija i dalje klasifikuje model u CB-1 kategoriji bez prelaska R&D praga.