1B AI model koji radi lokalno bez interneta: šta donosi nova verzija
MiniCPM5-1B-Claude-Opus-Fable5-Thining je novi model koji može da se pokreće na ličnom računaru bez potrebe za internetom ili API ključem. Sa samo 657MB u najmanjoj kvantizaciji, nudi impresivnih 128K tokena konteksta.
Za razliku od većine AI modela koji zahtevaju pristup internetu i plaćene API ključeve, ovaj 1B parametarski model može da radi potpuno lokalno na vašem hardveru. Razvijač GnLOLot objavio je MiniCPM5-1B-Claude-Opus-Fable5-Thinking, verziju optimizovanu za llama.cpp i slične platforme.
Model koristi OpenBMB-ov MiniCPM5-1B kao osnovu, sa 1.08 milijardi parametara i 24 sloja. Najimpresivnija specifikacija je kontekstni prozor od 131.072 tokena, što ga čini jednim od najvećih u klasi 1B modela. Dostupne su četiri kvantizacije, od 657MB (Q4_K_M) do 2.1GB (F16), sa Q8_0 kao preporučenom opcijom.
Ključna stvar koju treba znati je da ovaj model nije klasična distilacija već fino podešavanje na izlazima Claude Fable 5 modela. To znači da imitira stil odgovora, ali ne i dubinske sposobnosti većih modela. Korisnici mogu očekivati dobro formatirane odgovore, ali ne i napredno rezonovanje.
Model podržavaju popularne lokalne platforme kao što su llama.cpp, Ollama, LM Studio i KoboldCpp. Za pokretanje preko Ollama, dovoljno je ukucati jednostavnu komandu sa željenom kvantizacijom. U režimu "Think" (omogućen preko enable_thinking), model će prikazati i korake rezonovanja pre konačnog odgovora.
Iako je tehnički impresivan, model dolazi bez objavljenih benchmarkova ili detalja o skupu podataka za obuku. Takođe, pitanje licenciranja ostaje otvoreno – dok su osnovni težini pod Apache-2.0 licencom, korišćenje Claude-ovih izlaza za fino podešavanje može predstavljati pravni problem.
Za sada, ovo je zanimljiv eksperiment koji pokazuje koliko se može postići sa malim modelom – ali ne očekujte čuda. Prava vrednost je u tome što pruža pristup AI-u bez oslanjanja na cloud servise, što može biti presudno za neke korisnike.