NVIDIA predstavlja Nemotron3Embed: Najmoćniji open source model za pretraživanje
Novi NVIDIA modeli postigli su vrhunske rezultate na benchmarku za pretraživanje, nudeći podršku za 34 jezika i optimizaciju za Blackwell arhitekturu.
Ako tražite najbolji open source model za pretraživanje, NVIDIA ima ponudu koja teško može biti bolja. Njihova nova serija Nemotron3Embed modela, posebno dizajnirana za RAG, inteligentno pretraživanje pitanja, pretraživanje koda i scenarije sačuvanja memorije agenata, postavila je nove standarde u ovoj oblasti. Najveći od njih, Nemotron-3-Embed-8B-BF16, zauzeo je prvo mesto na RTEB benchmarku sa prosečnim NDCG@10 skorom od 78.46.
Serija obuhvata tri modela: precizni Nemotron-3-Embed-8B-BF16, lakši Nemotron-3-Embed-1B-BF16 i Nemotron-3-Embed-1B-NVFP4, optimizovan za Blackwell arhitekturu. Svi koriste Transformer enkoder sa bidirekcionim attention masking training-om i podržavaju maksimalnu dužinu sekvence od 32,768 tokena. Zanimljivo je da su svi bazni modeli zasnovani na Mistral arhitekturi, sa 8B verzijom izvedenom iz Ministral-3-8B-Instruct-2512.
Za one koji traže efikasnost, 1B-NVFP4 verzija pokazuje impresivne rezultate. Sa samo 0.38 izgubljenih poena u odnosu na BF16 verziju, ona zadržava 99.5% preciznosti, uz dvostruko veći propusni kapacitet na Blackwell arhitekturi. Ova verzija je rezultat sofisticiranog procesa kompresije i kvantizacije, što je čini idealnom za scenarije sa ograničenim resursima.
Na nivou implementacije, modeli se razlikuju po podržanim framework-ima. Dok 8B i 1B BF16 verzije podržavaju Transformers i Sentence Transformers, 1B-NVFP4 radi samo sa vLLM0.25.0 /v2/embed interfejsom. NVIDIA je takođe objavila optimizovan NIM mikroservis za 1B model, napisan u Rust-u, koji dostigne ili nadmašuje performanse vLLM checkpoint-a na GB200 i RTX PRO6000 platformama.
Što se tiče praktične primene, ovi modeli podržavaju multijezičko pretraživanje u preduzećima, pretraživanje koda i duge kontekstualne razgovore. Za scenarije sa ograničenim budžetom, NVIDIA predlaže hijerarhijsku RAG strategiju koja kombinuje snage 1B-NVFP4 i 8B modela.
Sa kompletnim primerima koda za lokalno i serversko izvršavanje, NVIDIA čini lako početak sa ovim modelima. Ključna odlika je upotreba query: i passage: prefiksa za razlikovanje upita i dokumenata, što omogućava direktno izračunavanje kosinusne sličnosti.
Kako će ovi modeli uticati na budućnost pretraživanja i interakcije sa AI sistemima? Sa svojom kombinacijom moći, fleksibilnosti i optimizacije, Nemotron3Embed serija izgleda kao ozbiljan korak napred u ovoj oblasti.