AI[kutak]
Veliki modeli

NVIDIA predstavlja Nemotron3Embed: Najmoćniji open source model za pretraživanje

Novi NVIDIA modeli postigli su vrhunske rezultate na benchmarku za pretraživanje, nudeći podršku za 34 jezika i optimizaciju za Blackwell arhitekturu.

Uredio: Stevan K.20:23, 17. jul 2026.1 min čitanja
NVIDIA predstavlja Nemotron3Embed: Najmoćniji open source model za pretraživanje
Ilustracija je generisana veštačkom inteligencijom.

Ako tražite najbolji open source model za pretraživanje, NVIDIA ima ponudu koja teško može biti bolja. Njihova nova serija Nemotron3Embed modela, posebno dizajnirana za RAG, inteligentno pretraživanje pitanja, pretraživanje koda i scenarije sačuvanja memorije agenata, postavila je nove standarde u ovoj oblasti. Najveći od njih, Nemotron-3-Embed-8B-BF16, zauzeo je prvo mesto na RTEB benchmarku sa prosečnim NDCG@10 skorom od 78.46.

Serija obuhvata tri modela: precizni Nemotron-3-Embed-8B-BF16, lakši Nemotron-3-Embed-1B-BF16 i Nemotron-3-Embed-1B-NVFP4, optimizovan za Blackwell arhitekturu. Svi koriste Transformer enkoder sa bidirekcionim attention masking training-om i podržavaju maksimalnu dužinu sekvence od 32,768 tokena. Zanimljivo je da su svi bazni modeli zasnovani na Mistral arhitekturi, sa 8B verzijom izvedenom iz Ministral-3-8B-Instruct-2512.

Za one koji traže efikasnost, 1B-NVFP4 verzija pokazuje impresivne rezultate. Sa samo 0.38 izgubljenih poena u odnosu na BF16 verziju, ona zadržava 99.5% preciznosti, uz dvostruko veći propusni kapacitet na Blackwell arhitekturi. Ova verzija je rezultat sofisticiranog procesa kompresije i kvantizacije, što je čini idealnom za scenarije sa ograničenim resursima.

Na nivou implementacije, modeli se razlikuju po podržanim framework-ima. Dok 8B i 1B BF16 verzije podržavaju Transformers i Sentence Transformers, 1B-NVFP4 radi samo sa vLLM0.25.0 /v2/embed interfejsom. NVIDIA je takođe objavila optimizovan NIM mikroservis za 1B model, napisan u Rust-u, koji dostigne ili nadmašuje performanse vLLM checkpoint-a na GB200 i RTX PRO6000 platformama.

Što se tiče praktične primene, ovi modeli podržavaju multijezičko pretraživanje u preduzećima, pretraživanje koda i duge kontekstualne razgovore. Za scenarije sa ograničenim budžetom, NVIDIA predlaže hijerarhijsku RAG strategiju koja kombinuje snage 1B-NVFP4 i 8B modela.

Sa kompletnim primerima koda za lokalno i serversko izvršavanje, NVIDIA čini lako početak sa ovim modelima. Ključna odlika je upotreba query: i passage: prefiksa za razlikovanje upita i dokumenata, što omogućava direktno izračunavanje kosinusne sličnosti.

Kako će ovi modeli uticati na budućnost pretraživanja i interakcije sa AI sistemima? Sa svojom kombinacijom moći, fleksibilnosti i optimizacije, Nemotron3Embed serija izgleda kao ozbiljan korak napred u ovoj oblasti.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...