AI[kutak]
Veliki modeli

Runway optimizuje raspodelu GPU između produkcije i istraživanja

Kako Runway rešava dilemma između potreba za produkcijom i istraživanjem uz pomoć naprednog kontrolera kapaciteta.

Uredio: Stevan K.22:01, 16. jul 2026.1 min čitanja
Runway optimizuje raspodelu GPU između produkcije i istraživanja
Ilustracija je generisana veštačkom inteligencijom.

Da li je moguće istovremeno optimizovati potrebe za GPU snagom u produkciji i istraživanju? Runway je razvio kontroler kapaciteta koji dinamički preraspodeljuje GPU resurse između ova dva ključna sektora, čime se smanjuje vreme čekanja u redu tokom dana i oslobađa više resursa za istraživanje tokom noći.

Produkcijski zahtevi za AI inferencijom variraju tokom dana. Čak i sa globalnom korisničkom bazom, najveći deo prometa koncentriše se oko radnog vremena u Severnoj Americi, sa vrhuncem oko 9 ujutro ET i padom na manje od polovine tog nivoa do 8 uveče ET. Ovo je stari dilema za svaku AI kompaniju: ili preopteretiti sistem tokom jutarnjeg peaks-a ili ostaviti većinu GPU resursa neiskorišćenih tokom noći.

Runway je rešio ovaj problem uz pomoć kontrolera kapaciteta nazvanog Deckard, koji dinamički preraspodeljuje GPU resurse između produkcije i istraživanja. Deckard upravlja dve ključne stvari: brojem replika u Kubernetes inferencijskim deploymentima i veličinom osnovnih cloud GPU node pool-ova, što mu omogućava fizičko premeštanje nodova između produkcije i istraživačkih klastera.

Umesto kontinualnog preraspoređivanja, kontroler koristi diskretne vremenske prozore sa unapred definisanim rasporedima. Ovaj pristup je izabran zbog visokih troškova premeštanja GPU resursa između klastera, što može trajati od 20 do 60 minuta.

Za optimizaciju kapaciteta, Runway se oslanja na teoriju čekanja (queueing theory), matematičku disciplinu koja datira još iz 1909. godine. Korišćenjem ključnih varijabli kao što su stopa dolazaka, stopa servisiranja i broj servera, kontroler može predvideti koliko GPU resursa je potrebno da bi se zadovoljili zahtevi korisnika.

Runway je razvio i jednostavan CLI alat pod nazivom deckard allocate koji omogućava generisanje rasporeda kapaciteta na osnovu stvarnih podataka o zahtevima. Ovaj alat koristi marginalne dobitke kako bi optimizovao raspodelu GPU resursa između različitih radnih opterećenja.

Jedna od ključnih prednosti ovog pristupa je što omogućava istraživačkim timovima da koriste preemptible nodove, što znači da duge obuke neće biti prekinute kada produkcija zatraži svoje resurse nazad. Ovo je postignuto označavanjem nodova koji mogu biti premešteni kao ephemeral, dok ostali nodovi ostaju rezervisani isključivo za istraživanje.

Runwayov pristup pokazuje da je moguće istovremeno optimizovati produkciju i istraživanje bez kompromisa. Korišćenjem naprednih matematičkih modela i jednostavnih, ali efikasnih alata, kompanija je uspela da smanji vreme čekanja korisnika i poveća dostupnost resursa za istraživanje.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...
Runway optimizuje raspodelu GPU između produkcije i istraživanja - AI[kutak]