AI[kutak]
Veliki modeli

Runway optimizuje raspodelu GPU između produkcije i istraživanja

Kako Runway rešava dilemma između potreba za produkcijom i istraživanjem uz pomoć naprednog kontrolera kapaciteta.

Stevan K. • 22:01, 16. jul 2026.1 min čitanja
Runway optimizuje raspodelu GPU između produkcije i istraživanja

Da li je moguće istovremeno optimizovati potrebe za GPU snagom u produkciji i istraživanju? Runway je razvio kontroler kapaciteta koji dinamički preraspodeljuje GPU resurse između ova dva ključna sektora, čime se smanjuje vreme čekanja u redu tokom dana i oslobađa više resursa za istraživanje tokom noći.

Produkcijski zahtevi za AI inferencijom variraju tokom dana. Čak i sa globalnom korisničkom bazom, najveći deo prometa koncentriše se oko radnog vremena u Severnoj Americi, sa vrhuncem oko 9 ujutro ET i padom na manje od polovine tog nivoa do 8 uveče ET. Ovo je stari dilema za svaku AI kompaniju: ili preopteretiti sistem tokom jutarnjeg peaks-a ili ostaviti većinu GPU resursa neiskorišćenih tokom noći.

Runway je rešio ovaj problem uz pomoć kontrolera kapaciteta nazvanog Deckard, koji dinamički preraspodeljuje GPU resurse između produkcije i istraživanja. Deckard upravlja dve ključne stvari: brojem replika u Kubernetes inferencijskim deploymentima i veličinom osnovnih cloud GPU node pool-ova, što mu omogućava fizičko premeštanje nodova između produkcije i istraživačkih klastera.

Umesto kontinualnog preraspoređivanja, kontroler koristi diskretne vremenske prozore sa unapred definisanim rasporedima. Ovaj pristup je izabran zbog visokih troškova premeštanja GPU resursa između klastera, što može trajati od 20 do 60 minuta.

Za optimizaciju kapaciteta, Runway se oslanja na teoriju čekanja (queueing theory), matematičku disciplinu koja datira još iz 1909. godine. Korišćenjem ključnih varijabli kao što su stopa dolazaka, stopa servisiranja i broj servera, kontroler može predvideti koliko GPU resursa je potrebno da bi se zadovoljili zahtevi korisnika.

Runway je razvio i jednostavan CLI alat pod nazivom deckard allocate koji omogućava generisanje rasporeda kapaciteta na osnovu stvarnih podataka o zahtevima. Ovaj alat koristi marginalne dobitke kako bi optimizovao raspodelu GPU resursa između različitih radnih opterećenja.

Jedna od ključnih prednosti ovog pristupa je što omogućava istraživačkim timovima da koriste preemptible nodove, što znači da duge obuke neće biti prekinute kada produkcija zatraži svoje resurse nazad. Ovo je postignuto označavanjem nodova koji mogu biti premešteni kao ephemeral, dok ostali nodovi ostaju rezervisani isključivo za istraživanje.

Runwayov pristup pokazuje da je moguće istovremeno optimizovati produkciju i istraživanje bez kompromisa. Korišćenjem naprednih matematičkih modela i jednostavnih, ali efikasnih alata, kompanija je uspela da smanji vreme čekanja korisnika i poveća dostupnost resursa za istraživanje.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi
Veliki modeli

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?

21. jul 2026.

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu
Veliki modeli

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu

Kineski gigant osvaja tržište tekst-u-govor tehnologije sa modelom koji je prestigao sve konkurente po kvalitetu, a po ceni je tri puta jeftiniji.

21. jul 2026.

Meta otvara Astryx, dizajn sistem za ljude i AI agente
Open Source

Meta otvara Astryx, dizajn sistem za ljude i AI agente

Meta je pustila u javnu beta verziju Astryx, svoj najkorišćeniji interni dizajn sistem sa 150+ komponenti, optimizovan za saradnju ljudi i veštačke inteligencije.

21. jul 2026.

Komentari (0)

Učitavanje komentara...