Runway optimizuje raspodelu GPU između produkcije i istraživanja
Kako Runway rešava dilemma između potreba za produkcijom i istraživanjem uz pomoć naprednog kontrolera kapaciteta.
Da li je moguće istovremeno optimizovati potrebe za GPU snagom u produkciji i istraživanju? Runway je razvio kontroler kapaciteta koji dinamički preraspodeljuje GPU resurse između ova dva ključna sektora, čime se smanjuje vreme čekanja u redu tokom dana i oslobađa više resursa za istraživanje tokom noći.
Produkcijski zahtevi za AI inferencijom variraju tokom dana. Čak i sa globalnom korisničkom bazom, najveći deo prometa koncentriše se oko radnog vremena u Severnoj Americi, sa vrhuncem oko 9 ujutro ET i padom na manje od polovine tog nivoa do 8 uveče ET. Ovo je stari dilema za svaku AI kompaniju: ili preopteretiti sistem tokom jutarnjeg peaks-a ili ostaviti većinu GPU resursa neiskorišćenih tokom noći.
Runway je rešio ovaj problem uz pomoć kontrolera kapaciteta nazvanog Deckard, koji dinamički preraspodeljuje GPU resurse između produkcije i istraživanja. Deckard upravlja dve ključne stvari: brojem replika u Kubernetes inferencijskim deploymentima i veličinom osnovnih cloud GPU node pool-ova, što mu omogućava fizičko premeštanje nodova između produkcije i istraživačkih klastera.
Umesto kontinualnog preraspoređivanja, kontroler koristi diskretne vremenske prozore sa unapred definisanim rasporedima. Ovaj pristup je izabran zbog visokih troškova premeštanja GPU resursa između klastera, što može trajati od 20 do 60 minuta.
Za optimizaciju kapaciteta, Runway se oslanja na teoriju čekanja (queueing theory), matematičku disciplinu koja datira još iz 1909. godine. Korišćenjem ključnih varijabli kao što su stopa dolazaka, stopa servisiranja i broj servera, kontroler može predvideti koliko GPU resursa je potrebno da bi se zadovoljili zahtevi korisnika.
Runway je razvio i jednostavan CLI alat pod nazivom deckard allocate koji omogućava generisanje rasporeda kapaciteta na osnovu stvarnih podataka o zahtevima. Ovaj alat koristi marginalne dobitke kako bi optimizovao raspodelu GPU resursa između različitih radnih opterećenja.
Jedna od ključnih prednosti ovog pristupa je što omogućava istraživačkim timovima da koriste preemptible nodove, što znači da duge obuke neće biti prekinute kada produkcija zatraži svoje resurse nazad. Ovo je postignuto označavanjem nodova koji mogu biti premešteni kao ephemeral, dok ostali nodovi ostaju rezervisani isključivo za istraživanje.
Runwayov pristup pokazuje da je moguće istovremeno optimizovati produkciju i istraživanje bez kompromisa. Korišćenjem naprednih matematičkih modela i jednostavnih, ali efikasnih alata, kompanija je uspela da smanji vreme čekanja korisnika i poveća dostupnost resursa za istraživanje.