Straipsnis

Google Frozen v2: efektyvesnis AI serverių lustas 2028

Google kuria Frozen v2 serverių akceleratorių, kuriame Gemini architektūros dalys perkeliamos į silicį, siekiant mažesnės delsos, didesnio našumo ir taupesnio AI apdorojimo debesijoje.

Google Frozen v2: efektyvesnis AI serverių lustas 2028
Skaitymo laikas: 3 Minutės

Įsivaizduokite serverio lustą, kuris ne tik paleidžia modelį, bet ir subtiliai vadovaujasi jo veikimo logika. „Google“ inžinieriai tyliai kuria būtent tai: serverių akceleratorių kodiniu pavadinimu „Frozen v2“, kuriame dalis „Gemini“ architektūros perkeliama tiesiai į silicį, siekiant gerokai didesnio efektyvumo ir mažesnės delsos.

Ši informacija pateikta „The Information“ ataskaitoje, kurioje remiamasi dviem su projektu susipažinusiais šaltiniais. Jų teiginys įspūdingas: „Frozen v2“ galėtų apdoroti nuo šešių iki dešimties kartų daugiau žetonų vienam vatui nei naujausi „Google“ tenzoriniai procesoriai. Numatytas terminas? 2028 metai. Motyvacija aiški ir gerai pažįstama visiems, stebintiems, kaip debesijos paklausa lenkia turimus pajėgumus: pranešama, kad „Google Cloud“ dėl dirbtinio intelekto apdorojimo resursų trūkumo turėjo atsisakyti dalies klientų sandorių.

Architektūros įterpimas vietoje taisyklių

Tradiciniai TPU ir GPU yra universalūs sprendimai. Įkeliate modelį, o aparatinė įranga vykdymo metu priima daugybę sprendimų: kaip perkelti duomenis, kurias operacijas suplanuoti, kada kreiptis į atmintį. Toks lankstumas yra labai naudingas. Tačiau jis turi kainą: papildomas sąnaudas. „Frozen v2“ renkasi kitą kryptį: tam tikri „Gemini“ būdingi sprendimai įtvirtinami tranzistorių lygio logikoje. Rezultatas: mažiau vykdymo žingsnių ir mažiau duomenų perkėlimo kiekvienai užklausai. Mažiau judėjimo. Mažiau pridėtinių sąnaudų. Mažesnė delsa. Todėl tampa realistiškesni nauji realiojo laiko naudojimo scenarijai.

Ant stalo buvo ir dar drąsesnė idėja. Ankstyvieji „Frozen“ projektai, kuriems, kaip pranešama, vadovavo Jeffas Deanas, bandė modelio svorius tiesiogiai įrašyti į silicį. Tai būtų radikali optimizacija. Tačiau toks lustas greitai pasentų, nes su viena modelio versija susieti lustai turi labai trumpą praktinio naudojimo laiką. „Google“ pasirinko tarpinį kelią. „Frozen v2“ turėtų įterpti architektūros karkasą, bet palikti svorius atnaujinamus, todėl tas pats lustas galėtų aptarnauti kelias „Gemini“ laidas, jei jos laikytųsi tų pačių architektūrinių principų.

Šis metodas galėtų pakankamai sutrumpinti atsako laiką, kad atsivertų naujos interaktyvių ir mažos delsos dirbtinio intelekto programų klasės.

„Google“ neketina „Frozen v2“ pakeisti savo TPU parko. Į tai reikėtų žiūrėti kaip į eksperimentinę kryptį, veikiančią greta TPU gamybos: bandomąją platformą labiau specializuotam siliciui, kol modelių dizainas stabilizuojasi. Pats TPU produktų planas neseniai atskyrė mokymo ir inferencijos poreikius, kai balandį „Cloud Next“ renginyje buvo pristatyti aštuntosios kartos lustai. „Frozen v2“ iniciatyva yra mažesnio masto; „Google“ neplanuoja tokios masinės gamybos apimties kaip TPU atveju.

Numatomas „Frozen v2“ pasirodymas taip pat dera su kitais pramonės žingsniais. Pranešama, kad „Google“ sudarė sutartį su „Intel“ dėl daugiau kaip trijų milijonų TPU lustų pakavimo iki 2028 metų. Tuo pat metu startuoliai ir konkurentai jau tyrinėja modelio logiką suprantantį silicį. Toronte įsikūrusi „Taalas“ pristatė savo HC1 lustą, susietą su „Llama 3.1 8B“, ir teigia pasiekianti 17 000 žetonų per sekundę be korpuse integruotos HBM atminties. Startuolis pritraukė apie 186 mln. eurų finansavimo. O praėjusiais metais „Nvidia“ pasirašė technologijų licencijavimo sutartį su „Groq“, kurios vertė siekia apie 18,6 mlrd. eurų. Tai rodo, kad rinka mato didelę vertę derinant modelio elgseną ir aparatinę įrangą.

Yra ir kompromisų. Architektūros įterpimas sumažina kai kurių rūšių lankstumą. Jis palankesnis tiems naudojimo atvejams, kuriuose modelių šeimos ilgainiui išlieka nuoseklios. Taip pat keičiasi produkto gyvavimo ciklas: pagal modelio architektūrą sukurtas silicis turi būti pagrįstas nuspėjamu dizaino stabilumu ir diegimo mastu. Tai paaiškina atsargią „Google“ poziciją. „Frozen v2“ yra eksperimentinis projektas; ne kiekvienas eksperimentas tampa produktu.

Kol kas „Google“ viešai nepatvirtino „Frozen v2“. Bendrovės atstovas „The Information“ priminė, kad daugelis vidinių projektų niekada nepasiekia gamybos. Vis dėlto pagrindinė idėja, dalį modelio logikos perkelti į silicį, kad būtų taupoma energija ir mažinama delsa, iš akademinio smalsumo virto konkurencine strategija. Tikėtina, kad vis daugiau bendrovių bandys panašius modelio logiką suprantančios aparatinės įrangos ir atnaujinamų svorių derinius, nes efektyvaus, mažos delsos dirbtinio intelekto paklausa toliau auga.

Austėja Kavaliauskaitė

„Technologijos visada mane žavėjo – nuo išmaniųjų telefonų iki dirbtinio intelekto proveržių. Džiaugiuosi galėdama dalintis naujienomis su jumis kiekvieną dieną.“

Palikti komentarą

Komentarai

Komentarų dar nėra. Būkite pirmas.