Straipsnis

Alibaba Qwen3.8-Max: naujas didžiųjų DI modelių šuolis

„Alibaba“ pristato „Qwen3.8-Max“, 2,4 trilijono parametrų multimodalinį DI modelį su MoE architektūra, ilgu kontekstu ir atvirais svoriais verslui bei kūrėjams.

Alibaba Qwen3.8-Max: naujas didžiųjų DI modelių šuolis
Skaitymo laikas: 4 Minutės

Įsivaizduokite, kad dirbtiniam intelektui pateikiate milijono puslapių sutartį, plačią programinio kodo bazę ar kelių valandų vaizdo įrašą ir beveik nelaukdami gaunate nuoseklų, praktiškai pritaikomą atsakymą. Būtent tokį pažadą „Alibaba“ sieja su „Qwen3.8-Max“, iki šiol didžiausiu ir pajėgiausiu bendrovės modeliu.

Kodėl dydis ir efektyvumas staiga tapo tokie svarbūs

„Qwen3.8-Max“ turi maždaug 2,4 trilijono parametrų, todėl patenka į tą pačią išskirtinę kategoriją kaip „Moonshot AI“ modelis „Kimi K3“, turintis apie 2,8 trilijono parametrų. Parametrų skaičius nėra galutinis kokybės matas, tačiau jis vis dar dažnai naudojamas kaip trumpas būdas nusakyti skaičiavimo galią ir mokymo duomenų kiekį, investuotą į šias sistemas. Praktikoje kūrėjams ir verslui svarbiausia tai, kiek naudingo darbo tokie dirbtinio intelekto modeliai gali atlikti neišpučiant debesijos paslaugų sąskaitų.

Čia svarbų vaidmenį atlieka „Alibaba“ architektūriniai sprendimai. Bendrovė teigia, kad „Qwen3.8-Max“ naudoja „Mixture of Experts“, arba MoE, architektūrą. Užuot kiekvienai užklausai aktyvavusi visą tinklą, MoE nukreipia užduotis į specializuotus potinklius. „Alibaba“ įgyvendinime vienai užklausai aktyvūs būna tik apie 95 mlrd. parametrų. Poveikis akivaizdus: mažesnė delsa ir gerokai mažesnė išvedimo kaina, kartu išlaikant milžinišką bendrą modelio žinių bazę. „Alibaba“ netgi teigia, kad modelis per 16 dienų užbaigė visą programinės įrangos inžinerijos projektą, taip pabrėždama praktinį našumą, o ne vien gražiai atrodančius etaloninių testų rezultatus.

Atviri svoriai yra dar viena svarbi šios istorijos dalis. Daugelis Kinijos dirbtinio intelekto komandų išleidžia didelius modelius su atsisiunčiamais baziniais svoriais, kviesdamos kūrėjus juos paleisti, pritaikyti ir eksperimentuoti lokaliai. Tai skiriasi nuo kelių JAV bendrovių strategijos, kurios pagrindinius modelius laiko uždarus, o našumo rodiklius pateikia ne visada skaidriai. Atvirumas spartina eksperimentavimą ir perkelia konkurenciją nuo ribotos prieigos prie to, ką komandos iš tikrųjų sukuria naudodamos šiuos modelius.

Viešuose reitinguose naujasis modelis jau sulaukė daug dėmesio. „Arena.AI“ palyginimų platformoje „Qwen3.8-Max“ užima aukščiausią vietą tarp Kinijos teksto modelių, nors pasauliniame teksto modelių reitinge atsilieka nuo „Claude Fable 5“ ir kelių „Anthropic“ „Opus“ variantų. Kalbant apie vaizdus ir vizualinį supratimą, „Alibaba“ teigia, kad „Qwen3.8-Max“ pasiekė antrą vietą pasaulyje, nusileisdamas vienam „Claude Fable 5“ variantui. Šios pozicijos rodo, kad modelis yra tikras multimodalinis dirbtinio intelekto konkurentas, o ne vien padidintas teksto generavimo variklis.

Tiek „Qwen3.8-Max“, tiek „Kimi K3“ palaiko multimodalines įvestis, tekstą, vaizdus ir vaizdo įrašus, ir gali apdoroti iki vieno milijono žetonų viename konteksto lange. Žetonai yra pagrindinės teksto ir kodo dalys; didžiulių žetonų langų palaikymas reiškia, kad modelis vienu kartu gali aprėpti ištisas teisines bylas, ilgas technines specifikacijas ar iš kelių modulių sudarytas programas. Ši galimybė keičia darbo procesus, kuriuose gali padėti dirbtinis intelektas, pereinant nuo trumpų ištraukų ir užklausų prie viso dokumento lygmens samprotavimo.

Ką tai reiškia produktų komandoms ir įmonėms? Pirma, masto ir kainos pusiausvyra pasikeitė. MoE tipo architektūros žada didelės talpos modelius, kurie aktyvuoja tik dalį savo tinklų, todėl paslaugų teikėjai gali siūlyti didelio pajėgumo išvedimą be linijinio sąnaudų augimo. Antra, atviri baziniai modeliai kviečia platesnę kūrėjų ekosistemą optimizuoti, papildomai mokyti ir diegti konkrečioms sritims pritaikytas programas. Trečia, multimodalinės ir ilgo konteksto galimybės daro šiuos modelius patrauklius žinių darbo automatizavimui, sudėtingam kodo generavimui, reguliacinei ir teisinei analizei.

Prieinamumas aiškus: „Alibaba“ teigia, kad „Qwen3.8-Max“ kitą savaitę bus pasiūlytas per jos „Model Studio“ platformą. Tyrėjams ir startuoliams, kurie nori modelius paleisti arba pritaikyti lokaliai, bazinių svorių prieinamumas gali paversti „Qwen3.8-Max“ tikru pamatiniu modeliu, kuriuo komandos remiasi kurdamos sprendimus, o ne vien pasiekia jį per API.

Konkurencija kaista. Kinijos laboratorijos sparčiai didina atvirų modelių mastą ir kartu eksperimentuoja su efektyvumui pirmiausia skirta architektūra. Vakarų žaidėjai daug dėmesio skiria saugai, suderinimui ir uždarų modelių valdymui. Vartotojai ir įmonės iš šios įvairovės gali laimėti: daugiau pasirinkimų, greitesnės iteracijos ir, idealiu atveju, modeliai, pritaikyti konkretiems verslo poreikiams, o ne universalios juodosios dėžės.

Taigi pagrindinė žinia paprasta: „Alibaba“ pristatė dar vieną svarbų dalyvį didžiųjų modelių lenktynėse. Subtilesnė mintis ta, kad konkurencija dabar sukasi apie praktiškai panaudojamą pajėgumą, modelius, kurie turi didžiulę žinių bazę, bet protingai pasirenka, kada išnaudoti savo skaičiavimo galią. Tai yra tikrasis inžinerinis statymas, o „Qwen3.8-Max“ yra „Alibaba“ pasirinkta korta.

Austėja Kavaliauskaitė

„Technologijos visada mane žavėjo – nuo išmaniųjų telefonų iki dirbtinio intelekto proveržių. Džiaugiuosi galėdama dalintis naujienomis su jumis kiekvieną dieną.“

Palikti komentarą

Komentarai

Komentarų dar nėra. Būkite pirmas.