1981 m. atsiradusi ir dešimtmečius nepastebėta klaida tapo įžanga. Ji tiksliai nubrėžė toną naujausiam Zhipu AI pristatymui: GLM-5.3, 743 mlrd. parametrų kalbos modeliui, pritaikytam kodavimui, agentinėms darbo eigoms ir kibernetinio saugumo analizei.
Zhipu AI teigia, kad GLM-5.3 pasirodo ne kaip didesnis bazinis modelis, o kaip išmanesnis. Svoris išlieka 743 mlrd. parametrų, tačiau komanda iš esmės perdirbo potreniravimo sluoksnį: praturtino simuliuotas aplinkas, išplėtė užduočių įvairovę ir padidino interaktyvius skaičiavimo išteklius, kad išgautų našumo šuolį. Rezultatas labiau primena ne grubų mastelio didinimą, o tikslią inžinerinę korekciją.
Prieiga iš pradžių suteikiama per mokamą GLM Coding Plan planą ir ZCode platformą. API prieiga ir atsisiunčiami modelio svoriai numatyti etapais po pakopinių saugumo peržiūrų artimiausiomis savaitėmis, todėl organizacijos galės modelį išbandyti anksti, kol Zhipu vertins jo tinkamumą platesniam platinimui.

Žetonų efektyvumas tapo vienu svarbiausių rodiklių. Pačios Z.ai Code Bench teste GLM-5.3 pasiekė 34,5 % sėkmės rodiklį naudodamas maždaug 75 000 išvesties žetonų, o GLM-5.2 pasiekė 23,4 % sėkmę su maždaug 96 000 žetonų. Paprastai tariant: mažiau tuščio kalbėjimo, daugiau rezultatų. Būtent tokį patobulinimą inžinieriai pastebi pirmiausia.
Vertinant grynuosius programavimo gebėjimus, vaizdas mišrus. Terminal Bench 3.0, kuris matuoja našumą gyvose Linux aplinkose ir automatizuotose sistemose, pakėlė GLM-5.3 rezultatą iki 28,3 balo, palyginti su 4,6 ankstesnėje kartoje. Įspūdinga. Vis dėlto komerciniai varžovai tebepirmauja: Claude Fable 5 surinko 33,7, o GPT-5.6 Sol pasiekė 34,6 balo, išlaikydami aukščiausias pozicijas.
Realias programinės įrangos klaidų taisymo užduotis vertinusiame DeepSWE v1.1 teste GLM-5.3 užfiksavo 66,9 balo rezultatą, gerokai pagerindamas ankstesnio modelio pasiekimą, tačiau vos nusileisdamas tokiems konkurentams kaip Kimi K3 (67,5) ir Fable 5 (69,7). Išvada aiški: GLM-5.3 sumažina atotrūkį nuo atvirojo ir uždarojo kodo konkurentų, tačiau stipriausi įmonių technologijų rinkiniai išlieka itin konkurencingi.

Labiausiai GLM-5.3 nustebina kibernetinio saugumo srityje: CyberGym etalone jis užėmė pirmąją vietą, surinkęs 84,5 %, aplenkdamas Fable 5 (83,8 %) ir GPT-5.6 Sol (83,6 %). Zhipu paskelbė saugumo suvestinę, kurioje nurodoma, kad GLM-5.3 aptiko 2 436 pažeidžiamumus 269 atvirojo kodo projektuose, o 1 097 jų priskirti nuo vidutinės iki kritinės rizikos kategorijoms. Vienas radinys ypač išsiskiria: išnaudojimo būdas, kurio ištakos siekia 1981 m. ir kurio ankstesni skeneriai bei tyrėjai, kaip pranešama, vidutiniškai neaptikdavo 26,6 metų.
Visa tai GLM-5.3 pozicionuoja kaip rimtą iššūkį regioniniams konkurentams, pavyzdžiui, Kimi K3, ir kaip provokuojantį naują dalyvį šalia JAV komercinių modelių. Tai nėra dar vienas įprastas leidimas; tai pavyzdys, kaip atsisakant vien tik parametrų skaičiaus didinimo ir renkantis išmanesnį, tikslingą potreniravimą galima pasiekti apčiuopiamų rezultatų, o kartu gauti stiprų pranašumą kibernetinio saugumo srityje.
Ar GLM-5.3 paskatins tiekėjus atverti daugiau savo įrankių grandinių, ar privers pradėti naują etalonų rezultatams orientuotos inžinerijos etapą? Tai parodys artimiausi keli API bandymų ir bendruomenės vertinimo mėnesiai.




Diskusija
Palikti komentarą
Komentarai
Komentarų dar nėra. Būkite pirmas.