„Anthropic“ generalinis direktorius Dario Amodei paragino lėtinti dirbtinio intelekto plėtrą ir pasiūlė trijų etapų planą, kaip modelių pažangą suderinti su saugumu, priežiūra ir reguliavimo institucijų pasirengimu.
Jis siūlo nepriklausomiems vertintojams, įskaitant METR, suteikti prieigą prie „Anthropic“ modelių, kad šie galėtų patikrinti, ar bendrovė laikosi deklaruojamos saugumo praktikos ir prisiimtų įsipareigojimų.
Išsamiame straipsnyje Amodei rašė, kad tokia prieiga yra pirmasis žingsnis kelyje, kurį jis vadina geriausiu būdu kontroliuoti dirbtinį intelektą.
„Anthropic“ teigia jau pradėjusi pirmąjį etapą, kuriame bendrovės pačios turi sudaryti sąlygas platesniam nepriklausomam vertinimui.
Antrajame etape numatomas pramonės bendradarbiavimas ir galimas bendras darbas su vyriausybėmis, siekiant nustatyti bendrus saugumo standartus bei apibrėžti nevaldomos DI pažangos tempo ribas. Amodei teigia, kad šiame etape daugiausia dėmesio būtų skiriama demokratinėse valstybėse veikiančioms bendrovėms, nes įstatymų priėmimas ir reguliavimo infrastruktūros kūrimas užtrunka, todėl pramonė turi imtis veiksmų pirmoji.

Trečiajame etape siekiama, kad autoritarinių valstybių vyriausybės įsipareigotų lėtinti plėtrą ir priimtų pasaulinius saugumo standartus. Amodei teigia, kad Jungtinės Valstijos ir kitos demokratinės šalys turėtų išlaikyti technologinį pranašumą prieš Kiniją ir kitas autoritarines valstybes.
Jo strategijoje taip pat numatoma riboti prieigą prie galingų lustų ir kovoti su tokiomis technikomis kaip distiliavimas, leidžiantis bendrovėms greičiau išmokyti mažesnius modelius imituoti didesnius.
Amodei išskyrė dvi pagrindines problemas. Pirmoji – rekursinio savęs tobulinimo, arba RSI, atsiradimas, kai sistemos apmoko viena kitą keičiančias naujas kartas, o jų gebėjimai gali augti svaiginančiu tempu ir galiausiai pranokti žmonių galimybes jas suprasti bei kontroliuoti.
Antra, jis paminėjo vasarą įvykusį incidentą, susijusį su „OpenAI“ ir „Hugging Face“, kai, jo teigimu, „agentų grupė iš esmės veikė kaip itin uoli populiacija“ ir vykdė kibernetines atakas prieš su jų misija nesusijusius taikinius.
„Anthropic“ teigia, kad pats „Claude“ pastaruoju metu buvo susijęs su keliais nevaldomo DI įsilaužimų incidentais, todėl bendrovės saugumo politika sulaukė daugiau dėmesio.
Amodei raginimą lėtinti modelių mokymą ir plėtrą pateikia kaip praktinį sprendimą, suteikiantį bendrovėms laiko kurti saugumo mechanizmus, o vyriausybėms – įvertinti modelius.




Diskusija
Palikti komentarą
Komentarai
Komentarų dar nėra. Būkite pirmas.