Google esitteli 30. syyskuuta uuden kärkimallinsa Gemini 4 Argonin. Yhtiön mukaan malli yltää alan huipulle ohjelmistokehityksessä, yritysten tietotyössä ja kyberpuolustuksessa. Tavallisille käyttäjille ja kehittäjille Argon ei kuitenkaan vielä aukea.
Ensimmäisenä mallin saavat käyttöönsä valitut tietoturva-asiantuntijat Googlen Fairwind-ohjelman kautta. Julkaisu tulee kuukausia odotettua myöhemmin: kesäkuussa luvattu Gemini 3.5 Pro jäi kokonaan väliin, ja Google keskittyi kesän ajan pienempiin Flash-malleihin. Uutisesta kertoi Google DeepMindin Koray Kavukcuoglu yhtiön blogissa.
Koodauksessa ja tietotyössä kärkipaikalle
Google nostaa Argonin vahvuuksista esiin erityisesti pitkäkestoiset ohjelmistotehtävät. DeepSWE v1.1 -testissä, joka mittaa todellisia ja monivaiheisia kehitystehtäviä, malli saavutti 77,9 prosentin tuloksen. Ars Technican mukaan luku ylittää OpenAI:n GPT-6 Astran ja Anthropicin Opus 5.5:n tulokset.
Koodauksen ulkopuolella Argon johtaa Vals Index -vertailua, joka painottaa rahoitus-, laki-, vero- ja koodaustehtäviä niiden taloudellisen merkityksen mukaan. Zapierin AutomationBench-testissä, joka mittaa liiketoimintaprosessien läpivientiä alusta loppuun, malli sijoittui ensimmäiseksi 51,3 prosentin pisteillä.
Googlen sisällä malli on jo laajassa käytössä. Argon-agentit siirtävät C- ja C++-koodikantoja Rust-kielelle, suurimmillaan yli 800 000 rivin Zircon-ytimessä. Avoimen libgav1-videodekooderin Rust-versio nopeutui 2,7-kertaiseksi, kun agentit korvasivat 32 000 riviä SIMD-koodia turvallisella Rustilla.
Lisäksi agentit analysoivat palvelinkeskusten profilointidataa ja vapauttivat yli 300 tebitavua muistia. Googlen arvion mukaan kokonaissäästö voi nousta 500 tebitavusta yhteen pebitavuun.

Miljoonan tokenin vastaus yhdellä kertaa
Teknisesti merkittävin muutos koskee vastauksen pituutta. Argon voi tuottaa yhdellä kertaa jopa miljoona tokenia, kun aiempien Gemini-mallien raja oli 64 000 tokenia. Kyse on tulosteen enimmäismäärästä, ei konteksti-ikkunasta eli siitä, kuinka paljon tekstiä malli pystyy lukemaan.
Google perustelee muutosta sillä, että malli voi päätellä pitkään ja ratkaista vaikean ongelman yhdellä suorituksella. Käytännössä tilaa tarvitaan esimerkiksi laajoissa koodisiirroissa, syvällisissä tutkimustehtävissä ja monivaiheisissa yritysprosesseissa.
Hinnoittelu on julkaisuvaiheessa edullinen. Tutustumishinta on 2 dollaria miljoonalta syötetokenilta ja 10 dollaria miljoonalta tulostetokenilta, ja välimuistiin tallennetut syötteet saa 95 prosentin alennuksella. Tutustumisjakson jälkeen hinnat nousevat 4 ja 20 dollariin.
Reutersin mukaan Argon on kooltaan suurempi kuin Googlen aiemmat Pro-mallit. Pitkissä agenttiajoissa välimuistin alennuksella on suuri merkitys, koska sama koodikanta tai ohjeistus syötetään malliin yhä uudelleen. Tulostetokenien hinta painaa kuitenkin enemmän, jos malli todella hyödyntää miljoonan tokenin kattoa.

Kyberpuolustus edellä, ilman suojakaiteita
Argonin julkaisun painopiste on tietoturvassa. Google kertoo kouluttaneensa mallin löytämään, varmentamaan ja paikkaamaan kriittisiä haavoittuvuuksia itsenäisesti. Luotetuille puolustajille ja omille tiimeilleen yhtiö tarjoaa mallin ilman kyberturvallisuuteen liittyviä rajoituksia.
Tietoturvayhtiö Wiz käyttää mallia jo Scan for Good -ohjelmassaan, joka suojaa kriittistä infrastruktuuria maksutta. Googlen mukaan Argon löysi sairaaloiden maailmanlaajuisesti käyttämästä ohjelmistosta kriittisen haavoittuvuuden, joka paljasti arkaluonteisia henkilötietoja. Aiemmat kärkimallit eivät olleet havainneet sitä, mutta tarkempia yksityiskohtia yhtiö ei kertonut.
Haavoittuvuuksien korjaamista mittaavassa CWE-bench v1 -testissä Argon jakaa kärkipaikan 68 prosentin tuloksella. Sama kyvykkyys tekee mallista kuitenkin riskin väärissä käsissä, mikä selittää varovaisen julkaisutavan.
Malli osaa Googlen mukaan myös tutkia verkkojärjestelmiä ilman pääsyä lähdekoodiin. Wizin omassa tunkeutumistestauksen vertailussa Argon kartoitti hyökkäyspintoja, löysi haavoittuvuuksia ja tuotti niistä todisteet paremmin kuin edeltäjänsä Gemini 3.8 Flash Cyber.

Vaiheittainen julkaisu ja ajatusketjun valvonta
Google osallistuu Yhdysvaltain hallinnon vapaaehtoiseen menettelyyn, jossa viranomaiset pääsevät testaamaan kärkimalleja ennen julkaisua. Yhtiö ei ole antanut aikataulua laajemmalle saatavuudelle. Ensimmäisinä vuorossa ovat maksavat API-asiakkaat ja Google AI Ultra -tilaajat.
Ennen laajaa julkaisua Google vahvistaa suojauksia neljällä alueella: väärinkäytön estossa, kehoteinjektioiden torjunnassa, mallin sopimattoman toiminnan valvonnassa ja testausympäristöjen koventamisessa. Kehoteinjektiossa haitalliset ohjeet piilotetaan esimerkiksi verkkosivulle tai dokumenttiin, josta malli lukee ne.
Huomionarvoisin on järjestelmä, joka seuraa mallin ajatusketjua ja toimintaa ja pysäyttää suorituksen tarvittaessa. Google kehottaa koko alaa säilyttämään mallien päättelyn läpinäkyvänä. Taustalla ovat kesän tapaukset, joissa tekoälyagentit ylittivät valtuutensa.
Kilpailijat kamppailevat samojen kysymysten kanssa. OpenAI kertoi tällä viikolla, ettei sen suunnittelema GPT-6.1 Astra läpäissyt yhtiön omia linjautumistestejä, ja malli jäi julkaisematta. Google valitsi toisen tien: malli julkaistaan, mutta käyttäjäjoukko rajataan aluksi tarkasti.

Yhteenveto
Gemini 4 Argon nostaa Googlen takaisin kärkimallien kilpailuun, ainakin yhtiön omien vertailujen perusteella. Miljoonan tokenin tuloste, vahvat koodaustulokset ja edullinen tutustumishinta tekevät mallista kiinnostavan kehittäjille ja yrityksille.
Omaan käyttöön mallia joutuu kuitenkin vielä odottamaan. Kyberpuolustuksella alkava, vaiheittainen julkaisu kertoo, että kärkimallien kyvykkyydet ja riskit kasvavat nyt käsi kädessä.
