
Kvantisointi ja KV-välimuisti rikkovat paikallisen mallin
Level1Techsin koesarja osoittaa, miksi paikallinen malli tuntuu tyhmältä: attention-backend, KV-välimuisti ja kvantisointi muuttavat tuloksen.
// Kategoria
Juttuja tekoälyyn liittyvistä asioista.

Level1Techsin koesarja osoittaa, miksi paikallinen malli tuntuu tyhmältä: attention-backend, KV-välimuisti ja kvantisointi muuttavat tuloksen.

Amazonin SOP-Bench mittaa agentteja yritysten oikeilla työohjeilla. Yhdentoista mallin testeissä uudempi versio jäi toisinaan vanhemman taakse.

Ox Alpha lupaa miljoonan tokenin kontekstin ilmaiseksi, mutta kukaan ei kerro kuka mallin rakensi. OpenRouterin stealth-julkaisu kuumensi arvailun.

Lontoolaisen Inherentin Faraday-agentti toisti julkaistujen tutkimusten tulokset tarkemmin kuin Claude Opus 4.8 ja GPT-5.5 – 27 miljardin parametrin mallilla.

Model Context Protocolin uusi tiekartta nostaa agenttien identiteetin, webhookit ja työkalujen asteittaisen löytämisen kehitystyön kärkeen.

OpenAI julkaisi Codexin agenttiytimen avoimena lähdekoodina: CLI, SDK ja app-server antavat kehittäjille pääsyn samaan koneistoon.

NVIDIAn tuore tutkimus näyttää, että agentin ympärille rakennettu harness ratkaisee pitkissä tehtävissä enemmän kuin itse malli.

OpenAI:n Private Safety Processing etsii väärinkäytöksiä useasta istunnosta kerralla, mutta asiakasdata pysyy nollaretention piirissä.

Ornith-1.5 luo itse harjoitustehtävänsä ja kehittyy niistä. Avoin 397B-malli yltää Claude Opus 4.8:n tasolle koodaus- ja agenttivertailuissa.

Tencentin UI-Mate-27B ohjaa työpöytää kuvakaappauksista ja ylittää Kimi-2.6:n vertailuissa. Painot ovat vapaasti ladattavissa.

OpenAI avasi 13-17-vuotiaille oman ChatGPT-version, jossa on tiukemmat sisältörajat ja opiskelutuki. Ikää ei silti todenneta.

Cursor avasi Origin-koodipalvelun samana päivänä, kun GitHub kaatui lähes seitsemäksi tunniksi. Palvelu on rakennettu agenttien mittakaavaan.

Alibaban 27 miljardin parametrin avoin malli yltää agenttivertailuissa kaupallisten kärkimallien tasolle – ja mahtuu tavallisen työaseman muistiin.

Cursorin builds-toiminto pitää kehitysympäristöt valmiina taustalla. Tänään ominaisuus kytkeytyy päälle oletuksena kaikissa ympäristöissä.

Bloombergin mukaan Stripe on sopinut OpenRouterin ostosta yli seitsemällä miljardilla dollarilla. Mallireitittimen valuaatio oli toukokuussa 1,3 miljardia.

Anthropic avasi Clauden tekstivesileiman toiminnan: menetelmä muuttaa sanavalintojen satunnaisuutta eikä lisää tekstiin yhtään merkkiä.

SpaceX sai Cursor-kaupan päätökseen 14. elokuuta. Osakevaihto arvotti Anysphären 60 miljardiin dollariin, ja tiimi siirtyy Grokin kehitykseen.

DeepSeek toi markkinoille MIT-lisensoidun Harness-agenttirungon ja julkaisi V4-Pron virallisen version, jossa agenttikyvyt paranivat selvästi.

Z.ai:n uusi GLM-5.3 nousi avointen mallien kärkeen koodauksessa, mutta yllättävä kyberkyvykkyys siirsi painojen julkaisua kahdella viikolla.

OpenAI ja Cerebras avasivat Ultrafast-palvelutason, jolla GPT-5.6 Sol tuottaa jopa 750 tokenia sekunnissa ilman laadun heikkenemistä.

NVIDIA laajensi Nemotron 3 -perhettä 30 miljardin parametrin MoE-mallilla ja avoimella reitityskirjastolla, joka ohjaa tehtävät sopivimmalle mallille.

Google toi Gemini 3.7 Flashin markkinoille kolme viikkoa edeltäjänsä jälkeen. Koodaustulokset paranivat selvästi ja tokenien hinta putosi puoleen.

SpaceXAI julkaisi Grok 4.6:n. Malli keskittyy pitkiin agenttiajoihin ja on saatavilla Cursorissa hintaan 2 dollaria miljoonalta syötetokenilta.

OpenAI jakoi Daybreak-ohjelmansa Blue- ja Red-tasoihin ja toi tarjolle GPT-5.6-Cyberin, joka vastaa 95 prosenttiin tietoturvakyselyistä.

Anthropicin julkaisematon Claude-versio nosti Riemannin zeta-funktion nollakohtien alarajan 41,6 prosentista 67,2 prosenttiin — matemaatikot vahvistivat sen.

Anthropic tekee automaattitilasta Claude Coden oletuksen 14. elokuuta. Testissä se havaitsi 89 prosenttia haitallisista toimista, ihminen 13,6.

Meta avasi Muse Glimmerin painot Apache 2.0 -lisenssillä. 30 miljardin parametrin monimodaalimalli ajaa agentteja yhdellä kuluttajanäytönohjaimella.

Alibaban Qwen3.8-Max kiipesi Artificial Analysisin agenttivertailun huipulle. Menetelmäpäivitys pudotti sen samana päivänä toiseksi.

AMD osti torontolaisen Taalasin, jonka sirut syövyttävät mallin painot suoraan piihin. Testipiiri syötti 16 960 tokenia sekunnissa.

Liquid AI:n LFM2.5-2.6B ajaa työkalukutsuja ja monivaiheisia agentteja paikallisesti, alle 2,5 gigatavun muistilla ja ilman pilviyhteyttä.

Mistralin Shieldstral on avoin 3B-turvallisuusmalli, joka ottaa moderointisäännöt vastaan tavallisena kysymyksenä ilman uudelleenkoulutusta.

Satya Nadella kehotti yrityksiä erottamaan agenttikehyksen mallista ja tarjosi Microsoftin omia MAI-malleja halvempana vaihtoehtona.

Andon Labsin Vending-Bench-testissä Claude Opus 5 teki ennätystuloksen, rikkoi yksitoista sopimusta ja laajensi liiketoimintaansa oma-aloitteisesti.

Tutkija osoitti, että Copilot for Wordiin piilotetut ohjeet voivat kopioitua uusiin dokumentteihin ja levitä eteenpäin ilman hyökkääjän apua.

OpenAI:n uusi Codex Security -komentorivityökalu ja TypeScript-SDK etsivät, vahvistavat ja korjaavat haavoittuvuuksia koodivarastoista.

Anthropicin Claude Mythos Preview paransi hyökkäystä kvanttiturvalliseen HAWK-allekirjoitukseen ja löysi nopeamman tavan murtaa kevennetty AES.

Nvidia teki miljardiluokan sijoituksen Ilya Sutskeverin Safe Superintelligenceen. Yhtiön laskentateho kymmenkertaistuu vuodessa Vera Rubin -alustalla.

Microsoft esitteli ensimmäisen oman tietoturvamallinsa ja agenttipohjaisen Project Perception -alustan, joka ylsi 96 prosenttiin CyberGym-testissä.

Kuaishoun KwaiKAT-tiimi rakensi yli 100 000 suoritettavaa koodivarastoa harjoitteluun. Tuloksena malli, joka voittaa Opus 4.8:n PinchBench-testissä.

Moonshot AI julkaisi Kimi K3:n painot. 2,8 biljoonan parametrin malli on suurin ladattava avoin malli, mutta itse isännöinti vaatii 1,4 teratavua.

Redis julkaisi seitsemän tietoturvapäivitystä sen jälkeen, kun tekoälyagenttien kerrotaan löytäneen nollapäivähaavoittuvuuksia tunneissa.

25 teknologiayhtiötä vaatii päättäjiä välttämään ennenaikaisia rajoituksia avoimen painon malleille. OpenAI ja Anthropic eivät allekirjoittaneet kirjettä.

Claude Opus 5 yltää lähes Fable 5:n tasolle puolella hinnasta ja nousee kärkeen agenttikoodauksessa. Malli on jo saatavilla myös GitHub Copilotissa.

Anthropic toi Claude Securityn Claude Codeen: moniagenttinen skanneri etsii haavoittuvuudet ja ehdottaa korjaukset suoraan terminaalissa.

FLUX 3 on Black Forest Labsin multimodaalinen malli, joka luo kuvaa, jopa 20 sekunnin videota äänellä ja ennustaa robottien liikkeitä.

OpenAI julkaisi Presence-alustan, joka auttaa yrityksiä ottamaan ääni- ja chat-agentit tuotantoon valvonnan ja käytäntöjen kanssa.

Anthropicin matemaatikko löysi Claude Fable 5:n avulla vastaesimerkin, joka kumoaa vuodesta 1939 avoinna olleen Jacobin otaksuman.

Poolsiden 118 miljardin parametrin Laguna S 2.1 pärjää monin verroin isommille malleille agenttikoodauksessa ja julkaisee testijäljet avoimesti.

Google esitteli Gemini 3.6 Flashin, edullisemman Flash-Liten ja CodeMender-tietoturva-agentin, jota ajaa uusi 3.5 Flash Cyber -malli.

Model Context Protocol siirtyy tilattomiin istuntoihin. Päivitys poistaa pullonkaulan, joka on estänyt laajat agentti-integraatiot yrityksissä.