Meta julkaisi Muse Spark 1.3:n 2. syyskuuta. Malli on yhtiön tähän asti vahvin, ja se on viritetty erityisesti koodaukseen ja pitkiin agenttitehtäviin. Kehittäjät pääsevät siihen käsiksi heti Muse Code -työkalussa ja Meta Model API -rajapinnassa. Laajempi levitys kuluttajapalveluihin seuraa myöhemmin.
Mark Zuckerberg kertoi julkaisusta itse ja kuvasi sitä suurimmaksi yksittäiseksi harppaukseksi, jonka tiimi on koodaus- ja agenttityössä tehnyt. Meta Superintelligence Labs on julkaissut Muse Spark -perheen malleja huhtikuusta lähtien poikkeuksellisen tiheään. Edellisestä versiosta ehti kulua vain kuukausi.
Koodausvertailut nousivat kärkitasolle
Selvin muutos näkyy agenttikoodauksen mittareissa. DeepSWE v1.1 -testi mittaa pitkäkestoista koodaustyötä, jossa malli joutuu etenemään monen vaiheen läpi. Muse Spark 1.3 sai siinä 75,4 pistettä, kun edeltäjä 1.2 jäi 55,0:aan. Tulos ohittaa niukasti myös Claude Opus 5:n 74,0 pistettä.
SWEAtlas CodeBase QnA puolestaan mittaa, kuinka hyvin malli ymmärtää olemassa olevaa koodikantaa. Siinä Muse Spark 1.3 ylsi 59,4 pisteeseen. GPT-5.6 Sol sai samassa testissä 53,5 pistettä ja Opus 5 jäi 52,7:ään. Ero kärkimallien välillä on tavallista suurempi.
Terminal-Bench 2.1 -testissä Muse Spark 1.3 ja GPT-5.6 Sol menivät tasan 88,8 pisteeseen. Opus 5 jäi 86,7:ään. Artificial Analysis sijoitti mallin päättelyvariantin kuudenneksi 636 mallin joukossa. Sijoitus asettaa Metan ensimmäistä kertaa selvästi kärkiryhmään.
Luvut ovat kuitenkin pääosin Metan omista mittauksista. Riippumattomia arvioita oikeista tuotantoympäristöistä on toistaiseksi vähän. Vertailuarvo kertoo harvoin siitä, kuinka luotettavasti malli käyttää työkaluja tuntien mittaisessa ajossa.

Vähemmän tokeneita, vähemmän työkalukutsuja
Toinen kärki on tehokkuus. Meta kertoo mallin kuluttavan noin 25 prosenttia vähemmän tokeneita samoihin tehtäviin kuin edeltäjänsä. Työkalukutsujen määrä laski noin 20 prosenttia.
Ero kertautuu pitkissä ajoissa. Agentti, joka selvittää saman tehtävän harvemmilla kutsuilla, maksaa vähemmän ja kaatuu harvemmin välivaiheisiin. Jokainen ylimääräinen kutsu on myös uusi kohta, jossa konteksti voi katketa tai tehtävä ajautua sivuraiteelle.
Muse Spark 1.2 maksoi 1,25 dollaria miljoonalta syötetokenilta ja 4,25 dollaria miljoonalta tuotostokenilta. Zuckerberg luonnehti uuden mallin hinnoittelua lähes mittaamisen arvottomaksi. Tarkkoja 1.3:n hintoja ei ole vielä julkaistu.
Malli pystyy myös pitämään useaa työnkulkua yllä yhdessä pitkässä keskustelussa. Meta kertoo parantaneensa kykyä seurata monimutkaisia ja pitkiä ohjeita sekä säilyttää konteksti tehtävien välillä. Juuri tämä on ollut agenttien heikoin lenkki.

Malli kysyy ennen kuin toimii
Kolmas painopiste on ihmisen valvonta pitkissä ajoissa. Meta Researchin mukaan malli esittää tarkentavia kysymyksiä silloin, kun ohje on monitulkintainen. Aiemmat versiot arvasivat useammin.
Malli pyytää apua jumiutuessaan ja varmistaa käyttäjältä ennen peruuttamattomia toimia. Pitkissä tehtävissä käyttäjä voi valita, raportoiko agentti edistymistään tiheästi vai työskenteleekö se hiljaa taustalla.
Meta kuvaa mallin tunnistavan aukkoja omassa suunnitelmassaan, pitävän kirjaa tehtävän aikana opitusta ja kokoavan lopputuotoksen avoimesta tavoitteesta. Malli on myös opetettu kokoamaan tietoa ristiriitaisista lähteistä eri työkalujen kautta.
Nämä ominaisuudet eivät korvaa valvontaa. Tuotannossa agenttitiimit tarvitsevat yhä erillisen lokituksen, valtuutuksen ja arvioinnin. Mallin lupaus varmistaa ennen toimintaa on koulutettu tapa, ei tekninen takuu.

Avoimet painot ja seuraava sukupolvi
Meta on luvannut avoimet painot Muse Spark -linjalle, mutta aikataulua ei ole kerrottu. Elokuussa julkaistun 1.2:n yhteydessä yhtiö esitteli myös pienemmän Muse Glimmerin, joka pyörii yhdellä kuluttajanäytönohjaimella.
Suurimman laskentatehon max reasoning -tila on yhä sisäisessä turvallisuustestauksessa. Se julkaistaan vasta arviointien jälkeen, eikä päivämäärää ole annettu. Tavalliset päättelytilat ovat käytössä heti.
Kehittäjät voivat ottaa mallin käyttöön Muse Code -komentorivityökalussa ja rajapinnan kautta. Muse Code on suunniteltu terminaaliin ja jatkuvan integraation putkiin, joissa se hoitaa refaktorointia, testien kirjoittamista ja virheenjäljitystä.
Yhtiö kehittää samaan aikaan Watermelon-koodinimistä mallia, joka on Muse Sparkia suurempi. Zuckerberg on vihjannut julkaisusta, mutta aikataulua ei ole kerrottu. Alexandr Wangin mukaan Muse Spark 1.3 on rakennuspalikka tuleviin itsenäisiin tuotteisiin.

Yhteenveto
Muse Spark 1.3 nostaa Metan koodausvertailuissa samalle viivalle OpenAI:n ja Anthropicin kanssa. Suurin muutos ei ole yksittäinen pistemäärä vaan se, että malli tekee saman työn harvemmilla askelilla ja pienemmällä tokenimäärällä.
Avointen painojen puuttuminen pitää mallin toistaiseksi Metan omien kanavien takana. Riippumattomat mittaukset ratkaisevat, pitävätkö luvut oikeissa koodikannoissa ja tuntien mittaisissa ajoissa.
