Tencent julkaisi 7. syyskuuta kaksi avointa hakumallia, EVIE-8B:n ja EVIE-4.5B:n. Molemmat etsivät oikean sivun dokumenttimassasta katsomalla sivua kuvana. Tekstintunnistusta ei ajeta lainkaan. Painot ja koulutuskoodi ovat Apache 2.0 -lisenssin alla.
Julkaisu osuu kohtaan, jossa moni yritys on jumissa. Skannatut laskut, tilinpäätökset ja diaesitykset menevät rikki, kun tekstintunnistus purkaa ne merkkijonoiksi. Taulukon rakenne katoaa ja kaavion sisältö häviää kokonaan. EVIE ohittaa koko vaiheen.
Sivu luetaan kuvana, ei tekstinä
EVIE rakentuu ColBERT-tyylisen myöhäisen vuorovaikutuksen (late interaction) päälle. Sama runkomalli koodaa sekä käyttäjän kyselyn että sivun kuvapikselit. Kysely hajoaa vektoreiksi sanoittain, sivu vektoreiksi kuva-alueittain.
Sivua ei siis puristeta yhdeksi tiivistelmävektoriksi. Yksi sivu tuottaa noin 750 vektoria, ja jokainen niistä on sidottu tiettyyn kohtaan sivulla. Osumapisteet lasketaan MaxSim-operaattorilla: jokainen kyselyn sana etsii parhaan vastineensa sivulta.
Käytännön ero näkyy yksityiskohdissa. Yksi rivi taulukossa tai yksi viite pitkässä lähdeluettelossa riittää nostamaan sivun hakutuloksen kärkeen. Koko sivun ei tarvitse käsitellä samaa aihetta.
Pohjamalleina ovat Qwen3.5-9B ja Qwen3.5-4B ColQwen3.5-kokoonpanossa. EVIE-8B:ssä on 8,41 miljardia parametria, EVIE-4.5B:ssä 4,61 miljardia. Isompi malli toimii samalla myös opettajana, josta pienempi tislataan.

ViDoRe V3 -vertailun kärkipaikka
Tencentin ilmoittamat luvut asettavat EVIE-8B:n vertailun kärkeen. Malli sai 66,75 pistettä nDCG@10-mittarilla ViDoRe V3 -testissä, joka on kolmesta vakiotestistä vaikein. Lähin nimetty verrokki webAI-ColVec1.1-8b jäi 65,32:een ja NVIDIAn nemotron-colembed-vl-8b-v2 63,54:ään.
Pienempi EVIE-4.5B jäi lippulaivastaan vain 0,73 pistettä: 66,02. Sekin ylittää verrokkinsa, myös selvästi suuremmat kahdeksan miljardin parametrin mallit. Tuntemattomilla toimialoilla mitattu ViDoRe V2 -tulos oli EVIE-8B:llä 74,23, kun VultronRetrieverPrime-8B ylsi 68,18:aan.
Yhdessä kohdassa EVIE hävisi. Alkuperäisessä ViDoRe V1 -testissä nemotron-colembed-vl-8b-v2 sai 92,65 pistettä ja EVIE-8B 92,18. Ero on pieni, ja V1 on vertailuista helpoin.
Luvut ovat toistaiseksi Tencentin itsensä raportoimia. Mallikortin mukaan tulokset on ajettu 138 tehtävän yli, mutta riippumatonta toistoa ei vielä ole. Varsinainen tutkimusartikkeli on luvattu myöhemmin.

Indeksin koko ratkaisee käyttöönoton
Myöhäisen vuorovaikutuksen tunnettu heikkous on tallennustila. Kun yksi sivu vie noin 750 vektoria, miljoonan sivun arkisto kasvaa indeksiksi, jota joutuu perustelemaan budjettivastaavalle. Tähän EVIE-4.5B tarjoaa kaksi ratkaisua, ja ne ovat julkaisun kiinnostavin osa.
Ensimmäinen on Prefix-MRL. Yksi projektio tuottaa 2 048 lukua vektoria kohti, ja hännän voi katkaista kyselyhetkellä 1 024:ään, 512:een, 256:een, 128:aan tai 64:ään. Mallia ei tarvitse vaihtaa välissä. 128 luvun leveydellä ViDoRe V3 -tulos putoaa 66,02:sta 65,27:ään, eli kuusitoistakertainen kavennus maksaa kolme neljäsosaa pisteestä.
Toinen on HAC, klusterointivaihe, joka puristaa sivun noin 750 vektoria 32:een tai 64:ään. Se ei vaadi koulutusta ja sen voi kytkeä päälle jälkikäteen. Tencentin pienimmällä julkaistulla asetuksella miljoona sivua mahtuu 3,81 gigatavuun.
Hinta näkyy tarkkuudessa. Tiiviimmällä asetuksella EVIE-4.5B jää 59,58 pisteeseen, eli lähes kuusi ja puoli pistettä täydestä. Se on koko päätös, ja se osuu eri tavalla eri aineistoihin. Tiheät talousluvut kärsivät klusteroinnista enemmän kuin tekstipainotteiset raportit.

Apache 2.0 avaa oman laitteiston
Molemmat mallit ja koulutuskoodi ovat Apache 2.0 -lisenssin alla. Lisenssi sallii kaupallisen käytön ja ajon omalla raudalla ilman erillistä sopimusta. Painot löytyvät Hugging Facesta nimillä tencent/EVIE-8B ja tencent/EVIE-4.5B.
Tämä ratkaisee tietyn joukon käyttötapauksia. Potilastiedot, sopimusarkistot ja kilpailutusaineistot eivät saa poistua talosta. Suljettu rajapinta ei silloin kelpaa, vaikka se olisi tarkempi.
Ajo onnistuu colpali-engine-kirjastolla, joka on jo vakiintunut ColPali- ja ColQwen-ympäristöissä. Vaihto on tarkistuspisteen vaihto, ei uudelleenrakennus. Aiempaa EVIE-Preview-4.5B-mallia käyttäneille päivitys on suoraviivainen.
EVIE ei kuitenkaan lue vastausta. Se palauttaa sivun ja osumapisteet, minkä jälkeen erillinen lukijamalli poimii varsinaisen luvun tai lauseen. Kokonaisuus on kaksivaiheinen dokumentti-RAG, jossa EVIE hoitaa vain hakuvaiheen.

Yhteenveto
EVIE-8B ja EVIE-4.5B eivät ole ensimmäisiä kuvapohjaisia dokumenttihakuja, ja ero edelliseen sukupolveen jää vertailuluvuissa pieneksi. Merkittävin uutinen on Prefix-MRL: indeksin leveydestä voi päättää vasta sen jälkeen, kun arkisto on jo indeksoitu.
Se joustavuus painaa enemmän kuin murto-osa pisteestä. Jos haku kohdistuu puhtaaseen tekstiin tai arkisto on pieni, julkaisun voi ohittaa huoletta. Jos taas skannatut sivut ja indeksin koko ovat olleet toistuva ongelma, EVIE-4.5B kannattaa testata ensin tiivistetyllä asetuksella eikä täydellä.
