Miksi päivitimme koodihaun malliin voyage-4-large
> Siirsimme koodiupotuksemme malliin voyage-4-large — joka on tällä hetkellä julkisen RTEB-koodinoutorankinglistan kärjessä. Rehellinen versio: kompromissi, jonka teemme, mitä todella indeksoimme ja miksi maksamme premium-upotuksista.
Tämän postauksen vertailuarvoluvut heijastavat RTEB-ranking-listoja julkaisuhetkellä (kesäkuu 2026). Ranking-listat liikkuvat; kohtele sijoituksia hetkellisenä otoksena, ei pysyvänä tosiasiana.
Semanttinen haku on vain niin hyvä kuin sen alla olevat upotukset.
Kun agentti kysyy Maguyvalta “missä käsittelemme uudelleenyrityksiä”, se ei grep-hae sanaa “retry”. Se kysyy merkitystä — takaisinvetosilmukkaa, katkaisijaa, sitä asiaa, joka kääri epävakaan kutsun. Tuohon kysymykseen vastaa vektorimalli, joka muuttaa koodin pisteeksi avaruudessa ja löytää naapurit. Valitse parempi malli, ja jokainen semanttinen kysely tuotteessa terävöityy hiljaa.
Joten muutimme omaamme. Kesäkuusta 2026 alkaen Maguyvan koodiupotukset ajetaan mallilla voyage-4-large, joka korvaa mallin voyage-code-3.
Vertailuarvo
Emme tehneet tätä päätöstä fiiliksellä. Julkinen Retrieval Embedding Benchmark (RTEB) rankkaa upotusmalleja todellisilla noutotehtävillä, ja sen Code-ranking-listalla voyage-4-large istuu sijalla #1 kokonaisuudessaan (90,86) — edellä mallia gemini-embedding-2-preview (90,26) ja huomionarvoisesti edellä mallia, jota jo käytimme, voyage-code-3 (89,73, #3).
Se on pieni absoluuttinen ero. Mutta se on ero oikeaan suuntaan, julkisella vertailuarvolla, juuri sillä tehtävällä, josta välitämme: koodin noutaminen merkityksen perusteella.
Kompromissi, jonka hyväksymme: binäärikvantisointi
Tässä on osa, jonka useimmat “päivitimme mallimme” -postaukset jättävät pois.
Maguyva ei tallenna täystarkkoja vektoreita. Tallennamme binäärikvantisoituja upotuksia: jokainen 2048-ulotteinen vektori kutistuu 2048-bittiseksi allekirjoitukseksi — 256 tavua per vektori. Näitä allekirjoituksia haetaan Hamming-etäisyydellä, indeksoituna ja osioituna vuokralaisittain.
Se on tarkoituksellinen kompromissi. Binäärikvantisointi luopuu jonkin verran noutotarkkuudesta vastineeksi dramaattisesti pienemmästä tallennustilasta ja nopeasta, halvasta etäisyyslaskennasta ilman erillistä vektoritietokantaa operoitavaksi. Tuotteelle, joka indeksoi kokonaisia repositorioita per työtila, tuo taloustiede merkitsee enemmän kuin viimeisen vertailuarvopisteen murto-osan puristaminen.
voyage-4-large sopii tähän suunnitteluun pakottamatta tallennuskerroksen migraatiota: se tuottaa 2048-ulotteisen tulosteen, saman kuin voyage-code-3, joten bit(2048)-sarakkeemme ja Hamming-hakupolku eivät muuttuneet. Malli parani, skeema pysyi paikallaan.
Koodi oli vasta alku
Maguyva on koodiälytyökalu. Mutta olemme myös asiakas nolla, ja osoitamme sen johonkin muuhun: markdowniin, joka elää repositorioissamme koodin vieressä. Arkkitehtoniset päätöstietueet, ajokirjat, sopimukset, talous- ja käytäntödokumentit — kaikki versionhallinnassa Gitissä, kaikki saman MCP-palvelimen takana, semanttinen indeksi dokumenttien, ei vain lähdekoodin, yli.
Juuri siksi voyage-4-largen laajuus merkitsee. Samalla RTEB-ranking-listaperheellä se on #1 taloudessa, #1 terveydenhuollossa ja #1 kokonaistekstinoudossa — edellä Googlen Gemini Embeddingiä, Coheren Embed v4:ää ja OpenAI:n text-embedding-3-largea. (Voyage on RTEB:n yhteisluoja, joten luemme sen vahvana julkisena signaalina emmekä täysin neutraalina tuomarina — mutta se on vertailtu suoraan jokaista suurta kaupallista mallia vastaan yksityisillä hold-out-aineistoilla.) Sama indeksi, joka löytää agentille oikean funktion, löytää oikean lausekkeen sopimuksesta tai oikean rivin käytännöstä — ja näillä toimialueilla voyage-4-large ei ole kompromissi, se on johtaja.
Miksi maksamme premium-upotuksista
On halvempi tapa tehdä hakua, ja suuri osa siitä on ilmaista. Leksikaalinen haku — BM25 ja sen sukulaiset — täsmää avainsanoja, ajaa paikallisesti eikä maksa mitään. Avoimen lähdekoodin upotusmallit kuten BGE, Nomic ja embeddinggemma antavat aidosti kelvollisen semanttisen noudon, ja voit isännöidä niitä itse GPU:n hinnalla. Maguyva käyttää myös ilmaista puolta: jokainen kysely yhdistää teksti-, AST-, graafi- ja semanttisen haun. Se, mistä emme säästä, on semanttinen kerros.
Maksamme tokenia kohti premium-upotuksista — voyage-4-large — sen sijaan että isännöisimme itse ilmaista mallia, kahdesta syystä. Ensinnäkin pelkkä avainsanahaku ei osaa vastata kysymykseen “missä käsittelemme uudelleenyrityksiä”, kun koodi sanoo backoff ja circuit breaker eikä koskaan sanaa “retry” — merkitys on koko upotuksen pointti, ja toimialueilla, joita palvelemme, avoimet mallit jäävät jälkeen premium-malleista: pari pistettä jäljessä yleistekstissä ja vielä enemmän jäljessä kapeissa alueissa kuten koodi, sopimukset ja talous. Toiseksi kokemuksemme mukaan noudon laatu muovaa lopullista vastausta enemmän kuin toisessa päässä oleva malli — vahva agentti, jolle annetaan väärä konteksti, vastaa silti väärin, eikä se koskaan näe dokumenttia, jota sille ei koskaan annettu.
Joten premium-upotukset ovat tokenikohtainen lasku, joka skaalautuu jokaisen indeksoimamme repositorion ja dokumentin mukana — ja maksamme sen tarkoituksella. Tuloksesta, jonka käyttäjämme saavat, oikeasta funktiosta tai oikeasta lausekkeesta, ajattelemme tuon kompromissin olevan sen arvoinen.
Rehellinen osa
Voyagen oma dokumentaatio yhä merkitsee mallin voyage-code-3 koodioptimoiduksi malliksi. Miksi siis vaihtaa?
Koska luimme julkisen vertailuarvon, emme vain vendorin mallitaulukkoa, ja vertailuarvo asetti mallin voyage-4-large kärkeen koodin noudossa. Tämä oli eteenpäin katsova päätös: ottaa uudempi, yleisesti vahvempi malli ja validoida se julkista ranking-listaa vasten tehtävillä, jotka merkitsevät. Olemme tyytyväisiä tuon vedon tekemiseen, koska todistusaineisto on laaja — voyage-4-large ei voita vain koodissa, se johtaa myös taloudessa, terveydenhuollossa ja kokonaisnoudossa.
Hiljainen lattia
Jokainen paljastamamme työkalu — semanttinen haku, tehtäväkontekstin kerääminen, perusteltu (grounded) kysymys-vastaus — pohjautuu lopulta noutoon. Kun noutokone paranee, toisessa päässä oleva agentti saa parempaa todistusaineistoa, tekee vähemmän vääriä käänteitä ja ankkuroi vastauksensa oikeaan koodiin — tai oikeaan lausekkeeseen, tai oikeaan käytäntöön. Terävämpi upotusmalli ei ole hohdokas ominaisuus. Se on lattia kaiken muun alla, ja juuri nostimme sitä. Et huomaa sitä. Se on pointti.
Aiheeseen liittyvää
Lisää Maguyva-projektin rakennuslokista
Kielten rekursiivinen itseparannus: koodiälyn hiominen noin 280 kielessä_
Tuemme koodiälyä noin 280 kielelle. Kukaan ihminen ei pysty auditoimaan sitä käsin. Siksi rakensimme kielten rekursiivisen itseparannussilmukan — pistokoe, LLM tuomarina, korjaa yksi asia, validoi uudelleen — ja ajamme sitä eristettyjen agenttien parvella, kunnes poiminta on todella oikein, ei vain vihreä.
Monimodaalinen fuusiohaku: oikean hakukoneen valinta jokaiselle kyselylle_
Kysely kuten "missä parseConfig on määritelty" haluaa erilaisen haun kuin "miten todennus toimii". Maguyva luokittelee tarkoituksen, painottaa neljää hakumodaliteettia sen mukaisesti ja yhdistää tulokset painotetulla Reciprocal Rank Fusionilla.
Agenttien havainnointi: Hookit, Alloy ja Grafana_
Kytkimme Claude Code -työkalun ja Codexin samaan Grafana-pinoon OpenTelemetryn ja Alloyn avulla ja käytimme sitten jäljityksiä ja lokeja löytääksemme ja korjataksemme agenttien käyttäytymisongelmat niiden lähteellä.