Spring til indhold
cd /blog

Hvorfor vi opgraderede kodesøgning til voyage-4-large

[Embeddings][Søgning][Arkitektur]

> Vi flyttede vores kode-embeddings til voyage-4-large — i øjeblikket øverst på den offentlige RTEB-rangliste for kode-retrieval. Den ærlige version: det kompromis, vi indgår, hvad vi rent faktisk indekserer, og hvorfor vi betaler for premium-embeddings.

Benchmark-tallene i dette indlæg afspejler RTEB-ranglisterne på udgivelsestidspunktet (juni 2026). Ranglister flytter sig; betragt placeringerne som et øjebliksbillede, ikke en permanent kendsgerning.

Semantisk søgning er kun så god som de embeddings, der ligger under den.

Når en agent spørger Maguyva “hvor håndterer vi retries,” grepper den ikke efter ordet “retry.” Den spørger efter meningen — backoff-løkken, circuit breakeren, den ting, der pakker et upålideligt kald ind. Det spørgsmål besvares af en vektormodel, der gør kode til et punkt i rummet og finder naboerne. Vælg en bedre model, og enhver semantisk forespørgsel i produktet bliver stille og roligt skarpere.

Så vi ændrede vores. Fra og med juni 2026 kører Maguyvas kode-embeddings på voyage-4-large, som erstatter voyage-code-3.

Benchmarken

Vi traf ikke denne beslutning på mavefornemmelse. Den offentlige Retrieval Embedding Benchmark (RTEB) rangerer embedding-modeller på reelle retrieval-opgaver, og på dens Code-rangliste ligger voyage-4-large1.-pladsen samlet (90.86) — foran gemini-embedding-2-preview (90.26) og, bemærkelsesværdigt, foran den model, vi allerede brugte, voyage-code-3 (89.73, #3).

Det er et lille absolut spring. Men det er et spring i den rigtige retning, på en offentlig benchmark, på præcis den opgave, vi bekymrer os om: at hente kode ud fra mening.

Det kompromis, vi accepterer: binær kvantisering

Her er den del, de fleste “vi opgraderede vores model”-indlæg udelader.

Maguyva gemmer ikke fuldpræcisions-vektorer. Vi gemmer binært kvantiserede embeddings: hver 2048-dimensionel vektor kollapser til en 2048-bit signatur — 256 bytes pr. vektor. De signaturer søges med Hamming-afstand, indekseres og partitioneres pr. tenant.

Det er et bevidst kompromis. Binær kvantisering opgiver noget retrieval-præcision til gengæld for dramatisk mindre lagerplads og hurtig, billig afstandsmatematik uden en separat vektordatabase at drive. For et produkt, der indekserer hele repositorier pr. workspace, betyder den økonomi mere end at presse den sidste brøkdel ud af et benchmarkpoint.

voyage-4-large passer ind i dette design uden at tvinge en migrering af lagerlaget: det producerer 2048-dimensionelt output, samme som voyage-code-3, så vores bit(2048)-kolonner og Hamming-søgesti ændrede sig ikke. Modellen blev bedre; skemaet stod stille.

Kode var kun begyndelsen

Maguyva er et code-intelligence-værktøj. Men vi er også kunde nul, og vi peger det på noget andet: den markdown, der lever i vores repositorier ved siden af koden. Arkitekturbeslutningsregistreringer, driftsvejledninger, kontrakter, finans- og politikdokumenter — det hele versionsstyret i Git, det hele bag den samme MCP-server, et semantisk indeks over dokumenterne, ikke kun kildekoden.

Det er præcis derfor, voyage-4-larges bredde betyder noget. På den samme RTEB-familie af ranglister er den #1 på finans, #1 på sundhed og #1 på samlet tekst-retrieval — foran Googles Gemini Embedding, Coheres Embed v4 og OpenAIs text-embedding-3-large. (Voyage er medskaber af RTEB, så vi læser det som et stærkt offentligt signal snarere end en fuldstændig neutral dommer — men den er benchmarket direkte mod hver eneste større kommercielle model, på private hold-out-sæt.) Det samme indeks, der finder den rigtige funktion til en agent, finder den rigtige klausul i en kontrakt eller den rigtige linje i en politik — og på de områder er voyage-4-large ikke et kompromis, det er lederen.

Hvorfor vi betaler for premium-embeddings

Der findes en billigere måde at søge på, og meget af det er gratis. Leksikalsk søgning — BM25 og dens slægtninge — matcher nøgleord, kører lokalt og koster ingenting. Open source-embedding-modeller som BGE, Nomic og embeddinggemma giver reelt anstændig semantisk retrieval, og man kan selv hoste dem for prisen af en GPU. Maguyva bruger også den gratis side: hver forespørgsel fusionerer tekst-, AST-, graf- og semantisk søgning. Det, vi ikke sparer på, er det semantiske lag.

Vi betaler pr. token for premium-embeddings — voyage-4-large — i stedet for selv at hoste en gratis model, af to grunde. For det første kan nøgleordssøgning alene ikke besvare “hvor håndterer vi retries,” når koden siger backoff og circuit breaker og aldrig siger ordet “retry” — mening er hele pointen med embeddingen, og på de områder, vi betjener, halter de åbne modeller efter premium-modellerne: et par point bagud på generel tekst, og længere bagud i nicher som kode, kontrakter og finans. For det andet former retrieval-kvalitet efter vores erfaring det endelige svar mere end modellen i den anden ende gør — en stærk agent, der får den forkerte kontekst, svarer stadig forkert, og den ser aldrig det dokument, den aldrig fik.

Så premium-embeddings er en pr.-token-regning, der skalerer med hvert repository og dokument, vi indekserer — og vi betaler den med vilje. For det resultat, vores brugere får, den rigtige funktion eller den rigtige klausul, mener vi, at det kompromis er det værd.

Den ærlige del

Voyages egen dokumentation kalder stadig voyage-code-3 for den kode-optimerede model. Så hvorfor skifte?

Fordi vi læser den offentlige benchmark, ikke bare leverandørens modeltabel, og benchmarken satte voyage-4-large i toppen for kode-retrieval. Dette var en fremadskuende beslutning: tag den nyere, generelt stærkere model og validér den mod en offentlig rangliste på de opgaver, der betyder noget. Vi er trygge ved at tage det væddemål, fordi beviserne er brede — voyage-4-large vinder ikke bare på kode, den fører også på finans, sundhed og samlet retrieval.

Det stille fundament

Hvert værktøj, vi eksponerer — semantisk søgning, task-context-indsamling, forankret spørgsmål-svar — bunder i retrieval. Når retrieveren forbedres, får agenten i den anden ende bedre evidens, tager færre forkerte drejninger og forankrer sine svar i den rigtige kode — eller den rigtige klausul, eller den rigtige politik. En skarpere embedding-model er ikke en flashy feature. Det er gulvet under alt det andet, og vi har lige hævet det. Du vil ikke bemærke det. Det er hele pointen.

Relateret læsning

Mere fra Maguyva-byggeloggen