Lumaktaw papunta sa content
cd /blog

Bakit Namin Ni-upgrade ang Code Search Papunta sa voyage-4-large

[Embeddings][Search][Architecture]

> Inilipat namin ang code embeddings namin papunta sa voyage-4-large — kasalukuyang nangunguna sa public RTEB code retrieval leaderboard. Ang tapat na bersyon: ang trade na ginagawa namin, ang talagang ini-index namin, at bakit kami nagbabayad para sa premium embeddings.

Ang mga numero sa benchmark sa post na ito ay sumasalamin sa RTEB leaderboards noong publication (Hunyo 2026). Gumagalaw ang mga leaderboard; ituring ang mga ranking bilang isang snapshot, hindi isang permanenteng katotohanan.

Kasing ganda lang ng semantic search ang embeddings na nasa ilalim nito.

Kapag nagtanong ang isang agent sa Maguyva ng “saan namin hinahawakan ang retries,” hindi ito nagg-grep para sa salitang “retry.” Nagtatanong ito para sa kahulugan — ang backoff loop, ang circuit breaker, ang bagay na bumabalot sa isang flaky call. Sinasagot ang tanong na iyon ng isang vector model na nagpapalit ng code papunta sa isang punto sa espasyo at hinahanap ang mga kapitbahay nito. Pumili ng mas magandang model at tahimik na sumisigla ang bawat semantic query sa produkto.

Kaya binago namin ang sa amin. Simula Hunyo 2026, tumatakbo ang code embeddings ng Maguyva sa voyage-4-large, na pumapalit sa voyage-code-3.

Ang Benchmark

Hindi namin ginawa ang tawag na ito base sa vibes lang. Ini-ranggo ng public Retrieval Embedding Benchmark (RTEB) ang mga embedding model batay sa totoong mga retrieval task, at sa Code leaderboard nito, ang voyage-4-large ay nasa #1 overall (90.86) — nangunguna kaysa sa gemini-embedding-2-preview (90.26) at, kapansin-pansin, nangunguna kaysa sa model na ginagamit na namin, ang voyage-code-3 (89.73, #3).

Maliit na absolute gap iyon. Pero isang gap ito sa tamang direksyon, sa isang public benchmark, sa eksaktong task na mahalaga sa amin: pagkuha ng code batay sa kahulugan.

Ang Trade na Tinatanggap Namin: Binary Quantization

Narito ang parteng inaalis ng karamihan sa mga post na “ni-upgrade namin ang model namin.”

Hindi nag-iimbak ng full-precision na mga vector ang Maguyva. Iniimbak namin ang binary-quantized na embeddings: nagko-collapse ang bawat 2048-dimensional na vector papunta sa isang 2048-bit na signature — 256 bytes bawat vector. Sinisiyasat ang mga signature na iyon gamit ang Hamming distance, indexed at partitioned kada tenant.

Isang sinadyang trade iyon. Sumusuko ang binary quantization ng kaunting retrieval precision kapalit ng dramatikong mas maliit na storage at mabilis, murang distance math na walang hiwalay na vector database na pagpapatakbuhin. Para sa isang produktong nag-i-index ng buong repositories kada workspace, mas mahalaga ang economics na iyon kaysa sa pagpiga ng huling piraso ng benchmark point.

Umaangkop ang voyage-4-large sa design na ito nang hindi pinipilit ang migration ng storage layer: gumagawa ito ng 2048-dimensional na output, kapareho ng voyage-code-3, kaya hindi nagbago ang mga column naming bit(2048) at ang Hamming search path. Umangat ang model; nanatili ang schema.

Ang Code, Simula Lang

Isang code-intelligence tool ang Maguyva. Pero customer zero rin kami, at itinuturo namin ito sa ibang bagay: ang markdown na nakatira sa mga repo namin kasabay ng code. Architecture decision records, runbooks, contracts, finance at policy docs — lahat version-controlled sa Git, lahat nasa likod ng parehong MCP server, isang semantic index sa ibabaw ng mga dokumento, hindi lang ng source.

Iyan mismo ang dahilan kung bakit mahalaga ang lawak ng voyage-4-large. Sa parehong RTEB family ng leaderboards, ito ang #1 sa finance, #1 sa healthcare, at #1 sa overall text retrieval — nangunguna kaysa sa Gemini Embedding ng Google, Embed v4 ng Cohere, at text-embedding-3-large ng OpenAI. (Co-creator ng RTEB ang Voyage, kaya binabasa namin ito bilang isang malakas na public signal sa halip na isang perpektong neutral na referee — pero na-benchmark ito nang head-to-head laban sa bawat major na commercial model, sa private hold-out sets.) Ang parehong index na nakakahanap ng tamang function para sa isang agent, nakakahanap din ng tamang clause sa isang contract o ng tamang linya sa isang policy — at sa mga domain na iyon, hindi compromise ang voyage-4-large, ito ang leader.

Bakit Kami Nagbabayad para sa Premium Embeddings

May mas murang paraan para mag-search, at karamihan dito, libre. Tumutugma sa keywords ang lexical search — BM25 at katulad nito — tumatakbo nang local, at walang binabayaran. Nagbibigay ng tunay na decent na semantic retrieval ang mga open-source na embedding model tulad ng BGE, Nomic, at embeddinggemma, at puwede mong i-self-host ang mga ito sa halaga lang ng isang GPU. Ginagamit din ng Maguyva ang libreng bahagi: pinagsasama ng bawat query ang text, AST, graph, at semantic search. Ang hindi namin kinukuripot, ang semantic layer.

Nagbabayad kami kada token para sa premium embeddings — voyage-4-large — sa halip na mag-self-host ng libreng model, dahil sa dalawang dahilan. Una, hindi masasagot ng keyword search lang ang “saan namin hinahawakan ang retries” kapag ang code ay sinasabing backoff at circuit breaker at hindi kailanman sinasabi ang salitang “retry” — kahulugan ang buong punto ng embedding, at sa mga domain na aming pinaglilingkuran, nahuhuli ang mga open model sa mga premium: ilang puntos ang layo sa general text, at mas malayo pa sa mga niche tulad ng code, contracts, at finance. Ikalawa, sa karanasan namin, mas humuhubog ang retrieval quality sa huling sagot kaysa sa model sa kabilang dulo — sumasagot pa ring mali ang isang malakas na agent na binigyan ng maling context, at hindi nito nakikita ang dokumentong hindi naman binigay sa kanya.

Kaya isang per-token na bill na sumusukat kasabay ng bawat repo at dokumentong ini-index namin ang premium embeddings — at binabayaran namin ito nang sinasadya. Para sa resulta na nakukuha ng mga user namin, ang tamang function o ang tamang clause, sa tingin namin, sulit ang trade na iyon.

Ang Tapat na Bahagi

Itinuturing pa rin ng sariling documentation ng Voyage ang voyage-code-3 bilang code-optimized na model. Kaya bakit lumipat?

Dahil binasa namin ang public benchmark, hindi lang ang model table ng vendor, at inilagay ng benchmark ang voyage-4-large sa tuktok para sa code retrieval. Isang forward-looking na tawag ito: kunin ang mas bago, karaniwang mas malakas na model at i-validate ito laban sa isang public leaderboard sa mga task na mahalaga. Komportable kami sa pagtaya na ito dahil malawak ang ebidensya — hindi lang nananalo ang voyage-4-large sa code, nangunguna rin ito sa finance, healthcare, at overall retrieval.

Ang Tahimik na Sahig

Bumabagsak sa retrieval ang bawat tool na ini-expose namin — semantic search, task-context gathering, grounded Q&A. Kapag umangat ang retriever, mas magandang ebidensya ang nakukuha ng agent sa kabilang dulo, mas kaunting maling liko ang ginagawa, at ini-anchor ang mga sagot nito sa tamang code — o sa tamang clause, o sa tamang policy. Hindi isang flashy na feature ang isang mas matalas na embedding model. Ito ang sahig sa ilalim ng lahat ng iba pa, at kararaan lang namin itong itaas. Hindi mo ito mapapansin. Iyon nga ang punto.

Kaugnay na babasahin

Higit pa mula sa build log ng Maguyva