Lompat ke konten
cd /blog

Mengapa Kami Meningkatkan Pencarian Kode ke voyage-4-large

[Embeddings][Pencarian][Arsitektur]

> Kami memindahkan embedding kode kami ke voyage-4-large — saat ini teratas di papan peringkat retrieval kode RTEB publik. Versi jujurnya: trade-off yang kami ambil, apa yang sebenarnya kami indeks, dan mengapa kami membayar untuk embedding premium.

Angka benchmark dalam tulisan ini mencerminkan papan peringkat RTEB pada saat publikasi (Juni 2026). Papan peringkat bergerak; anggap peringkatnya sebagai potret sesaat, bukan fakta permanen.

Pencarian semantik hanya sebaik embedding yang mendasarinya.

Ketika seorang agen bertanya kepada Maguyva “di mana kita menangani retry,” ia tidak sedang meng-grep kata “retry.” Ia sedang menanyakan makna — loop backoff, circuit breaker, hal yang membungkus sebuah panggilan yang tidak stabil. Pertanyaan itu dijawab oleh sebuah model vektor yang mengubah kode menjadi sebuah titik dalam ruang dan menemukan tetangganya. Pilih model yang lebih baik, dan setiap kueri semantik di produk ini diam-diam menjadi lebih tajam.

Jadi kami mengubah milik kami. Per Juni 2026, embedding kode Maguyva berjalan di atas voyage-4-large, menggantikan voyage-code-3.

Benchmark-nya

Kami tidak membuat keputusan ini berdasarkan feeling. Retrieval Embedding Benchmark (RTEB) publik memeringkat model embedding pada task retrieval sungguhan, dan pada papan peringkat Code-nya, voyage-4-large berada di #1 secara keseluruhan (90,86) — mengungguli gemini-embedding-2-preview (90,26) dan, yang patut dicatat, mengungguli model yang sebelumnya kami pakai, voyage-code-3 (89,73, #3).

Itu selisih absolut yang kecil. Tetapi itu selisih ke arah yang benar, pada benchmark publik, pada task persis yang kami pedulikan: mengambil kode berdasarkan makna.

Trade-off yang Kami Terima: Kuantisasi Biner

Inilah bagian yang sering dilewatkan kebanyakan tulisan “kami meningkatkan model kami.”

Maguyva tidak menyimpan vektor presisi penuh. Kami menyimpan embedding yang terkuantisasi biner: setiap vektor 2048 dimensi dipadatkan menjadi sebuah signature 2048-bit — 256 byte per vektor. Signature-signature itu dicari dengan Hamming distance, diindeks dan dipartisi per tenant.

Itu trade-off yang disengaja. Kuantisasi biner melepas sebagian presisi retrieval demi penyimpanan yang jauh lebih kecil dan perhitungan jarak yang cepat dan murah tanpa perlu database vektor terpisah untuk dioperasikan. Untuk sebuah produk yang mengindeks seluruh repositori per workspace, ekonomi itu lebih penting daripada memeras poin terakhir dari sebuah benchmark.

voyage-4-large cocok dengan desain ini tanpa memaksa migrasi lapisan penyimpanan: ia menghasilkan output 2048 dimensi, sama seperti voyage-code-3, sehingga kolom bit(2048) kami dan jalur pencarian Hamming kami tidak berubah. Modelnya membaik; skemanya tetap sama.

Kode Hanyalah Permulaan

Maguyva adalah tool code-intelligence. Tetapi kami juga customer zero, dan kami mengarahkannya ke sesuatu yang lain: markdown yang hidup di repo kami bersebelahan dengan kode. Architecture decision record, runbook, kontrak, dokumen finance dan policy — semuanya version-controlled di Git, semuanya di balik server MCP yang sama, sebuah indeks semantik atas dokumen, bukan hanya source code.

Itulah persisnya mengapa keluasan voyage-4-large itu penting. Pada keluarga papan peringkat RTEB yang sama, ia #1 di finance, #1 di healthcare, dan #1 di retrieval teks keseluruhan — mengungguli Gemini Embedding milik Google, Embed v4 milik Cohere, dan text-embedding-3-large milik OpenAI. (Voyage adalah salah satu pencipta RTEB, jadi kami membacanya sebagai sinyal publik yang kuat, bukan wasit yang sepenuhnya netral — tetapi ia di-benchmark head-to-head dengan setiap model komersial besar, pada hold-out set privat.) Indeks yang sama yang menemukan fungsi yang tepat untuk seorang agen juga menemukan klausul yang tepat dalam sebuah kontrak atau baris yang tepat dalam sebuah policy — dan pada domain-domain itu, voyage-4-large bukan sebuah kompromi, ia sang pemimpin.

Mengapa Kami Membayar untuk Embedding Premium

Ada cara yang lebih murah untuk melakukan pencarian, dan sebagian besarnya gratis. Pencarian leksikal — BM25 dan sejenisnya — mencocokkan kata kunci, berjalan lokal, dan tidak berbiaya apa pun. Model embedding open-source seperti BGE, Nomic, dan embeddinggemma memberikan retrieval semantik yang sungguh-sungguh lumayan, dan Anda bisa meng-self-host mereka dengan harga sebuah GPU. Maguyva juga menggunakan sisi gratis itu: setiap kueri memfusikan pencarian teks, AST, graf, dan semantik. Yang tidak kami irit adalah lapisan semantiknya.

Kami membayar per token untuk embedding premium — voyage-4-large — alih-alih meng-self-host model gratis, karena dua alasan. Pertama, pencarian kata kunci saja tidak bisa menjawab “di mana kita menangani retry” ketika kodenya berkata backoff dan circuit breaker dan tidak pernah menyebut kata “retry” — makna adalah keseluruhan inti dari embedding, dan pada domain-domain yang kami layani, model open source tertinggal dari model premium: beberapa poin di belakang pada teks umum, dan lebih jauh tertinggal di niche seperti kode, kontrak, dan finance. Kedua, dalam pengalaman kami, kualitas retrieval membentuk jawaban akhir lebih daripada model di sisi lainnya — seorang agen yang kuat tetapi diberi konteks yang salah tetap menjawab salah, dan ia tidak pernah melihat dokumen yang tidak pernah diberikan kepadanya.

Jadi embedding premium adalah tagihan per token yang berskala dengan setiap repo dan dokumen yang kami indeks — dan kami membayarnya dengan sengaja. Untuk hasil yang didapat pengguna kami, fungsi yang tepat atau klausul yang tepat, kami rasa trade-off itu sepadan.

Bagian yang Jujur

Dokumentasi Voyage sendiri masih melabeli voyage-code-3 sebagai model yang dioptimalkan untuk kode. Jadi mengapa berpindah?

Karena kami membaca benchmark publiknya, bukan sekadar tabel model milik vendor, dan benchmark itu menempatkan voyage-4-large di puncak untuk retrieval kode. Ini adalah keputusan yang menatap ke depan: mengambil model yang lebih baru dan secara umum lebih kuat, lalu memvalidasinya terhadap sebuah papan peringkat publik pada task-task yang penting. Kami nyaman membuat taruhan itu karena buktinya luas — voyage-4-large tidak hanya menang di kode, ia juga memimpin di finance, healthcare, dan retrieval keseluruhan.

Lantai yang Diam-diam

Setiap tool yang kami ekspos — pencarian semantik, pengumpulan task-context, tanya jawab grounded — bermuara pada retrieval. Ketika retriever-nya membaik, agen di sisi lainnya mendapat bukti yang lebih baik, membuat lebih sedikit langkah yang salah, dan menambatkan jawabannya pada kode yang tepat — atau klausul yang tepat, atau policy yang tepat. Sebuah model embedding yang lebih tajam bukan fitur yang mencolok. Ia adalah lantai di bawah segalanya yang lain, dan kami baru saja menaikkannya. Anda tidak akan menyadarinya. Itulah intinya.

Bacaan terkait

Lebih banyak dari build log Maguyva