Kod Aramasını voyage-4-large'a Neden Yükselttik
> Kod gömmelerimizi voyage-4-large'a taşıdık — şu anda herkese açık RTEB kod getirim liderlik tablosunun zirvesinde. Dürüst versiyon: yaptığımız ödünleşim, gerçekte neyi indekslediğimiz ve neden premium gömmelere ödeme yaptığımız.
Bu yazıdaki kıyaslama sayıları, yayınlandığı tarihteki (Haziran 2026) RTEB liderlik tablolarını yansıtır. Liderlik tabloları değişir; sıralamaları kalıcı bir gerçek değil, bir anlık görüntü olarak ele alın.
Semantik arama, altındaki gömmeler kadar iyidir.
Bir ajan Maguyva’ya “yeniden denemeleri nerede ele alıyoruz” diye sorduğunda, “retry” kelimesini grep’lemiyordur. Anlamı soruyordur — geri çekilme (backoff) döngüsünü, devre kesiciyi, kararsız bir çağrıyı sarmalayan şeyi. Bu soru, kodu uzayda bir noktaya dönüştüren ve komşularını bulan bir vektör modeli tarafından yanıtlanır. Daha iyi bir model seçin ve üründeki her semantik sorgu sessizce daha keskinleşir.
Bu yüzden bizimkini değiştirdik. Haziran 2026 itibarıyla, Maguyva’nın kod gömmeleri voyage-code-3’in yerini alan voyage-4-large üzerinde çalışıyor.
Kıyaslama
Bu kararı sezgiyle vermedik. Herkese açık Retrieval Embedding Benchmark (RTEB), gömme modellerini gerçek getirim görevlerinde sıralar ve Code liderlik tablosunda voyage-4-large, gemini-embedding-2-preview’ün (90.26) önünde ve dikkat çekici bir şekilde zaten kullandığımız modelin, voyage-code-3’ün (89.73, #3), önünde genel sıralamada #1’de (90.86) yer alır.
Bu küçük, mutlak bir farktır. Ama herkese açık bir kıyaslamada, tam olarak önemsediğimiz görevde — kodu anlamıyla getirmek — doğru yönde bir farktır.
Kabul Ettiğimiz Ödünleşim: İkili Nicemleme
İşte çoğu “modelimizi yükselttik” yazısının atladığı kısım.
Maguyva tam hassasiyetli vektörleri saklamaz. İkili nicemlenmiş (binary-quantized) gömmeleri saklarız: her 2048 boyutlu vektör, 2048 bitlik bir imzaya sıkışır — vektör başına 256 bayt. Bu imzalar Hamming mesafesiyle aranır, kiracı başına indekslenir ve bölümlenir.
Bu kasıtlı bir ödünleşimdir. İkili nicemleme, dramatik derecede daha küçük depolama ve ayrı bir vektör veritabanı işletmeden hızlı, ucuz mesafe matematiği karşılığında bir miktar getirim hassasiyetinden vazgeçer. Çalışma alanı başına tüm depoları indeksleyen bir ürün için, bu ekonomi, bir kıyaslama puanının son kesrini sıkıştırmaktan daha önemlidir.
voyage-4-large, depolama katmanının bir geçişini zorlamadan bu tasarıma uyar: voyage-code-3 ile aynı şekilde 2048 boyutlu çıktı üretir, bu yüzden bit(2048) sütunlarımız ve Hamming arama yolumuz değişmedi. Model daha iyi oldu; şema yerinde kaldı.
Kod Sadece Başlangıçtı
Maguyva bir kod zekâsı aracıdır. Ama biz de sıfırıncı müşteriyiz ve onu başka bir şeye yönlendiriyoruz: depolarımızda kodla birlikte yaşayan markdown. Mimari karar kayıtları, çalışma kitapları (runbook), sözleşmeler, finans ve politika belgeleri — hepsi Git’te sürüm kontrollü, hepsi aynı MCP sunucusunun arkasında, sadece kaynak üzerinde değil belgeler üzerinde semantik bir indeks.
Voyage-4-large’ın genişliğinin önemli olmasının tam nedeni budur. Aynı RTEB liderlik tabloları ailesinde finansta #1, sağlıkta #1 ve genel metin getiriminde #1’dir — Google’ın Gemini Embedding’inin, Cohere’in Embed v4’ünün ve OpenAI’ın text-embedding-3-large’ının önünde. (Voyage, RTEB’in bir ortak yaratıcısıdır, bu yüzden bunu tamamen tarafsız bir hakem yerine güçlü bir kamusal sinyal olarak okuyoruz — ama özel tutulan (hold-out) veri kümelerinde her büyük ticari modele karşı baş başa kıyaslanmıştır.) Bir ajan için doğru fonksiyonu bulan aynı indeks, bir sözleşmedeki doğru maddeyi veya bir politikadaki doğru satırı da bulur — ve bu alanlarda voyage-4-large bir uzlaşma değildir, liderdir.
Neden Premium Gömmelere Ödeme Yapıyoruz
Arama yapmanın daha ucuz bir yolu var ve bunun çoğu ücretsiz. Sözcüksel arama — BM25 ve benzerleri — anahtar kelimeleri eşleştirir, yerel olarak çalışır ve hiçbir şeye mal olmaz. BGE, Nomic ve embeddinggemma gibi açık kaynaklı gömme modelleri gerçekten makul semantik getirim sağlar ve bunları bir GPU fiyatına kendiniz barındırabilirsiniz. Maguyva ücretsiz tarafı da kullanır: her sorgu metin, AST, graf ve semantik aramayı birleştirir. Ucuza kaçmadığımız şey semantik katmandır.
Ücretsiz bir modeli kendimiz barındırmak yerine premium gömmeler için token başına ödeme yapıyoruz — voyage-4-large — iki nedenden dolayı. Birincisi, kod backoff ve circuit breaker dediğinde ve asla “retry” kelimesini söylemediğinde, tek başına anahtar kelime araması “yeniden denemeleri nerede ele alıyoruz” sorusunu yanıtlayamaz — anlam, gömmenin tüm meselesidir ve hizmet ettiğimiz alanlarda açık modeller premium olanların gerisinde kalır: genel metinde birkaç puan geride, kod, sözleşmeler ve finans gibi niş alanlarda daha da geride. İkincisi, deneyimimize göre getirim kalitesi, nihai yanıtı diğer uçtaki modelden daha fazla şekillendirir — yanlış bağlam verilen güçlü bir ajan yine de yanlış yanıt verir ve kendisine hiç verilmemiş bir belgeyi asla görmez.
Yani premium gömmeler, indekslediğimiz her depo ve belgeyle ölçeklenen token başına bir faturadır — ve bunu kasıtlı olarak ödüyoruz. Kullanıcılarımızın elde ettiği sonuç, doğru fonksiyon veya doğru madde için, bu ödünleşimin buna değdiğini düşünüyoruz.
Dürüst Kısım
Voyage’ın kendi dokümantasyonu hâlâ voyage-code-3’i kod için optimize edilmiş model olarak etiketliyor. Peki neden geçtik?
Çünkü sadece tedarikçinin model tablosunu değil, herkese açık kıyaslamayı okuduk ve kıyaslama kod getiriminde voyage-4-large’yi zirveye koydu. Bu ileriye dönük bir karardı: daha yeni, genel olarak daha güçlü modeli alıp önemli görevlerde herkese açık bir liderlik tablosuna karşı doğrulamak. Bu bahsi yapmakta rahatız çünkü kanıt geniş — voyage-4-large sadece kodda kazanmıyor, finansta, sağlıkta ve genel getirimde de öne geçiyor.
Sessiz Taban
Sunduğumuz her araç — semantik arama, görev bağlamı toplama, temellendirilmiş soru-cevap — sonunda getirime dayanır. Getirici iyileştiğinde, diğer uçtaki ajan daha iyi kanıt alır, daha az yanlış dönüş yapar ve yanıtlarını doğru koda — ya da doğru maddeye, ya da doğru politikaya — dayandırır. Daha keskin bir gömme modeli gösterişli bir özellik değildir. Her şeyin altındaki tabandır ve biz onu az önce yükselttik. Fark etmeyeceksiniz. Asıl mesele de bu.
İlgili okumalar
Maguyva yapım günlüğünden daha fazlası
Dilde Özyinelemeli Öz-İyileştirme: ~280 Dilde Kod Zekâsını İnceden İnceye Cilalamak_
~280 dil için kod zekâsı desteği sunuyoruz. Hiçbir insan bunu elle denetleyemez. Bu yüzden bir dilde özyinelemeli öz-iyileştirme döngüsü kurduk — nokta kontrolü, hakem olarak LLM, tek bir şeyi düzelt, yeniden doğrula — ve çıkarım sadece yeşil değil gerçekten doğru olana kadar bunu izole ajanlardan oluşan bir filoyla çalıştırıyoruz.
Çok Modlu Füzyon Arama: Her Sorgu için Doğru Getiriciyi Seçmek_
'parseConfig nerede tanımlanmış' gibi bir sorgu, 'kimlik doğrulama nasıl çalışıyor' sorgusundan farklı bir arama ister. Maguyva niyeti sınıflandırır, dört getirim modalitesini buna göre ağırlıklandırır ve sonuçları ağırlıklı Reciprocal Rank Fusion ile birleştirir.
Ajan Gözlemlenebilirliği: Hook'lar, Alloy ve Grafana_
Claude Code ve Codex'i OpenTelemetry ve Alloy ile tek bir Grafana yığınına bağladık, ardından ajan davranış sorunlarını kaynağında bulup düzeltmek için izleri (trace) ve günlükleri kullandık.