> methodology.md
Nasıl ölçüyoruz
Bu sayfa, Maguyva kalite ve maliyet iddialarının nasıl temellendirildiğini okuyabileceğiniz gerçek yerdir. Yalnızca gerçekleri içerir: neyi ölçtüğümüz, nasıl puanladığımız ve denetlediğimizi iddia etmediğimiz şeyler.
17 Temmuz 2026 tarihinden itibaren geçerlidir. Burada yeni, denetlenmemiş hiçbir kıyaslama uydurulmaz. Güncel sayılar, kaynak verilerden yeniden üretilen ürün yüzeylerinde yaşar; bu sayfa ölçüm modelini açıklar.
Bu, kolaylığınız için sağlanan yapay zeka destekli bir çeviridir. Bağlayıcı olan tek sürüm resmi İngilizce sürümdür — kaydolduğunuzda girdiğiniz herhangi bir anlaşma İngilizce metne tabidir. Resmi İngilizce sürümü oku
tl;dr — Kalite iddiaları, tek bir “%100 hassasiyet” kanıtına değil, fixture yayın kapılarına ve çok boyutlu language-audit tablolarına dayanır. Fixture'larda yeşil olmak, bağımsız olarak doğrulanmış doğru çıkarımla aynı şey değildir. Maliyet iddiaları, üçüncü taraf bir rekabet denetimi değil, workspace fiyatlandırma matematiği ve kamuya açık işletme maliyeti şeffaflığıdır.
1. Bu Sayfa Neden Var
Şüpheci alıcıların pazarlama metnini tersine mühendislikle çözmesi gerekmemeli. Maguyva depoları indeksler ve sitenin genelinde hassasiyet, dil kapsamı ve maliyet iddialarını sunar. Bu iddiaların, ölçüm kapsamı konusunda dürüst bir metodoloji yüzeyine ihtiyacı var: neyin fixture destekli, neyin yargıya dayalı ve neyin bağımsız sertifikasyon yerine sadece bir çerçeveleme olduğu.
2. Neyi Ölçüyoruz
Kod zekası kalitesi öncelikli olarak dil motoru üzerinde ölçülür — kaynaktan sembollerin, ilişkilerin ve grafiklerin çıkarımı — öznel “ajan memnuniyeti” puanları üzerinden değil.
- Dile özel fixture paketleri: handler'ın doğru şekilde çıkarması gereken beklenen kenarlar ve semboller
- Yayın kapıları: diller yalnızca fixture hassasiyeti, recall ve F1 yayınlanan eşikleri geçtiğinde piyasaya sürülür (hassasiyet ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97, istatistiksel güven için minimum kenar sayısıyla birlikte)
- Language-audit boyutları: doğrulama tablosunda doğruluk, yapısal bütünlük, eksiksizlik, kalite ve performans
- Korpus ve nokta kontrol döngüleri: gerçek depolardan örneklenen ve bir rubriğe göre sınıflandırılan kenarlar (doğru, yanlış pozitif, tür/kapsam/metadata hatası) — language-grind blog yazılarımızda anlatılır
- Ürün yetenek bayrakları: sunucunun katalog boyutundan bağımsız olarak neyi vaat ettiği (AST, yerel değişkenler, grafik çıkarımı)
Önemli: Fixture'lar, kendi yazdığımız fixture'lara karşı doğrulanır. YEŞİL, bilinen vakaların geçtiği anlamına gelir. Bu, her gerçek dünya kod deyiminin sorunsuz çıkarıldığı anlamına otomatik olarak gelmez. Bu ayrım kasıtlı ve kamuya açıktır.
3. Yeşil ile Bağımsız Doğrulanmış Karşılaştırması
Language-audit tablosu, tek bir yeşil ışığın “kusursuz kanıtlanmış” olarak okunamaması için birden fazla eksen kullanır. Tablodaki başlık sayılar genellikle şu şekilde ayrılır:
- overall_green — self-snapshot fixture'lara ve ilgili korpus kapılarına karşı regresyonsuz (gerekli ama yeterli değil)
- independently_verified — nokta kontrol tohumu gibi güçlü bir yargı sinyali var (hâlâ yargılanmış hatalar gösteren dilleri de içerir)
- verified_clean / örneklenen kenarlarda sıfır yargılanmış hata — yargılanmış dillerin daha katı bir alt kümesi
- kürasyon / oracle güveni — fixture'ların kendilerinin güvenilir oracle olarak kabul edilip edilmediği
- yapısal bayraklar — grafik çıkarımı ve AST yeteneği, katalog üyeliğiyle aynı şey değildir
Pazarlama dilindeki dil sayısı (örneğin “279+ dil”) katalog boyutudur: yapılandırılmış diller ve sunucu girdileri. Katalog boyutu bir AST kalite SLA'sı değildir. Tek bir gösterişli baş sayı yerine katmanlı raporlamayı tercih ediyoruz. Güncel ürün yüzeyi için Uyumluluk ve Dil Kılavuzları'na, anlatı detayı için blogdaki dilin özyinelemeli öz-iyileştirmesi yazısına bakın.
4. Arama ve Getirme Kalitesi
Anlamsal arama kalitesi çok modludur: metin, AST, grafik ve embeddingler birleştirilir. Yenilmez bir getirme iddiasında bulunmak yerine kasıtlı mühendislik dengelerini belgeliyoruz:
- Embeddingler, karar anında kamuya açık getirme liderlik tablolarına göre seçilmiş ticari bir model ailesi kullanır (2026 Haziran blog anlık görüntüsü itibarıyla voyage-4-large)
- Vektörler depolama ve maliyet için ikili olarak kuantize edilir; bu, ayrı bir vektör veritabanı olmadan daha ucuz ve hızlı Hamming aramasına karşılık bir miktar getirme hassasiyetinden kasıtlı olarak vazgeçer
- Amaç yönlendirme ve füzyon ağırlıkları, ölçülmüş operasyonel etkileri olan (örneğin amaç yönlendirmeden sonra daha düşük sıfır sonuç oranları) mühendislik sezgiselleridir, müşteri korpuslarında yayınlanmış bağımsız bir IR değerlendirme paketi değildir
- Blog yazıları “hâlâ kusurlu olan” bölümleri içerir — kusurlu sinyaller gizlenen dipnotlar değil, kaydın bir parçasıdır
5. Maliyet İddiaları
Maguyva'daki maliyet dili, üçüncü taraf tarafından onaylanmış resmi bir TCO çalışması değil, fiyatlandırma yapısı ve işletme şeffaflığı ile ilgilidir.
- Workspace fiyatlandırması: kişi veya ajan koltuğu başına değil, depo sayısı, indekslenen satır sayısı ve yeniden inşa sıklığına göre faturalandırılır. SSS ve plan metinleri bu boyutları ayrıntılı olarak açıklar.
- Fiyatlandırma sayfasındaki “yaklaşık 10-30 kat daha az” tarzı karşılaştırmalar, hangi koltuk başına fiyatlandırılan araçla karşılaştırdığınıza bağlı olarak tipik koltuk fiyatı aralıklarına karşı açıklayıcı bir matematiktir. Kilitli, bağımsız bir rekabetçi kıyaslama paketi değildir.
- İşletme maliyeti dürüstlüğü: /team sayfası gerçek bir aylık yazılım harcama dökümü yayınlar (abonelikler, MCP/search araçları, kullanıma göre şekillenen maliyetler). Bu, denetlenmiş bir mali tablo değil, müşteri-sıfır şeffaflığıdır.
- Embedding ve altyapı maliyetleri kabul edilmiş ürün maliyetleridir (premium embeddingler, depolama, grafik yeniden inşaları). Bunları bilerek karşılıyoruz ve bunu voyage-4-large yazısında ve fiyatlandırma anlatısında açıkça söylüyoruz.
6. İddia Etmediklerimiz
Bu sayfa aynı zamanda bir iddia-etmeme listesidir. Bir şey ölçüm tablosunda değilse, pazarlama tonunu kanıt olarak değerlendirmeyin.
- Her dil için genel bir mutlak hassasiyet garantisi yoktur. Fixture eşikleri her dil için bilinen vakalarda geçerlidir; kalan gerçek dünya hatası beklenir ve gerçek zemine dayanır.
- overall_green'in her depodaki her deyim için üretim-mükemmel çıkarım anlamına geldiği iddiası yoktur
- Bu yüzeyde bir metodoloji artefaktı olarak sunulan hiçbir üçüncü taraf uyumluluk sertifikasyon paketi yoktur (veri işleme gerçekleri için Güvenlik'e bakın, uyumluluk rozetleri için değil)
- Paylaşılan korpuslarla, sürekli bir skor kartı olarak yayınlanmış bağımsız çok satıcılı bir karşılaştırma yoktur
- Arama sonuçları ve analizler Hizmet Şartları kapsamında en iyi çaba ilkesiyle kalır — Maguyva kod incelemesinin, testin veya güvenlik denetimlerinin yerini tutmaz
7. Kendiniz Nasıl Doğrularsınız
Amaçlanan alıcı hareketi hâlâ şudur: zaten anladığınız bir depoyu indeksleyin, gerçek bir soru sorun ve alıntıları inceleyin.
- Ücretsiz başlayın: küçük, temsili depolar ilk günde tüm şirket indeksinden daha iyi sonuç verir
- MCP araçlarını kullanın (intelligent_search, find_symbol, dependency_search) ve alıntılanan yolları açın
- Alma ve getirme mimarisi için Nasıl Çalışır'ı okuyun
- Sadece katalog boyutu değil, yetenek katmanları için Uyumluluk ve Dil Kılavuzları'nı okuyun
- Veri işleme için Güvenlik ve Gizlilik'i okuyun; bu sayfa bunların yerini tutmaz