सामग्री पर जाएँ
cd /blog

हमने कोड सर्च को voyage-4-large में क्यों अपग्रेड किया

[एम्बेडिंग][खोज][आर्किटेक्चर]

> हमने अपनी कोड एम्बेडिंग को voyage-4-large पर शिफ़्ट किया — जो फ़िलहाल पब्लिक RTEB कोड रिट्रीवल लीडरबोर्ड में शीर्ष पर है। ईमानदार वर्ज़न: वह ट्रेड-ऑफ़ जो हम करते हैं, हम वास्तव में क्या इंडेक्स करते हैं, और हम प्रीमियम एम्बेडिंग के लिए भुगतान क्यों करते हैं।

इस पोस्ट में दिए गए बेंचमार्क आंकड़े प्रकाशन के समय (जून 2026) के RTEB लीडरबोर्ड को दर्शाते हैं। लीडरबोर्ड बदलते रहते हैं; रैंकिंग को एक स्नैपशॉट मानें, स्थायी तथ्य नहीं।

सिमेंटिक सर्च सिर्फ़ उतनी ही अच्छी होती है जितनी उसके नीचे मौजूद एम्बेडिंग।

जब कोई एजेंट Maguyva से पूछता है “हम रीट्राई कहां हैंडल करते हैं,” तो वह “retry” शब्द के लिए grep नहीं कर रहा होता। वह अर्थ पूछ रहा होता है — बैकऑफ़ लूप, सर्किट ब्रेकर, वह चीज़ जो किसी अस्थिर कॉल को लपेटती है। उस सवाल का जवाब एक वेक्टर मॉडल देता है जो कोड को स्पेस में एक बिंदु में बदल देता है और पड़ोसियों को खोजता है। बेहतर मॉडल चुनें और प्रोडक्ट में हर सिमेंटिक क्वेरी चुपचाप तेज़ हो जाती है।

तो हमने अपना बदल दिया। जून 2026 से, Maguyva की कोड एम्बेडिंग voyage-4-large पर चलती हैं, जिसने voyage-code-3 की जगह ली है।

बेंचमार्क

हमने यह फ़ैसला किसी अनुमान पर नहीं लिया। पब्लिक Retrieval Embedding Benchmark (RTEB) असली रिट्रीवल टास्क पर एम्बेडिंग मॉडल को रैंक करता है, और इसके Code लीडरबोर्ड पर voyage-4-large कुल मिलाकर #1 (90.86) पर है — gemini-embedding-2-preview (90.26) से आगे, और उल्लेखनीय रूप से, उस मॉडल से भी आगे जिसे हम पहले से उपयोग कर रहे थे, voyage-code-3 (89.73, #3)।

यह एक छोटा-सा पूर्ण अंतर है। लेकिन यह सही दिशा में एक अंतर है, एक पब्लिक बेंचमार्क पर, ठीक उसी टास्क पर जिसकी हमें परवाह है: अर्थ के आधार पर कोड को रिट्रीव करना।

जो ट्रेड-ऑफ़ हम स्वीकार करते हैं: बाइनरी क्वांटाइज़ेशन

यहां वह हिस्सा है जिसे ज़्यादातर “हमने अपना मॉडल अपग्रेड किया” पोस्ट छोड़ देती हैं।

Maguyva पूर्ण-सटीकता वाले वेक्टर स्टोर नहीं करता। हम बाइनरी-क्वांटाइज़्ड एम्बेडिंग स्टोर करते हैं: हर 2048-डायमेंशनल वेक्टर एक 2048-बिट सिग्नेचर में सिमट जाता है — प्रति वेक्टर 256 बाइट्स। उन सिग्नेचर को Hamming distance से सर्च किया जाता है, इंडेक्स्ड और प्रति टेनेंट पार्टीशन्ड।

यह एक जानबूझकर किया गया ट्रेड-ऑफ़ है। बाइनरी क्वांटाइज़ेशन कुछ रिट्रीवल प्रिसिज़न के बदले नाटकीय रूप से छोटा स्टोरेज और तेज़, सस्ता डिस्टेंस मैथ देता है, बिना किसी अलग वेक्टर डेटाबेस को ऑपरेट किए। ऐसे प्रोडक्ट के लिए जो प्रति वर्कस्पेस पूरी रिपॉज़िटरी इंडेक्स करता है, यह इकोनॉमिक्स बेंचमार्क पॉइंट के आख़िरी हिस्से को निचोड़ने से ज़्यादा मायने रखती है।

voyage-4-large स्टोरेज लेयर के माइग्रेशन को मजबूर किए बिना इस डिज़ाइन में फ़िट बैठता है: यह 2048-डायमेंशनल आउटपुट देता है, ठीक voyage-code-3 की तरह, तो हमारे bit(2048) कॉलम और Hamming सर्च पथ नहीं बदले। मॉडल बेहतर हो गया; स्कीमा जगह पर बनी रही।

कोड तो बस शुरुआत थी

Maguyva एक कोड-इंटेलिजेंस टूल है। लेकिन हम ख़ुद भी अपने पहले ग्राहक हैं, और हम इसे किसी और चीज़ पर भी लगाते हैं: वह मार्कडाउन जो कोड के साथ हमारी रिपॉज़िटरी में रहता है। आर्किटेक्चर डिसीज़न रिकॉर्ड, रनबुक, कॉन्ट्रैक्ट, फ़ाइनेंस और पॉलिसी डॉक्स — यह सब Git में वर्ज़न-कंट्रोल्ड है, यह सब उसी MCP सर्वर के पीछे है, दस्तावेज़ों पर एक सिमेंटिक इंडेक्स, न कि सिर्फ़ सोर्स पर।

यही ठीक वह वजह है कि voyage-4-large की व्यापकता मायने रखती है। लीडरबोर्ड के उसी RTEB परिवार पर यह फ़ाइनेंस पर #1, हेल्थकेयर पर #1, और कुल टेक्स्ट रिट्रीवल पर #1 है — Google के Gemini Embedding, Cohere के Embed v4, और OpenAI के text-embedding-3-large से आगे। (Voyage, RTEB का सह-निर्माता है, इसलिए हम इसे एक बिल्कुल निष्पक्ष रेफ़री के बजाय एक मज़बूत पब्लिक सिग्नल के रूप में पढ़ते हैं — लेकिन इसे हर बड़े कमर्शियल मॉडल के विरुद्ध, प्राइवेट होल्ड-आउट सेट पर, आमने-सामने बेंचमार्क किया गया है।) वही इंडेक्स जो किसी एजेंट के लिए सही फ़ंक्शन खोजता है, किसी कॉन्ट्रैक्ट में सही क्लॉज़ या किसी पॉलिसी में सही लाइन भी खोजता है — और उन डोमेन में, voyage-4-large कोई समझौता नहीं है, यह लीडर है।

हम प्रीमियम एम्बेडिंग के लिए भुगतान क्यों करते हैं

सर्च करने का एक सस्ता तरीक़ा है, और उसका बड़ा हिस्सा मुफ़्त है। लेक्सिकल सर्च — BM25 और उसके जैसे — कीवर्ड मैच करते हैं, लोकली चलते हैं, और कुछ भी ख़र्च नहीं करते। BGE, Nomic, और embeddinggemma जैसे ओपन-सोर्स एम्बेडिंग मॉडल वाक़ई ठीक-ठाक सिमेंटिक रिट्रीवल देते हैं, और आप इन्हें एक GPU की क़ीमत पर सेल्फ़-होस्ट कर सकते हैं। Maguyva मुफ़्त पक्ष का भी उपयोग करता है: हर क्वेरी टेक्स्ट, AST, ग्राफ, और सिमेंटिक सर्च को मिलाती है। जिस चीज़ पर हम कंजूसी नहीं करते वह है सिमेंटिक लेयर।

हम एक मुफ़्त मॉडल सेल्फ़-होस्ट करने के बजाय प्रीमियम एम्बेडिंग — voyage-4-large — के लिए प्रति टोकन भुगतान करते हैं, दो वजहों से। पहला, अकेले कीवर्ड सर्च “हम रीट्राई कहां हैंडल करते हैं” का जवाब नहीं दे सकती जब कोड backoff और circuit breaker कहता है और कभी “retry” शब्द नहीं कहता — अर्थ ही एम्बेडिंग का पूरा मक़सद है, और हम जिन डोमेन को सर्व करते हैं उन पर ओपन मॉडल प्रीमियम मॉडल से पीछे रहते हैं: सामान्य टेक्स्ट पर कुछ पॉइंट पीछे, और कोड, कॉन्ट्रैक्ट, और फ़ाइनेंस जैसी नीश में और ज़्यादा पीछे। दूसरा, हमारे अनुभव में रिट्रीवल क्वालिटी अंतिम जवाब को दूसरी तरफ़ के मॉडल से कहीं ज़्यादा आकार देती है — एक मज़बूत एजेंट को भी ग़लत कॉन्टेक्स्ट दिया जाए तो वह ग़लत जवाब ही देता है, और वह उस दस्तावेज़ को कभी नहीं देखता जो उसे कभी दिया ही नहीं गया।

तो प्रीमियम एम्बेडिंग एक प्रति-टोकन बिल है जो हर रिपॉज़िटरी और दस्तावेज़ के साथ स्केल करता है जिसे हम इंडेक्स करते हैं — और हम इसे जानबूझकर चुकाते हैं। हमारे उपयोगकर्ताओं को मिलने वाले नतीजे के लिए, सही फ़ंक्शन या सही क्लॉज़, हमें लगता है कि यह ट्रेड-ऑफ़ इसके लायक़ है।

ईमानदार हिस्सा

Voyage का अपना डॉक्यूमेंटेशन अब भी voyage-code-3 को कोड-ऑप्टिमाइज़्ड मॉडल के रूप में लेबल करता है। तो हमने बदलाव क्यों किया?

क्योंकि हमने पब्लिक बेंचमार्क पढ़ा, सिर्फ़ वेंडर की मॉडल टेबल नहीं, और बेंचमार्क ने कोड रिट्रीवल के लिए voyage-4-large को सबसे ऊपर रखा। यह एक आगे-देखने वाला फ़ैसला था: नए, आम तौर पर मज़बूत मॉडल को लें और उन टास्क पर एक पब्लिक लीडरबोर्ड के विरुद्ध उसे वैलिडेट करें जो मायने रखते हैं। हम यह दांव लगाने में सहज हैं क्योंकि साक्ष्य व्यापक है — voyage-4-large सिर्फ़ कोड पर नहीं जीतता, यह फ़ाइनेंस, हेल्थकेयर, और कुल रिट्रीवल पर भी आगे है।

शांत बुनियाद

हम जो भी टूल एक्सपोज़ करते हैं — सिमेंटिक सर्च, टास्क-कॉन्टेक्स्ट संग्रह, साक्ष्य-आधारित प्रश्नोत्तर — आख़िर में रिट्रीवल पर टिकते हैं। जब रिट्रीवर बेहतर होता है, तो दूसरी तरफ़ मौजूद एजेंट को बेहतर साक्ष्य मिलता है, वह कम ग़लत मोड़ लेता है, और अपने जवाबों को सही कोड में — या सही क्लॉज़, या सही पॉलिसी में — जड़ देता है। एक तेज़ एम्बेडिंग मॉडल कोई चमकदार फ़ीचर नहीं है। यह बाक़ी सब कुछ के नीचे की बुनियाद है, और हमने उसे अभी ऊंचा किया है। आपको इसका पता नहीं चलेगा। यही तो मक़सद है।

जुड़ी हुई रीडिंग

Maguyva की बिल्ड लॉग से और लेख

भाषा आवर्ती स्व-सुधार: लगभग 280 भाषाओं में कोड इंटेलिजेंस को अनथक मेहनत से निखारना_

हम लगभग 280 भाषाओं के लिए कोड इंटेलिजेंस सपोर्ट करते हैं। कोई इंसान इसका हाथ से ऑडिट नहीं कर सकता। इसलिए हमने एक भाषा आवर्ती स्व-सुधार लूप बनाया — स्पॉट-चेक, LLM-as-judge, एक चीज़ ठीक करो, दोबारा वैलिडेट करो — और इसे आइसोलेटेड एजेंट्स के एक फ़्लीट के साथ तब तक चलाते हैं जब तक एक्सट्रैक्शन वास्तव में सही न हो जाए, सिर्फ़ ग्रीन न हो।

[आर्किटेक्चर][भाषाएँ][एजेंट्स]

मल्टी-मोडल फ़्यूज़न सर्च: हर क्वेरी के लिए सही रिट्रीवर चुनना_

"parseConfig कहां परिभाषित है" जैसी क्वेरी को "auth कैसे काम करता है" से अलग तरह की सर्च चाहिए। Maguyva इंटेंट को वर्गीकृत करता है, उसके हिसाब से चार रिट्रीवल मोडैलिटी को वेट देता है, और नतीजों को वेटेड Reciprocal Rank Fusion से जोड़ता है।

[खोज][आर्किटेक्चर]

एजेंट ऑब्ज़र्वेबिलिटी: Hooks, Alloy, और Grafana_

हमने Claude Code और Codex को OpenTelemetry और Alloy के साथ एक ही Grafana स्टैक में जोड़ा, फिर एजेंट व्यवहार की समस्याओं को उनके स्रोत पर खोजने और ठीक करने के लिए ट्रेस और लॉग का उपयोग किया।

[ऑब्ज़र्वेबिलिटी][Grafana][OpenTelemetry][आर्किटेक्चर]