Przejdź do treści
cd /blog

Dlaczego zaktualizowaliśmy wyszukiwanie kodu do voyage-4-large

[Embeddings][Wyszukiwanie][Architektura]

> Przenieśliśmy nasze embeddingi kodu na voyage-4-large — obecnie na szczycie publicznego rankingu RTEB dla wyszukiwania kodu. Wersja uczciwa: kompromis, na jaki idziemy, co faktycznie indeksujemy i dlaczego płacimy za embeddingi premium.

Liczby benchmarków w tym wpisie odzwierciedlają rankingi RTEB w momencie publikacji (czerwiec 2026). Rankingi się zmieniają; traktuj je jako zrzut z danego momentu, nie trwały fakt.

Wyszukiwanie semantyczne jest tak dobre, jak leżące u jego podstaw embeddingi.

Gdy agent pyta Maguyva „gdzie obsługujemy ponowienia”, nie grepuje słowa „retry”. Pyta o znaczenie — pętlę backoff, wyłącznik obwodu (circuit breaker), coś, co opakowuje niestabilne wywołanie. Na to pytanie odpowiada model wektorowy, który zamienia kod w punkt w przestrzeni i znajduje sąsiadów. Wybierz lepszy model, a każde zapytanie semantyczne w produkcie po cichu staje się ostrzejsze.

Więc zmieniliśmy nasz. Od czerwca 2026 embeddingi kodu Maguyva działają na voyage-4-large, zastępując voyage-code-3.

Benchmark

Nie podjęliśmy tej decyzji na wyczucie. Publiczny Retrieval Embedding Benchmark (RTEB) rankinguje modele embeddingów na prawdziwych zadaniach wyszukiwania, a na jego rankingu Code voyage-4-large zajmuje #1 ogółem (90,86) — przed gemini-embedding-2-preview (90,26) i, co istotne, przed modelem, którego już używaliśmy, voyage-code-3 (89,73, #3).

To niewielka różnica bezwzględna. Ale to różnica we właściwym kierunku, na publicznym benchmarku, w dokładnie tym zadaniu, na którym nam zależy: wydobywaniu kodu według znaczenia.

Kompromis, który akceptujemy: kwantyzacja binarna

Oto część, którą pomija większość wpisów typu „zaktualizowaliśmy nasz model”.

Maguyva nie przechowuje wektorów pełnej precyzji. Przechowujemy embeddingi skwantyzowane binarnie: każdy 2048-wymiarowy wektor zwija się do 2048-bitowej sygnatury — 256 bajtów na wektor. Te sygnatury są przeszukiwane odległością Hamminga, zaindeksowane i podzielone na partycje per tenant.

To celowy kompromis. Kwantyzacja binarna rezygnuje z części precyzji wyszukiwania w zamian za drastycznie mniejsze przechowywanie oraz szybką, tanią matematykę odległości bez osobnej bazy wektorowej do utrzymywania. Dla produktu, który indeksuje całe repozytoria per workspace, ta ekonomia ma większe znaczenie niż wyciśnięcie ostatniego ułamka punktu benchmarku.

voyage-4-large pasuje do tego projektu bez wymuszania migracji warstwy przechowywania: produkuje wyjście 2048-wymiarowe, tak jak voyage-code-3, więc nasze kolumny bit(2048) i ścieżka wyszukiwania Hamminga się nie zmieniły. Model się poprawił; schemat pozostał na miejscu.

Kod to był dopiero początek

Maguyva to narzędzie inteligencji kodu. Ale jesteśmy też klientem zero i kierujemy je na coś jeszcze: markdown, który żyje w naszych repozytoriach obok kodu. Rekordy decyzji architektonicznych, runbooki, kontrakty, dokumenty finansowe i dotyczące polityki — wszystko to wersjonowane w Git, wszystko za tym samym serwerem MCP, semantyczny indeks nad dokumentami, nie tylko nad źródłem.

Właśnie dlatego szerokość voyage-4-large ma znaczenie. Na tej samej rodzinie rankingów RTEB jest #1 w finansach, #1 w ochronie zdrowia i #1 w ogólnym wyszukiwaniu tekstowym — przed Gemini Embedding od Google, Embed v4 od Cohere i text-embedding-3-large od OpenAI. (Voyage jest współtwórcą RTEB, więc czytamy to jako silny sygnał publiczny, a nie idealnie neutralnego sędziego — ale jest benchmarkowany bezpośrednio z każdym większym modelem komercyjnym, na prywatnych zbiorach hold-out). Ten sam indeks, który znajduje właściwą funkcję dla agenta, znajduje właściwą klauzulę w kontrakcie lub właściwą linię w polityce — a w tych domenach voyage-4-large to nie kompromis, to lider.

Dlaczego płacimy za embeddingi premium

Istnieje tańszy sposób na wyszukiwanie, a znaczna jego część jest darmowa. Wyszukiwanie leksykalne — BM25 i jego krewni — dopasowuje słowa kluczowe, działa lokalnie i nic nie kosztuje. Modele embeddingów open source, takie jak BGE, Nomic i embeddinggemma, dają naprawdę przyzwoite wyszukiwanie semantyczne, i możesz je hostować samodzielnie za cenę GPU. Maguyva korzysta też ze strony darmowej: każde zapytanie łączy wyszukiwanie tekstowe, AST, grafowe i semantyczne. Nie oszczędzamy na warstwie semantycznej.

Płacimy za token za embeddingi premium — voyage-4-large — zamiast hostować darmowy model samodzielnie, z dwóch powodów. Po pierwsze, samo wyszukiwanie słów kluczowych nie potrafi odpowiedzieć na „gdzie obsługujemy ponowienia”, gdy kod mówi backoff i circuit breaker, a nigdy nie mówi słowa „retry” — znaczenie to cały sens embeddingu, a w domenach, które obsługujemy, modele open source zostają w tyle za modelami premium: kilka punktów w tekście ogólnym, i jeszcze bardziej w niszach takich jak kod, kontrakty i finanse. Po drugie, z naszego doświadczenia jakość wyszukiwania kształtuje ostateczną odpowiedź bardziej niż model po drugiej stronie — silny agent otrzymujący niewłaściwy kontekst i tak odpowie źle, i nigdy nie zobaczy dokumentu, którego mu nigdy nie dano.

Więc embeddingi premium to rachunek za token, który skaluje się z każdym repozytorium i dokumentem, który indeksujemy — i płacimy go celowo. Dla wyniku, jaki dostają nasi użytkownicy, właściwej funkcji lub właściwej klauzuli, uważamy, że ten kompromis jest wart tego.

Uczciwa część

Własna dokumentacja Voyage wciąż oznacza voyage-code-3 jako model zoptymalizowany pod kod. Więc dlaczego zmiana?

Ponieważ czytamy publiczny benchmark, nie tylko tabelę modeli dostawcy, a benchmark postawił voyage-4-large na szczycie dla wyszukiwania kodu. To była decyzja patrząca w przyszłość: wziąć nowszy, ogólnie silniejszy model i zwalidować go względem publicznego rankingu na zadaniach, które mają znaczenie. Czujemy się komfortowo, podejmując ten zakład, ponieważ dowody są szerokie — voyage-4-large nie wygrywa tylko na kodzie, przoduje też w finansach, ochronie zdrowia i ogólnym wyszukiwaniu.

Cicha podłoga

Każde narzędzie, które udostępniamy — wyszukiwanie semantyczne, gromadzenie kontekstu zadania, ugruntowane pytania i odpowiedzi — na dole opiera się na wyszukiwaniu. Gdy retriever się poprawia, agent po drugiej stronie dostaje lepsze dowody, popełnia mniej złych skrętów i zakotwicza swoje odpowiedzi we właściwym kodzie — albo we właściwej klauzuli, albo we właściwej polityce. Ostrzejszy model embeddingów to nie efektowna funkcja. To podłoga pod wszystkim innym, a my właśnie ją podnieśliśmy. Nie zauważysz tego. O to właśnie chodzi.

Powiązane treści

Więcej z dziennika budowy Maguyva