> methodology.md
Jak mierzymy
Ta strona to dosłownie miejsce, w którym można przeczytać, na czym opierają się twierdzenia Maguyva dotyczące jakości i kosztów. Zawiera same fakty: co mierzymy, jak to oceniamy i czego nie udajemy, że zostało zaudytowane.
Obowiązuje od 17 lipca 2026 r. Nie wymyślamy tu żadnych nowych, niezaudytowanych benchmarków. Aktualne liczby znajdują się na powierzchniach produktu, które regenerują się na podstawie danych źródłowych; ta strona wyjaśnia model pomiaru.
To jest tłumaczenie wspomagane przez AI, udostępnione dla Twojej wygody. Wersja oficjalna w języku angielskim jest jedyną wiążącą — każda umowa, którą zawierasz, rejestrując się, podlega tekstowi w języku angielskim. Przeczytaj oficjalną wersję w języku angielskim
tl;dr — Twierdzenia dotyczące jakości opierają się na bramkach wydania fixture i wielowymiarowych tablicach language-audit — a nie na jednym dowodzie „100% precyzji”. Zielone światło na fixture'ach to nie to samo, co niezależnie zweryfikowana poprawna ekstrakcja. Twierdzenia dotyczące kosztów to matematyka cen workspace oraz publiczna przejrzystość kosztów operacyjnych, a nie niezależny audyt konkurencyjny strony trzeciej.
1. Dlaczego ta strona istnieje
Sceptyczni kupujący nie powinni musieć odtwarzać tekstów marketingowych metodą inżynierii wstecznej. Maguyva indeksuje repozytoria i przedstawia na całej witrynie twierdzenia dotyczące precyzji, pokrycia językowego i kosztów. Te twierdzenia wymagają powierzchni metodologicznej, która jest szczera co do zakresu pomiaru: co jest poparte fixture'ami, co opiera się na ocenie eksperckiej, a co jest jedynie ujęciem retorycznym, a nie niezależną certyfikacją.
2. Co mierzymy
Jakość code intelligence mierzymy przede wszystkim na poziomie silnika językowego — ekstrakcji symboli, relacji i grafów z kodu źródłowego — a nie na podstawie subiektywnych wyników „zadowolenia agenta”.
- Zestawy fixture dla poszczególnych języków: oczekiwane krawędzie i symbole, które handler musi poprawnie wyekstrahować
- Bramki wydania: języki trafiają do produkcji dopiero, gdy precyzja, recall i F1 na fixture'ach przekroczą opublikowane progi (precyzja ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 na fixture'ach, przy minimalnej liczbie krawędzi zapewniającej wiarygodność statystyczną)
- Wymiary language-audit: dokładność, integralność strukturalna, kompletność, jakość i wydajność na tablicy walidacyjnej
- Pętle korpusowe i punktowe kontrole: próbkowane krawędzie z rzeczywistych repozytoriów klasyfikowane według rubryki (poprawna, fałszywie pozytywna, błąd typu/zakresu/metadanych) — opisane w naszych wpisach na blogu o language-grind
- Flagi możliwości produktu: co serwer faktycznie oferuje (AST, lokalne zmienne, ekstrakcja grafu) — niezależnie od rozmiaru katalogu
Ważne: Fixture'y są walidowane względem fixture'ów, które sami napisaliśmy. ZIELONY wynik oznacza, że znane przypadki przechodzą testy. Nie oznacza to automatycznie, że każdy rzeczywisty idiom kodu zostanie poprawnie wyekstrahowany. To rozróżnienie jest celowe i jawne.
3. Zielone światło a niezależna weryfikacja
Tablica language-audit wykorzystuje wiele osi, dzięki czemu pojedyncze zielone światło nie może być odczytywane jako „udowodniona perfekcja”. Kluczowe liczby na tablicy są zazwyczaj podzielone na:
- overall_green — brak regresji względem fixture'ów self-snapshot i powiązanych bramek korpusowych (warunek konieczny, ale niewystarczający)
- independently_verified — istnieje silny sygnał oceny eksperckiej, np. próbka kontrolna (obejmuje też języki, w których nadal wykryto ocenione błędy)
- verified_clean / zero błędów ocenionych na próbkowanych krawędziach — ściślejszy podzbiór ocenionych języków
- kuracja / zaufanie do oracle — czy same fixture'y są traktowane jako zaufane wyrocznie
- flagi strukturalne — ekstrakcja grafu i możliwości AST nie są tożsame z samą przynależnością do katalogu
Liczba języków w materiałach marketingowych (na przykład „279+ języków”) to rozmiar katalogu: skonfigurowane języki i wpisy serwera. Rozmiar katalogu nie jest gwarancją jakości AST (SLA). Wolimy raportowanie warstwowe od pojedynczej, efektownej liczby. Aktualny stan produktu znajdziesz w sekcjach Zgodność i Przewodniki językowe; szczegółowy opis — we wpisie o rekursywnym samodoskonaleniu języków na blogu.
4. Jakość wyszukiwania i pozyskiwania danych
Jakość semantic search jest multimodalna: tekst, AST, graf i embeddingi są łączone. Dokumentujemy celowe kompromisy inżynieryjne, zamiast twierdzić, że mamy niepokonane wyszukiwanie:
- Embeddingi wykorzystują komercyjną rodzinę modeli (voyage-4-large według stanu z migawki bloga z czerwca 2026 r.), wybraną na podstawie publicznych rankingów retrieval w momencie podejmowania decyzji
- Wektory są kwantyzowane binarnie pod kątem przechowywania i kosztów; to celowy kompromis, w którym część precyzji retrieval oddajemy w zamian za tańsze i szybsze wyszukiwanie Hamminga bez osobnej bazy wektorowej
- Routing intencji i wagi fuzji to zaprojektowane heurystyki o zmierzonych efektach operacyjnych (na przykład niższy wskaźnik zapytań bez wyników po wdrożeniu routingu intencji), a nie opublikowany niezależny zestaw ewaluacyjny IR na korpusach klienckich
- Wpisy na blogu zawierają sekcje „co wciąż jest niedoskonałe” — niedoskonałe sygnały są częścią zapisu, a nie ukrywanymi przypisami
5. Twierdzenia dotyczące kosztów
Język dotyczący kosztów w Maguyva odnosi się do struktury cenowej i przejrzystości operacyjnej, a nie do formalnego badania TCO certyfikowanego przez stronę trzecią.
- Cennik workspace: rozliczany na podstawie liczby repozytoriów, zindeksowanych linii kodu i częstotliwości przebudowy — a nie za miejsce dla człowieka czy agenta. Szczegóły znajdziesz w FAQ i opisach planów.
- Porównania w stylu „nawet 10–30x taniej” na stronie Cennik to poglądowa matematyka względem typowych zakresów cen za miejsce, w zależności od tego, z jakim narzędziem rozliczanym per seat porównujesz. Nie jest to zamknięty, niezależny pakiet benchmarków konkurencyjnych.
- Uczciwość kosztów operacyjnych: strona /team publikuje rzeczywisty miesięczny podział wydatków na oprogramowanie (subskrypcje, narzędzia MCP/search, koszty zależne od użycia). To przejrzystość na zasadzie „customer zero”, a nie audytowane sprawozdanie finansowe.
- Koszty embeddingów i infrastruktury to zaakceptowane koszty produktu (premium embeddingi, storage, przebudowy grafu). Ponosimy je celowo i mówimy o tym wprost we wpisie o voyage-4-large oraz w narracji cenowej.
6. Czego nie twierdzimy
Ta strona jest też listą nie-twierdzeń. Jeśli czegoś nie ma na tablicy pomiarowej, nie traktuj tonu marketingowego jako dowodu.
- Brak ogólnej gwarancji absolutnej precyzji dla każdego języka. Progi fixture obowiązują dla każdego języka na znanych przypadkach; pewien poziom rzeczywistych błędów jest oczekiwany i uziemiony w rzeczywistości.
- Brak twierdzenia, że overall_green oznacza produkcyjnie doskonałą ekstrakcję dla każdego idiomu w każdym repozytorium
- Brak certyfikatu zgodności strony trzeciej przedstawianego jako artefakt metodologiczny na tej stronie (patrz Bezpieczeństwo w kwestii faktów dotyczących obsługi danych, nie odznak zgodności)
- Brak niezależnego porównania wielu dostawców na wspólnych korpusach publikowanego jako stały ranking
- Wyniki wyszukiwania i analizy pozostają usługą typu best-effort zgodnie z Regulaminem — Maguyva nie zastępuje przeglądu kodu, testowania ani audytów bezpieczeństwa
7. Jak zweryfikować to samodzielnie
Zamierzony sposób działania kupującego to wciąż: zindeksuj repozytorium, które już znasz, zadaj jedno prawdziwe pytanie i sprawdź cytowania.
- Zacznij za darmo: małe, reprezentatywne repozytoria pierwszego dnia sprawdzają się lepiej niż indeks całej firmy
- Użyj narzędzi MCP (intelligent_search, find_symbol, dependency_search) i otwórz cytowane ścieżki
- Przeczytaj Jak to działa, aby poznać architekturę indeksowania i retrieval
- Przeczytaj Zgodność i Przewodniki językowe, aby poznać poziomy możliwości, a nie tylko rozmiar katalogu
- Przeczytaj Bezpieczeństwo i Prywatność w kwestii obsługi danych; ta strona ich nie zastępuje