> methodology.md
Jak měříme
Tato stránka je doslova místem, kde si můžete přečíst, na čem jsou založena tvrzení Maguyva o kvalitě a nákladech. Obsahuje pouze fakta: co měříme, jak to hodnotíme a co nepředstíráme, že bylo auditováno.
Platné od 17. července 2026. Nevymýšlíme zde žádné nové, needitované benchmarky. Aktuální počty žijí na produktových plochách, které se regenerují ze zdrojových dat; tato stránka vysvětluje model měření.
Toto je překlad vytvořený s pomocí AI, poskytnutý pro vaše pohodlí. Závaznou je pouze oficiální anglická verze — jakákoli smlouva, kterou uzavřete při registraci, se řídí anglickým textem. Přečíst oficiální anglickou verzi
tl;dr — Tvrzení o kvalitě se opírají o fixture release gates a vícerozměrné tabule language-audit — nikoli o jediný důkaz „100% přesnosti“. Zelená na fixtures neznamená totéž co nezávisle ověřená správná extrakce. Tvrzení o nákladech jsou matematika cen workspace a veřejná transparentnost provozních nákladů, nikoli nezávislý konkurenční audit třetí strany.
1. Proč tato stránka existuje
Skeptičtí kupující by neměli muset zpětně analyzovat marketingové texty. Maguyva indexuje repozitáře a na celém webu prezentuje tvrzení o přesnosti, jazykovém pokrytí a nákladech. Tato tvrzení potřebují metodickou plochu, která je upřímná ohledně rozsahu měření: co je podloženo fixtures, co je podloženo odborným úsudkem a co je jen rámování, nikoli nezávislá certifikace.
2. Co měříme
Kvalitu code intelligence měříme primárně na úrovni jazykového enginu — extrakce symbolů, vztahů a grafů ze zdrojového kódu — nikoli na základě subjektivních skóre „spokojenosti agenta“.
- Sady fixtures pro jednotlivé jazyky: očekávané hrany a symboly, které musí handler správně extrahovat
- Release gates: jazyky jdou do produkce až poté, co přesnost, recall a F1 na fixtures překročí zveřejněné prahy (přesnost ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 na fixtures, s minimálním počtem hran pro statistickou spolehlivost)
- Dimenze language-audit: přesnost, strukturální integrita, úplnost, kvalita a výkon na validační tabuli
- Smyčky korpusu a namátkových kontrol: vzorkované hrany z reálných repozitářů klasifikované podle rubriky (správně, falešně pozitivní, chyba typu/rozsahu/metadat) — popsané v našich blogových příspěvcích o language-grind
- Příznaky schopností produktu: co server skutečně nabízí (AST, lokální proměnné, extrakce grafu) — odděleně od velikosti katalogu
Důležité: Fixtures se validují vůči fixtures, které jsme sami napsali. ZELENÁ znamená, že známé případy procházejí. Automaticky to neznamená, že se každý reálný idiom kódu extrahuje čistě. Toto rozlišení je záměrné a veřejné.
3. Zelená vs. nezávisle ověřeno
Tabule language-audit používá více os, takže jediné zelené světlo nelze číst jako „dokázaná dokonalost“. Hlavní čísla na tabuli jsou typicky rozdělena na:
- overall_green — bez regrese vůči self-snapshot fixtures a souvisejícím korpusovým branám (nutná, nikoli postačující podmínka)
- independently_verified — existuje silný signál odborného úsudku, například namátková kontrola (zahrnuje i jazyky, u nichž se stále vyskytují posouzené chyby)
- verified_clean / nula posouzených chyb na vzorkovaných hranách — přísnější podmnožina posouzených jazyků
- kurace / důvěra v oracle — zda jsou samotné fixtures považovány za důvěryhodné orákulum
- strukturální příznaky — extrakce grafu a schopnost AST nejsou totéž co pouhá příslušnost ke katalogu
Počet jazyků v marketingovém textu (například „279+ jazyků“) je velikost katalogu: nakonfigurované jazyky a položky serveru. Velikost katalogu není SLA pro kvalitu AST. Dáváme přednost vrstvenému reportování před jediným efektním číslem. Aktuální stav produktu najdete v sekcích Kompatibilita a Jazykové průvodce; podrobný popis v příspěvku o rekurzivním sebezdokonalování jazyků na blogu.
4. Kvalita vyhledávání a získávání dat
Kvalita sémantického vyhledávání je multimodální: text, AST, graf a embeddingy jsou fúzovány. Dokumentujeme záměrné inženýrské kompromisy, místo abychom tvrdili, že máme nepřekonatelné vyhledávání:
- Embeddingy používají komerční rodinu modelů (voyage-4-large ke dni červnového snímku blogu 2026), vybranou podle veřejných žebříčků retrieval v době rozhodování
- Vektory jsou binárně kvantizovány kvůli úložišti a nákladům; to záměrně vyměňuje část přesnosti retrieval za levnější a rychlejší Hammingovo vyhledávání bez samostatné vektorové databáze
- Směrování záměru a váhy fúze jsou navržené heuristiky s naměřenými provozními efekty (například nižší míra nulových výsledků po zavedení směrování záměru), nikoli publikovaná nezávislá sada IR hodnocení na zákaznických korpusech
- Blogové příspěvky obsahují sekce „co je stále nedokonalé“ — nedokonalé signály jsou součástí záznamu, nikoli skrývanými poznámkami pod čarou
5. Tvrzení o nákladech
Jazyk o nákladech u Maguyva se týká cenové struktury a provozní transparentnosti, nikoli formální studie TCO certifikované třetí stranou.
- Ceny workspace: účtovány podle počtu repozitářů, indexovaných řádků a frekvence přestavby — nikoli za místo pro člověka nebo agenta. FAQ a popisy plánů rozepisují jednotlivé dimenze.
- Srovnání ve stylu „zhruba 10–30× méně“ na stránce Ceny jsou ilustrativní matematika vůči typickým rozsahům cen za místo, v závislosti na tom, s jakým nástrojem účtovaným za místo srovnáváte. Nejde o uzamčený nezávislý konkurenční benchmarkový balíček.
- Poctivost provozních nákladů: stránka /team publikuje reálný měsíční rozpad výdajů na software (předplatná, nástroje MCP/search, náklady odvozené od využití). Jde o transparentnost typu „customer zero“, nikoli auditovanou účetní závěrku.
- Náklady na embeddingy a infrastrukturu jsou přijaté náklady produktu (prémiové embeddingy, úložiště, přestavby grafu). Neseme je záměrně a otevřeně to říkáme v příspěvku o voyage-4-large i v cenové narativu.
6. Co netvrdíme
Tato stránka je také seznamem ne-tvrzení. Pokud něco není na měřicí tabuli, neberte marketingový tón jako důkaz.
- Žádná plošná záruka absolutní přesnosti pro každý jazyk. Prahy fixtures platí pro každý jazyk na známých případech; zbytková reálná chyba je očekávaná a ukotvená v realitě.
- Žádné tvrzení, že overall_green znamená produkčně dokonalou extrakci pro každý idiom v každém repozitáři
- Žádný balíček certifikace shody třetí strany prezentovaný jako metodický artefakt na této ploše (viz Zabezpečení pro fakta o nakládání s daty, nikoli odznaky shody)
- Žádné nezávislé srovnání více dodavatelů na sdílených korpusech publikované jako stálý žebříček
- Výsledky vyhledávání a analýzy zůstávají službou na bázi „nejlepší snaha“ podle Podmínek služby — Maguyva nenahrazuje code review, testování ani bezpečnostní audity
7. Jak si to ověřit sami
Zamýšlený postup kupujícího je stále tento: indexujte repozitář, kterému už rozumíte, položte jednu skutečnou otázku a prozkoumejte citace.
- Začněte zdarma: malé reprezentativní repozitáře fungují první den lépe než index celé firmy
- Použijte nástroje MCP (intelligent_search, find_symbol, dependency_search) a otevřete citované cesty
- Přečtěte si Jak to funguje pro architekturu ingestování a vyhledávání
- Přečtěte si Kompatibilita a Jazykové průvodce pro úrovně schopností, nejen velikost katalogu
- Přečtěte si Zabezpečení a Ochrana soukromí pro nakládání s daty; tato stránka je nenahrazuje