> methodology.md
Hur vi mäter
Den här sidan är bokstavligen platsen för att läsa hur kvalitets- och kostnadspåståendena om Maguyva är förankrade. Den är rena fakta: vad vi mäter, hur vi poängsätter det och vad vi inte låtsas ha granskat.
Gäller från 17 juli 2026. Inga nya ogranskade benchmarks uppfinns här. Aktuella siffror finns på produktytor som återgenereras från källdata; den här sidan förklarar mätmodellen.
Detta är en AI-assisterad översättning som tillhandahålls för din bekvämlighet. Den officiella engelska versionen är den enda bindande — alla avtal du ingår när du registrerar dig styrs av den engelska texten. Läs den officiella engelska versionen
tl;dr — Kvalitetspåståenden vilar på fixture release gates och flerdimensionella language-audit-tavlor — inte på ett enda bevis för “100 % precision.” Grönt på fixtures är inte detsamma som oberoende verifierad, korrekt extraktion. Kostnadspåståenden är workspace-prissättningsmatematik och offentlig transparens kring driftskostnader, ingen oberoende konkurrensgranskning av tredje part.
1. Varför den här sidan finns
Skeptiska köpare ska inte behöva reverse-engineera marknadsföringstext. Maguyva indexerar repositories och visar precisions-, språktäcknings- och kostnadspåståenden över hela sajten. Dessa påståenden behöver en metodikyta som är ärlig om mätomfånget: vad som är fixture-belagt, vad som är bedömningsbelagt och vad som är framing snarare än oberoende certifiering.
2. Vad vi mäter
Kvaliteten på kodintelligens mäts främst på language engine — extraktion av symboler, relationer och grafer från källan — inte på subjektiva “agent happiness”-poäng.
- Fixture-sviter per språk: förväntade edges och symboler som handlern måste extrahera korrekt
- Release gates: språk lanseras endast när fixture-precision, recall och F1 klarar publicerade tröskelvärden (precision ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 på fixtures, med ett minimiantal edges för statistisk tillförlitlighet)
- Language-audit-dimensioner: noggrannhet, strukturell integritet, fullständighet, kvalitet och prestanda på valideringstavlan
- Corpus- och stickprovsloopar: samplade edges från verkliga repositories, klassificerade enligt rubrik (korrekt, falskt positivt, typ-/omfångs-/metadatafel) — beskrivna i våra language-grind-blogginlägg
- Product capability flags: vad servern annonserar (AST, locals, grafextraktion) skilt från katalogstorlek
Viktigt: Fixtures valideras mot fixtures vi själva skrivit. GRÖNT betyder att de kända fallen klarar sig. Det betyder inte automatiskt att varje idiom från verkligheten extraheras felfritt. Den skillnaden är avsiktlig och offentlig.
3. Grönt kontra oberoende verifierat
Language-audit-tavlan använder flera axlar så att ett enda grönt ljus inte kan läsas som “bevisat perfekt.” Huvudsiffrorna på tavlan är vanligtvis uppdelade:
- overall_green — regressionsrent mot self-snapshot-fixtures och relaterade corpus gates (nödvändigt, inte tillräckligt)
- independently_verified — har en stark bedömningssignal, till exempel en spot-check-seed (inkluderar språk som fortfarande visar bedömda fel)
- verified_clean / noll bedömda fel på samplade edges — en strängare delmängd av bedömda språk
- curation / oracle trust — huruvida fixtures själva behandlas som betrodda oracles
- structural flags — grafextraktion och AST-förmåga är inte identiskt med katalogmedlemskap
Marknadsföringens språkantal (till exempel “279+ språk”) är katalogstorlek: konfigurerade språk och serverposter. Katalogstorlek är inget AST-kvalitets-SLA. Vi föredrar nivåindelad rapportering framför en enda skrytsiffra. För den nuvarande produktytan, se Compatibility och Language Guides; för berättande detaljer, se inlägget om språkens rekursiva självförbättring på bloggen.
4. Kvalitet på sökning och retrieval
Kvaliteten på semantisk sökning är multimodal: text, AST, graf och embeddings smälts samman. Vi dokumenterar medvetna tekniska avvägningar istället för att hävda oslagbar retrieval:
- Embeddings använder en kommersiell modellfamilj (voyage-4-large enligt blogginstantbilden från juni 2026), vald utifrån offentliga retrieval-topplistor vid beslutstillfället
- Vektorer är binärt kvantiserade för lagring och kostnad; det byter medvetet bort viss retrieval-precision mot billigare, snabbare Hamming-sökning utan en separat vektordatabas
- Intent routing och fusion weights är konstruerade heuristiker med uppmätta operativa effekter (till exempel lägre andel nollresultat efter intent routing), inte en publicerad oberoende IR-utvärderingssvit på kunders korpusar
- Blogginlägg innehåller avsnitt om “vad som fortfarande är ofullständigt” — ofullständiga signaler är en del av protokollet, inga fotnoter att dölja
5. Kostnadspåståenden
Kostnadsspråket på Maguyva handlar om prisstruktur och driftstransparens, inte en formell TCO-studie certifierad av tredje part.
- Workspace-prissättning: debiteras per repositories, indexerade rader och ombyggnadsfrekvens — inte per mänsklig plats eller agentplats. FAQ och planbeskrivningar förklarar dimensionerna.
- “Ungefär 10–30x mindre”-jämförelser på Pricing är illustrativ matematik mot typiska per-plats-intervall, beroende på vilket per-plats-prissatt verktyg du jämför med. Det är inget låst, oberoende konkurrensbenchmark-paket.
- Ärlighet om driftskostnader: /team-sidan publicerar en verklig månatlig uppdelning av mjukvarukostnader (prenumerationer, MCP-/sökverktyg, användningsbaserade kostnader). Det är customer-zero-transparens, inget granskat bokslut.
- Embedding- och infrakostnader är accepterade produktkostnader (premium-embeddings, lagring, grafombyggnader). Vi betalar dem med avsikt och säger det i voyage-4-large-inlägget och prissättningsberättelsen.
6. Vad vi inte påstår
Den här sidan är också en lista över icke-påståenden. Om något inte finns på mättavlan, behandla inte marknadsföringstonen som bevis.
- Ingen övergripande garanti för absolut precision för alla språk. Fixture-tröskelvärden gäller per språk på kända fall; kvarvarande verkliga fel är förväntade och förankrade.
- Inget påstående om att overall_green motsvarar produktionsperfekt extraktion för varje repository-idiom
- Inget compliance-certifieringspaket från tredje part som hävdas vara en metodikartefakt på denna yta (se Security för fakta om datahantering, inte compliance-märken)
- Ingen oberoende multivendor-jämförelse med delade korpusar publicerad som ett stående resultatkort
- Sökresultat och analyser förblir best-effort enligt Terms of Service — Maguyva ersätter inte kodgranskning, testning eller säkerhetsgranskningar
7. Hur du verifierar själv
Den avsedda köparrörelsen är fortfarande: indexera en repo du redan förstår, ställ en enda riktig fråga och granska citaten.
- Börja gratis: små representativa repos slår ett helt företags index på dag ett
- Använd MCP-verktyg (intelligent_search, find_symbol, dependency_search) och öppna de citerade sökvägarna
- Läs How It Works för ingestions- och retrieval-arkitekturen
- Läs Compatibility och Language Guides för förmågenivåer, inte bara katalogstorlek
- Läs Security och Privacy för datahantering; den här sidan ersätter inte dem