> methodology.md
Hvordan vi måler
Denne siden er bokstavelig talt stedet for å lese hvordan kvalitets- og kostnadspåstandene om Maguyva er forankret. Den er rene fakta: hva vi måler, hvordan vi poengsetter det, og hva vi ikke later som vi har revidert.
Gjelder fra 17. juli 2026. Ingen nye ureviderte benchmarks blir diktet opp her. Gjeldende tall finnes på produktflater som regenereres fra kildedata; denne siden forklarer målemodellen.
Dette er en AI-assistert oversettelse gitt for din bekvemmelighet. Den offisielle engelske versjonen er den eneste bindende — enhver avtale du inngår når du registrerer deg, styres av den engelske teksten. Les den offisielle engelske versjonen
tl;dr — Kvalitetspåstander hviler på fixture release gates og flerdimensjonale language-audit-tavler — ikke på ett enkelt bevis for “100 % presisjon.” Grønt på fixtures er ikke det samme som uavhengig verifisert, korrekt ekstraksjon. Kostnadspåstander er workspace-prisingsmatematikk og offentlig transparens om driftskostnader, ingen uavhengig konkurranserevisjon fra tredjepart.
1. Hvorfor denne siden finnes
Skeptiske kjøpere skal ikke måtte reverse-engineere markedsføringstekst. Maguyva indekserer repositories og viser presisjons-, språkdeknings- og kostnadspåstander på hele siden. Disse påstandene trenger en metodikkflate som er ærlig om måleomfanget: hva som er fixture-belagt, hva som er vurderingsbelagt, og hva som er framing fremfor uavhengig sertifisering.
2. Hva vi måler
Kvaliteten på kodeintelligens måles primært på language engine — ekstraksjon av symboler, relasjoner og grafer fra kilden — ikke på subjektive “agent happiness”-poeng.
- Fixture-suiter per språk: forventede edges og symboler som handleren må ekstrahere korrekt
- Release gates: språk lanseres først når fixture-presisjon, recall og F1 når publiserte terskelverdier (presisjon ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 på fixtures, med et minimumsantall edges for statistisk pålitelighet)
- Language-audit-dimensjoner: nøyaktighet, strukturell integritet, fullstendighet, kvalitet og ytelse på valideringstavlen
- Korpus- og stikkprøveløkker: samplede edges fra ekte repositories, klassifisert etter rubrikk (korrekt, falsk positiv, type-/omfangs-/metadatafeil) — beskrevet i våre language-grind-blogginnlegg
- Product capability flags: hva serveren annonserer (AST, locals, grafekstraksjon) atskilt fra katalogstørrelse
Viktig: Fixtures valideres mot fixtures vi selv har skrevet. GRØNT betyr at de kjente tilfellene består. Det betyr ikke automatisk at hvert idiom fra den virkelige verden ekstraheres feilfritt. Det skillet er bevisst og offentlig.
3. Grønt versus uavhengig verifisert
Language-audit-tavlen bruker flere akser, slik at ett enkelt grønt lys ikke kan leses som “bevist perfekt.” Hovedtallene på tavlen er vanligvis delt opp:
- overall_green — regresjonsrent mot self-snapshot-fixtures og relaterte corpus gates (nødvendig, ikke tilstrekkelig)
- independently_verified — har et sterkt vurderingssignal, for eksempel et spot-check-seed (inkluderer språk som fortsatt viser vurderte feil)
- verified_clean / null vurderte feil på samplede edges — en strengere delmengde av vurderte språk
- curation / oracle trust — om fixtures selv behandles som pålitelige oracles
- structural flags — grafekstraksjon og AST-kapabilitet er ikke identisk med katalogmedlemskap
Markedsføringens språktall (for eksempel “279+ språk”) er katalogstørrelse: konfigurerte språk og serveroppføringer. Katalogstørrelse er ikke en AST-kvalitets-SLA. Vi foretrekker nivådelt rapportering fremfor ett enkelt skrytetall. For den nåværende produktflaten, se Compatibility og Language Guides; for narrativ detalj, se innlegget om språkenes rekursive selvforbedring på bloggen.
4. Kvalitet på søk og retrieval
Kvaliteten på semantisk søk er multimodal: tekst, AST, graf og embeddings smeltes sammen. Vi dokumenterer bevisste ingeniøravveininger fremfor å hevde uslåelig retrieval:
- Embeddings bruker en kommersiell modellfamilie (voyage-4-large per blogg-øyeblikksbildet fra juni 2026), valgt mot offentlige retrieval-topplister på beslutningstidspunktet
- Vektorer er binært kvantisert for lagring og kostnad; det bytter bevisst bort noe retrieval-presisjon mot billigere, raskere Hamming-søk uten en separat vektordatabase
- Intent routing og fusion weights er konstruerte heuristikker med målte operasjonelle effekter (for eksempel lavere andel nullresultater etter intent routing), ikke en publisert uavhengig IR-evalueringssuite på kundekorpus
- Blogginnlegg inkluderer avsnitt om “hva som fortsatt er ufullstendig” — ufullstendige signaler er en del av protokollen, ikke fotnoter som skjules
5. Kostnadspåstander
Kostnadsspråket hos Maguyva handler om prisstruktur og driftstransparens, ikke en formell TCO-studie sertifisert av tredjepart.
- Workspace-prising: faktureres etter repositories, indekserte linjer og ombyggingsfrekvens — ikke per menneskelig plass eller agentplass. FAQ og planomtaler forklarer dimensjonene.
- “Omtrent 10–30x mindre”-sammenligninger på Pricing er illustrativ matematikk mot typiske per-plass-intervaller, avhengig av hvilket per-plass-priset verktøy du sammenligner med. Det er ingen låst, uavhengig konkurransebenchmark-pakke.
- Ærlighet om driftskostnader: /team-siden publiserer en reell månedlig oversikt over programvarekostnader (abonnementer, MCP-/søkeverktøy, bruksbaserte kostnader). Det er customer-zero-transparens, ikke et revidert regnskap.
- Embedding- og infrakostnader er aksepterte produktkostnader (premium-embeddings, lagring, grafombygginger). Vi betaler dem med hensikt og sier det i voyage-4-large-innlegget og prisingsfortellingen.
6. Hva vi ikke påstår
Denne siden er også en liste over ikke-påstander. Hvis noe ikke er på måletavlen, ikke behandle markedsføringstonen som bevis.
- Ingen generell garanti for absolutt presisjon for alle språk. Fixture-terskler gjelder per språk på kjente tilfeller; gjenværende feil fra den virkelige verden er forventet og forankret.
- Ingen påstand om at overall_green tilsvarer produksjonsperfekt ekstraksjon for hvert repository-idiom
- Ingen compliance-sertifiseringspakke fra tredjepart som hevdes å være et metodikkartefakt på denne flaten (se Security for fakta om datahåndtering, ikke compliance-merker)
- Ingen uavhengig multivendor-sammenligning med delte korpus publisert som et stående resultatkort
- Søkeresultater og analyser forblir best-effort under Terms of Service — Maguyva er ikke en erstatning for kodegjennomgang, testing eller sikkerhetsrevisjoner
7. Hvordan du verifiserer selv
Den tiltenkte kjøperbevegelsen er fortsatt: indekser en repo du allerede forstår, still ett ekte spørsmål, og inspiser sitatene.
- Start gratis: små representative repos slår en hel bedrifts indeks på dag én
- Bruk MCP-verktøy (intelligent_search, find_symbol, dependency_search) og åpne de siterte stiene
- Les How It Works for ingestion- og retrieval-arkitekturen
- Les Compatibility og Language Guides for kapabilitetsnivåer, ikke bare katalogstørrelse
- Les Security og Privacy for datahåndtering; denne siden erstatter dem ikke