> methodology.md
Sådan måler vi
Denne side er bogstaveligt talt stedet at læse om, hvordan kvalitets- og omkostningspåstandene om Maguyva er forankrede. Det er rene fakta: hvad vi måler, hvordan vi scorer det, og hvad vi ikke lader som om vi har revideret.
Gældende fra 17. juli 2026. Der opfindes ingen nye urevisionerede benchmarks her. Aktuelle tal findes på produktoverflader, der regenereres fra kildedata; denne side forklarer målemodellen.
Dette er en AI-understøttet oversættelse leveret som en bekvemmelighed. Den officielle engelske version er den eneste bindende — enhver aftale, du indgår ved tilmelding, er underlagt den engelske tekst. Læs den officielle engelske version
tl;dr — Kvalitetspåstande hviler på fixture release gates og flerdimensionelle language-audit-tavler — ikke på ét enkelt bevis for “100 % præcision.” Grønt på fixtures er ikke det samme som uafhængigt verificeret, korrekt ekstraktion. Omkostningspåstande er workspace-prisfastsættelsesmatematik og offentlig transparens om driftsomkostninger, ingen uafhængig konkurrencerevision fra tredjepart.
1. Hvorfor denne side findes
Skeptiske købere bør ikke skulle reverse-engineere marketingtekst. Maguyva indekserer repositories og viser præcisions-, sprogdæknings- og omkostningspåstande på tværs af siden. Disse påstande kræver en metodologioverflade, der er ærlig om måleomfanget: hvad der er fixture-baseret, hvad der er vurderingsbaseret, og hvad der er framing frem for uafhængig certificering.
2. Hvad vi måler
Kvaliteten af kodeintelligens måles primært på language engine — ekstraktion af symboler, relationer og grafer fra kilden — ikke på subjektive “agent happiness”-scorer.
- Fixture-sæt pr. sprog: forventede edges og symboler, som handleren skal ekstrahere korrekt
- Release gates: sprog udgives kun, når fixture-præcision, recall og F1 når de publicerede tærskelværdier (præcision ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 på fixtures, med et minimumsantal edges for statistisk pålidelighed)
- Language-audit-dimensioner: nøjagtighed, strukturel integritet, fuldstændighed, kvalitet og ydeevne på valideringstavlen
- Korpus- og stikprøveløkker: samplede edges fra rigtige repositories, klassificeret efter rubrik (korrekt, falsk positiv, type-/scope-/metadatafejl) — beskrevet i vores language-grind-blogindlæg
- Product capability flags: hvad serveren annoncerer (AST, locals, grafekstraktion) adskilt fra katalogstørrelse
Vigtigt: Fixtures valideres mod fixtures, vi selv har skrevet. GRØN betyder, at de kendte tilfælde består. Det betyder ikke automatisk, at hvert idiom fra den virkelige verden ekstraheres fejlfrit. Den skelnen er bevidst og offentlig.
3. Grøn versus uafhængigt verificeret
Language-audit-tavlen bruger flere akser, så et enkelt grønt lys ikke kan læses som “bevist perfekt.” Hovedtallene på tavlen er typisk opdelt:
- overall_green — regressionsrent mod self-snapshot-fixtures og relaterede corpus gates (nødvendigt, ikke tilstrækkeligt)
- independently_verified — har et stærkt vurderingssignal, f.eks. et spot-check-seed (inkluderer sprog, der stadig viser vurderede fejl)
- verified_clean / nul vurderede fejl på samplede edges — en strengere delmængde af vurderede sprog
- curation / oracle trust — om fixtures selv behandles som pålidelige oracles
- structural flags — grafekstraktion og AST-kapabilitet er ikke identisk med katalogmedlemskab
Marketingens sprogantal (f.eks. “279+ sprog”) er katalogstørrelse: konfigurerede sprog og serverposter. Katalogstørrelse er ikke en AST-kvalitets-SLA. Vi foretrækker lagdelt rapportering frem for ét enkelt pralende tal. For den nuværende produktoverflade, se Compatibility og Language Guides; for narrativ detalje, se blogindlægget om sprogenes rekursive selvforbedring.
4. Kvalitet af søgning og retrieval
Kvaliteten af semantisk søgning er multimodal: tekst, AST, graf og embeddings smeltes sammen. Vi dokumenterer bevidste ingeniørafvejninger frem for at hævde uovervindelig retrieval:
- Embeddings bruger en kommerciel modelfamilie (voyage-4-large ifølge blog-øjebliksbilledet fra juni 2026), valgt op imod offentlige retrieval-ranglister på beslutningstidspunktet
- Vektorer er binært kvantiserede af hensyn til lagring og omkostninger; det bytter bevidst noget retrieval-præcision for billigere, hurtigere Hamming-søgning uden en separat vektordatabase
- Intent routing og fusion weights er konstruerede heuristikker med målte operationelle effekter (f.eks. lavere andel af nulresultater efter intent routing), ikke en publiceret uafhængig IR-evalueringssuite på kundekorpusser
- Blogindlæg indeholder afsnit om “hvad der stadig er ufuldstændigt” — ufuldstændige signaler er en del af protokollen, ikke fodnoter, der skjules
5. Omkostningspåstande
Omkostningssproget hos Maguyva handler om prisstruktur og driftstransparens, ikke en formel TCO-undersøgelse certificeret af en tredjepart.
- Workspace-prisfastsættelse: faktureres efter repositories, indekserede linjer og genopbygningsfrekvens — ikke pr. menneskelig plads eller agentplads. FAQ og plantekst forklarer dimensionerne.
- “Cirka 10-30x mindre”-sammenligninger på Pricing er illustrativ matematik mod typiske per-plads-intervaller, afhængigt af hvilket per-plads-prissat værktøj du sammenligner med. Det er ingen fastlåst, uafhængig konkurrencebenchmark-pakke.
- Ærlighed om driftsomkostninger: /team-siden offentliggør en reel månedlig opgørelse af softwareomkostninger (abonnementer, MCP-/søgeværktøj, brugsbaserede omkostninger). Det er customer-zero-transparens, ikke et revideret regnskab.
- Embedding- og infraomkostninger er accepterede produktomkostninger (premium-embeddings, lagring, grafgenopbygninger). Vi betaler dem med vilje og siger det i voyage-4-large-indlægget og prisfastsættelsesfortællingen.
6. Hvad vi ikke påstår
Denne side er også en liste over ikke-påstande. Hvis noget ikke er på måletavlen, så behandl ikke marketingtonen som bevis.
- Ingen generel garanti for absolut præcision for alle sprog. Fixture-tærskler gælder pr. sprog på kendte tilfælde; resterende fejl fra den virkelige verden er forventede og forankrede.
- Ingen påstand om, at overall_green svarer til produktionsperfekt ekstraktion for hvert repository-idiom
- Ingen compliance-certificeringspakke fra en tredjepart, der hævdes at være et metodologisk artefakt på denne overflade (se Security for fakta om datahåndtering, ikke compliance-mærker)
- Ingen uafhængig multivendor-sammenligning med delte korpusser offentliggjort som et stående scorecard
- Søgeresultater og analyser forbliver best-effort under Terms of Service — Maguyva er ikke en erstatning for kodegennemgang, test eller sikkerhedsrevisioner
7. Sådan verificerer du selv
Den tiltænkte købsadfærd er stadig: indekser en repo, du allerede forstår, stil ét rigtigt spørgsmål, og undersøg citaterne.
- Start gratis: små repræsentative repos slår et helt firmas indeks på dag ét
- Brug MCP-værktøjer (intelligent_search, find_symbol, dependency_search), og åbn de citerede stier
- Læs How It Works for ingestion- og retrieval-arkitekturen
- Læs Compatibility og Language Guides for kapabilitetsniveauer, ikke kun katalogstørrelse
- Læs Security og Privacy for datahåndtering; denne side erstatter dem ikke