> methodology.md
Paano kami sumusukat
Ito ang literal na lugar para basahin kung paano naka-ground ang quality at cost claims ng Maguyva. Facts-only ito: ano ang sinusukat namin, paano namin ito sino-score, at kung ano ang hindi namin pinapanggap na na-audit.
May bisa simula Hulyo 17, 2026. Walang bagong unaudited benchmark na ginawa dito. Ang kasalukuyang mga bilang ay nasa product surfaces na nag-re-regenerate mula sa source data; ipinapaliwanag ng page na ito ang measurement model.
Ito ay AI-assisted na pagsasalin na ibinigay para sa iyong kaginhawaan. Ang opisyal na English na bersyon lang ang binding — anumang kasunduan kapag nag-sign up ka ay pinamamahalaan ng English na teksto. Basahin ang opisyal na English na bersyon
tl;dr — Ang mga pahayag tungkol sa kalidad ay nakasalalay sa mga fixture release gate at sa maraming dimensiyon ng language-audit — hindi sa iisang patunay ng “100% precision.” Ang pagiging green sa fixtures ay hindi katumbas ng hiwalay na napatunayang tamang extraction. Ang mga pahayag tungkol sa gastos ay matematika ng workspace pricing at pampublikong transparensiya sa operasyon, hindi audit ng kakumpitensiya mula sa third party.
1. Bakit Umiiral ang Page na Ito
Hindi dapat kailanganin ng mga skeptical na buyer na i-reverse-engineer ang marketing copy. Nag-i-index ang Maguyva ng mga repository at nagpapakita ng precision, language coverage, at cost claims sa buong site. Kailangan ng mga claim na iyon ng methodology surface na tapat tungkol sa measurement scope: ano ang fixture-backed, ano ang judgment-backed, at ano ang framing lamang kaysa independent certification.
2. Ano ang Sinusukat Namin
Ang quality ng code intelligence ay pangunahing sinusukat sa language engine — extraction ng mga symbol, relationship, at graph mula sa source — hindi sa subjective na “agent happiness” score.
- Per-language fixture suite: mga inaasahang edge at symbol na kailangang tama ang extraction ng handler
- Release gates: nagsi-ship lang ang mga wika kapag naabot ng fixture precision, recall, at F1 ang mga naka-publish na threshold (precision ≥ 0.95, recall ≥ 0.99, F1 ≥ 0.97 sa fixtures, na may minimum edge count para sa statistical confidence)
- Mga dimensiyon ng language-audit: katumpakan, integridad ng estruktura, pagkakumpleto, kalidad, at performance sa validation board
- Corpus at spot-check loops: mga sampled na edge mula sa totoong repository na classified ayon sa pamantayan (tama, maling positibo, o error sa uri, saklaw, o metadata) — inilarawan sa aming mga language-grind blog post
- Product capability flags: kung ano ang ina-advertise ng server (AST, locals, graph extraction) na hiwalay sa laki ng catalog
Mahalaga: Nagva-validate ang mga fixture laban sa mga fixture na isinulat namin. Ang ibig sabihin ng GREEN ay pumasa ang mga kilalang case. Hindi ito otomatikong nangangahulugang malinis na na-extract ang bawat real-world idiom. Sinasadya at pampubliko ang pagkakaibang ito.
3. Green kumpara sa Independently Verified
Gumagamit ang language-audit board ng maraming axis kaya hindi maaaring basahin ang iisang green light bilang “proven perfect.” Karaniwang nahahati ang mga headline number sa board:
- overall_green — regression-clean laban sa self-snapshot fixtures at related corpus gates (kailangan, pero hindi sapat)
- independently_verified — may malakas na judgment signal tulad ng spot-check seed (kasama ang mga wikang may judged error pa rin)
- verified_clean / zero judged error sa sampled edges — mas mahigpit na subset ng mga judged na wika
- curation / oracle trust — kung ang mga fixture mismo ay tinuturing na trusted oracle
- structural flags — hindi pareho ang graph extraction at AST capability sa catalog membership
Ang language count sa marketing (halimbawa, “279+ languages”) ay catalog size: configured na mga wika at server entries. Hindi AST quality SLA ang catalog size. Mas pinipili ang tiered reporting kaysa iisang vanity headcount. Para sa kasalukuyang product surface, tingnan ang Compatibility at Language Guides; para sa narrative detail, tingnan ang language recursive self-improvement post sa blog.
4. Kalidad ng Search at Retrieval
Multi-modal ang quality ng semantic search: pinagsasama ang text, AST, graph, at embeddings. Dini-document namin ang mga sinadyang engineering trade-off sa halip na mag-claim ng unbeatable retrieval:
- Gumagamit ang embeddings ng komersiyal na pamilya ng modelo (voyage-4-large ayon sa blog snapshot noong Hunyo 2026) na pinili laban sa public retrieval leaderboard noong panahon ng desisyon
- Binary-quantized ang mga vector para sa storage at cost; sinadyang ipinagpalit nito ang ibang retrieval precision para sa mas mura, mas mabilis na Hamming search nang walang hiwalay na vector database
- Ang intent routing at fusion weights ay engineered heuristics na may measured operational effect (halimbawa, mas mababang zero-result rate pagkatapos ng intent routing), hindi published independent IR evaluation suite sa customer corpora
- May “what's still imperfect” section ang mga blog post — bahagi ng record ang mga imperfect signal, hindi footnote na itinatago
5. Mga Cost Claim
Ang cost language sa Maguyva ay tungkol sa pricing structure at operating transparency, hindi formal na TCO study na certified ng third party.
- Workspace pricing: sinisingil ayon sa repositories, indexed lines, at rebuild frequency — hindi per human o agent seat. Ipinapaliwanag ng FAQ at plan copy ang mga dimension.
- “Roughly 10–30x less” na istilong comparison sa Pricing ay illustrative math laban sa typical na per-seat range, depende sa kung aling seat-priced na tool ang ikinukumpara mo. Hindi ito locked independent competitive benchmark package.
- Katapatan sa gastos sa operasyon: naglalathala ang /team page ng totoong aktuwal na buwanang hati ng gastos sa software (mga subscription, MCP at search tooling, at gastos na nagbabago ayon sa paggamit). Transparensiya mula sa unang customer ito, hindi pahayag sa pananalapi na dumaan sa audit.
- Ang embedding at infra cost ay accepted product cost (premium embeddings, storage, graph rebuilds). Binabayaran namin ito nang sinasadya at sinasabi ito sa voyage-4-large post at pricing narrative.
6. Ano ang Hindi Namin Sinasabing Claim
Listahan din ng non-claims ang page na ito. Kung wala ang isang bagay sa measurement board, huwag ituring na patunay ang marketing tone.
- Walang blanket absolute-precision guarantee para sa bawat wika. Naaangkop ang fixture threshold per wika sa mga kilalang case; inaasahan ang residual real-world error at ito ay naka-ground.
- Walang claim na ang overall_green ay katumbas ng production-perfect extraction para sa bawat repository idiom
- Walang third-party compliance certification package na inaangkin bilang methodology artifact sa surface na ito (tingnan ang Security para sa data-handling facts, hindi compliance badge)
- Walang independent multi-vendor bake-off na may shared corpora na naka-publish bilang standing scorecard
- Nananatiling best-effort ang mga search result at analysis sa ilalim ng Terms of Service — hindi kapalit ng Maguyva ang code review, testing, o security audit
7. Paano Ka Makaka-verify Mag-isa
Ganito pa rin ang inaasahang galaw ng buyer: mag-index ng repo na naiintindihan mo na, magtanong ng isang totoong tanong, at suriin ang mga citation.
- Magsimula nang libre: mas mainam ang maliliit na representative na repo kaysa buong-company index sa unang araw
- Gamitin ang mga MCP tool (intelligent_search, find_symbol, dependency_search) at buksan ang mga cited path
- Basahin ang How It Works para sa ingestion at retrieval architecture
- Basahin ang Compatibility at Language Guides para sa capability tier, hindi lang catalog size
- Basahin ang Security at Privacy para sa data handling; hindi papalit ang page na ito sa kanila