> methodology.md
我们如何度量
本页面正是您了解 Maguyva 质量与成本主张依据的地方。这里只讲事实:我们度量什么、如何评分,以及我们并不假装已经审计过的部分。
自 2026 年 7 月 17 日起生效。这里不会凭空造出任何未经审计的新基准。当前的各项数值展示在从源数据重新生成的产品界面上;本页面解释的是度量模型本身。
本翻译由 AI 辅助生成,仅为方便阅读之用。官方英文版本才是唯一具有法律约束力的版本——你在注册时所达成的任何协议,均以英文文本为准。 阅读官方英文版本
tl;dr — 质量主张建立在夹具发布门禁和多维度的 language-audit 看板之上——而非依赖单一的“100% 精确率”证明。夹具亮绿灯,并不等于抽取的正确性已经过独立验证。成本主张是工作区定价的计算和公开的运营成本透明度,而非第三方竞品审计。
1. 本页面存在的原因
持怀疑态度的买家,不应该还得去逆向推敲营销文案。Maguyva 会为代码仓库建立索引,并在整个网站上呈现精确率、语言覆盖范围和成本方面的主张。这些主张需要一个对度量范围诚实以待的方法论页面:哪些有夹具支撑,哪些有人工判断支撑,哪些只是表述方式而非独立认证。
2. 我们度量什么
代码智能的质量主要在语言引擎上度量——即从源代码中抽取符号、关系和图谱——而不是靠主观的“agent 满意度”评分。
- 分语言的夹具测试套件:处理器必须正确抽取的预期边和符号
- 发布门禁:只有当夹具上的精确率、召回率和 F1 达到公布的阈值(夹具上 precision ≥ 0.95、recall ≥ 0.99、F1 ≥ 0.97,并满足用于统计置信度的最小边数)时,语言才会发布
- Language-audit 维度:验证看板上的准确性、结构完整性、完备性、质量和性能
- 语料库与抽检循环:按评分标准对从真实仓库采样的边进行分类(正确、误报、类型/作用域/元数据错误)——详见我们关于 language-grind 的博客文章
- 产品能力标志:服务器所声明的能力(AST、局部变量、图谱抽取)与目录规模相互独立
重要: 夹具是针对我们自己编写的夹具进行验证的。绿灯意味着已知用例通过了,但并不自动意味着现实世界中的每一种写法都能干净利落地抽取出来。这一区别是刻意为之的,也是公开的。
3. 绿灯 vs 独立验证
language-audit 看板采用多个维度,因此单个绿灯并不能被解读为“已证明完美”。看板上的核心数字通常会拆分为:
- overall_green——相对于自身快照夹具及相关语料库门禁没有回归(必要条件,而非充分条件)
- independently_verified——具备较强的判断信号,例如抽检种子(其中包含仍存在已判定错误的语言)
- verified_clean / 采样边上已判定错误为零——判定语言中更为严格的一个子集
- 整理质量/评判基准可信度——夹具本身是否被当作可信的评判基准
- structural flags——图谱抽取和 AST 能力,与是否列入目录并不等同
营销层面的语言数量(例如“279+ 种语言”)指的是目录规模:已配置的语言和服务器条目。目录规模并不是 AST 质量的 SLA。相比单一好看的数字,我们更倾向于分层报告。当前的产品界面请见“兼容性”和“语言指南”;详细的来龙去脉请见博客上关于语言递归式自我改进的文章。
4. 搜索与检索质量
语义搜索的质量是多模态的:文本、AST、图谱和嵌入相互融合。我们如实记录经过深思熟虑的工程取舍,而不是宣称拥有无可匹敌的检索能力:
- 嵌入使用的是商用模型系列(截至 2026 年 6 月博客快照时为 voyage-4-large),在做出选型决策时是对照公开的检索排行榜挑选的
- 向量经过二值量化以节省存储和成本;这会刻意牺牲一部分检索精确率,以换取无需独立向量数据库、更便宜也更快的汉明搜索
- 意图路由和融合权重是经过工程设计的启发式方法,具有可度量的实际运营效果(例如引入意图路由后零结果率下降),而不是在客户语料库上公开发布的独立 IR 评测套件
- 博客文章中都设有“仍不完美之处”的章节——不完美的信号是记录的一部分,而不是用来遮掩的脚注
5. 成本主张
Maguyva 上关于成本的表述,讲的是定价结构和运营透明度,而不是由第三方认证的正式 TCO 研究。
- 工作区定价:按代码仓库数量、已索引行数和重建频率计费——而不是按人头或 agent 席位计费。常见问题和套餐说明中详列了各项计费维度。
- 定价页面上“大约少 10–30 倍”这类比较,是针对典型按席位计价区间的示意性测算,具体取决于你拿哪款按席位收费的工具来比较。它们并不是一套锁定的、独立的竞品基准包。
- 运营成本上的坦诚:/team 页面公布了真实的每月软件开支明细(订阅、MCP/搜索工具、随用量变化的成本)。这是“零号客户”式的透明度,而不是经过审计的财务报表。
- 嵌入和基础设施成本是我们认可的产品成本(高级嵌入、存储、图谱重建)。我们是有意为此买单的,并在 voyage-4-large 的文章和定价说明中如实说明。
6. 我们不主张什么
本页面同时也是一份“非主张”清单。如果某项内容没有出现在度量看板上,就不要把营销口吻当作证据。
- 我们不为每一种语言提供笼统的绝对精确率保证。夹具阈值是针对已知用例、按语言逐一适用的;现实世界中残留的错误是预料之中的,也是我们明说的。
- 我们不主张 overall_green 就等于对每一种仓库写法都能做到生产环境级完美抽取
- 我们不会在本页面上把任何第三方合规认证套件当作方法论成果来宣称(数据处理相关事实请见“安全”页面,那里没有合规徽章)
- 我们没有把使用共享语料库的独立多厂商横向评测,作为一份常设记分卡对外发布
- 搜索结果和分析在《服务条款》下仍属尽力而为——Maguyva 不能替代代码审查、测试或安全审计
7. 如何自行验证
我们建议的买家操作路径始终是:为一个你已经熟悉的仓库建立索引,提出一个真实的问题,然后检查引用出处。
- 免费开始:第一天,有代表性的小型仓库胜过整个公司的索引
- 使用 MCP 工具(intelligent_search、find_symbol、dependency_search),并打开被引用的路径
- 关于数据摄取和检索架构,请阅读“运作原理”(How It Works)
- 关于能力分层(而不仅仅是目录规模),请阅读“兼容性”和“语言指南”
- 关于数据处理,请阅读“安全”和“隐私”;本页面并不能取代它们