> methodology.md
我們如何度量
本頁面正是您了解 Maguyva 品質與成本主張依據的地方。這裡只談事實:我們度量什麼、如何評分,以及我們並不假裝已經稽核過的部分。
自 2026 年 7 月 17 日起生效。這裡不會憑空造出任何未經稽核的新基準。目前的各項數值呈現在會從來源資料重新產生的產品介面上;本頁面說明的是度量模型本身。
這是為了方便你閱讀而提供的 AI 輔助翻譯。官方英文版本才具有法律效力——你註冊時所簽署的任何協議,均以英文版本為準。 閱讀官方英文版本
tl;dr — 品質主張建立在夾具發布關卡與多維度的 language-audit 看板之上——而非仰賴單一的「100% 精確率」證明。夾具亮綠燈,並不等於抽取的正確性已經過獨立驗證。成本主張是工作區定價的計算與公開的營運成本透明度,而非第三方競品稽核。
1. 本頁面存在的原因
抱持懷疑的買家,不應該還得去逆向推敲行銷文案。Maguyva 會為程式碼儲存庫建立索引,並在整個網站上呈現精確率、語言涵蓋範圍與成本方面的主張。這些主張需要一個對度量範圍誠實以對的方法論頁面:哪些有夾具佐證,哪些有人工判斷佐證,哪些只是表述方式而非獨立認證。
2. 我們度量什麼
程式碼智慧的品質主要在語言引擎上度量——也就是從原始碼中抽取符號、關係與圖譜——而不是靠主觀的「代理滿意度」評分。
- 分語言的夾具測試套件:處理器必須正確抽取的預期邊與符號
- 發布關卡:唯有當夾具上的精確率、召回率與 F1 達到公布的門檻(夾具上 precision ≥ 0.95、recall ≥ 0.99、F1 ≥ 0.97,並滿足用於統計信賴度的最小邊數)時,語言才會發布
- Language-audit 維度:驗證看板上的準確性、結構完整性、完備性、品質與效能
- 語料庫與抽查循環:依評分標準對從真實儲存庫取樣的邊進行分類(正確、誤報、型別/範圍/中繼資料錯誤)——詳見我們關於 language-grind 的部落格文章
- 產品能力旗標:伺服器所宣告的能力(AST、區域變數、圖譜抽取),與目錄規模彼此獨立
重要: 夾具是針對我們自己撰寫的夾具進行驗證的。綠燈代表已知案例通過了,但並不自動代表現實世界中的每一種寫法都能乾淨俐落地抽取出來。這項區別是刻意為之,也是公開的。
3. 綠燈 vs 獨立驗證
language-audit 看板採用多個維度,因此單一綠燈並不能被解讀為「已證明完美」。看板上的核心數字通常會拆分為:
- overall_green——相對於自身快照夾具及相關語料庫關卡沒有回歸(必要條件,而非充分條件)
- independently_verified——具備較強的判斷訊號,例如抽查種子(其中包含仍存在已判定錯誤的語言)
- verified_clean / 取樣邊上已判定錯誤為零——判定語言中更為嚴格的一個子集
- 策展/判定基準可信度——夾具本身是否被視為可信的判定基準
- structural flags——圖譜抽取與 AST 能力,與是否列入目錄並不等同
行銷層面的語言數量(例如「279+ 種語言」)指的是目錄規模:已設定的語言與伺服器條目。目錄規模並不是 AST 品質的 SLA。相較於單一好看的數字,我們更傾向於分層報告。目前的產品介面請見「相容性」與「語言指南」;詳細的來龍去脈請見部落格上關於語言遞迴式自我改進的文章。
4. 搜尋與檢索品質
語意搜尋的品質是多模態的:文字、AST、圖譜與嵌入相互融合。我們如實記錄經過深思熟慮的工程取捨,而不是宣稱擁有無可匹敵的檢索能力:
- 嵌入使用的是商用模型系列(截至 2026 年 6 月部落格快照時為 voyage-4-large),在做出選型決策時是對照公開的檢索排行榜挑選的
- 向量經過二值量化以節省儲存與成本;這會刻意犧牲一部分檢索精確率,以換取無需獨立向量資料庫、更便宜也更快的漢明搜尋
- 意圖路由與融合權重是經過工程設計的啟發式方法,具有可度量的實際營運效果(例如導入意圖路由後零結果率下降),而不是在客戶語料庫上公開發布的獨立 IR 評測套件
- 部落格文章中都設有「仍不完美之處」的章節——不完美的訊號是記錄的一部分,而不是用來遮掩的註腳
5. 成本主張
Maguyva 上關於成本的表述,談的是定價結構與營運透明度,而不是由第三方認證的正式 TCO 研究。
- 工作區定價:依程式碼儲存庫數量、已索引行數與重建頻率計費——而不是按人頭或代理席次計費。常見問題與方案說明中詳列了各項計費維度。
- 定價頁面上「大約少 10–30 倍」這類比較,是針對典型按席次計價區間的示意性試算,實際取決於你拿哪款按席次收費的工具來比較。它們並不是一套鎖定的、獨立的競品基準包。
- 營運成本上的坦誠:/team 頁面公布了真實的每月軟體支出明細(訂閱、MCP/搜尋工具、隨用量變化的成本)。這是「零號客戶」式的透明度,而不是經過稽核的財務報表。
- 嵌入與基礎設施成本是我們認可的產品成本(進階嵌入、儲存、圖譜重建)。我們是刻意為此買單的,並在 voyage-4-large 的文章與定價說明中如實說明。
6. 我們不主張什麼
本頁面同時也是一份「非主張」清單。如果某項內容沒有出現在度量看板上,就不要把行銷口吻當作證據。
- 我們不為每一種語言提供籠統的絕對精確率保證。夾具門檻是針對已知案例、按語言逐一適用的;現實世界中殘留的錯誤是預料之中的,也是我們明講的。
- 我們不主張 overall_green 就等於對每一種儲存庫寫法都能做到生產環境級完美抽取
- 我們不會在本頁面上把任何第三方合規認證套件當作方法論成果來宣稱(資料處理相關事實請見「安全」頁面,那裡沒有合規徽章)
- 我們沒有把使用共享語料庫的獨立多廠商橫向評測,當作一份常設計分卡對外發布
- 搜尋結果與分析在《服務條款》下仍屬盡力而為——Maguyva 無法取代程式碼審查、測試或安全稽核
7. 如何自行驗證
我們建議的買家操作路徑始終是:為一個你已經熟悉的儲存庫建立索引,提出一個真實的問題,然後檢查引用出處。
- 免費開始:第一天,有代表性的小型儲存庫勝過整間公司的索引
- 使用 MCP 工具(intelligent_search、find_symbol、dependency_search),並開啟被引用的路徑
- 關於資料擷取與檢索架構,請閱讀「運作原理」(How It Works)
- 關於能力分層(而不僅是目錄規模),請閱讀「相容性」與「語言指南」
- 關於資料處理,請閱讀「安全」與「隱私」;本頁面並不能取代它們