> methodology.md
計測の仕組み
このページは、Maguyva の品質とコストに関する主張がどのように裏付けられているかを実際に確認できる場所です。掲載するのは事実のみ:何を計測し、どう評価し、そして監査済みだと偽らない範囲を明記します。
2026年7月17日発効。ここで新たに未監査のベンチマークを作り出すことはありません。最新の数値は、ソースデータから再生成されるプロダクト上に掲載されています。本ページでは、その計測モデルについて説明します。
これは利便性のために提供されるAI翻訳版です。拘束力を持つのは公式の英語版のみであり、サインアップ時に成立する契約は英語の本文に準拠します。 公式の英語版を読む
tl;dr — 品質に関する主張は、フィクスチャのリリースゲートと多次元の language-audit ボードに基づいており、「精度100%」という単一の証明に頼るものではありません。フィクスチャがグリーンであることは、抽出の正しさが独立して検証されたことと同じではありません。コストに関する主張は、ワークスペースの料金計算と公開された運用コストの透明性であり、第三者による競合監査ではありません。
1. このページが存在する理由
懐疑的な購入検討者が、マーケティングコピーをリバースエンジニアリングする必要はあってはなりません。Maguyva はリポジトリをインデックス化し、精度、言語カバレッジ、コストに関する主張をサイト全体で提示しています。こうした主張には、計測範囲について正直に示す方法論のページが必要です。すなわち、何がフィクスチャに裏付けられ、何が判断に裏付けられ、そして何が独立した認証ではなく単なる見せ方にすぎないのか、という点です。
2. 何を計測するか
コードインテリジェンスの品質は、主に言語エンジン、すなわちソースからのシンボル・関係・グラフの抽出によって計測します。主観的な「エージェントの満足度」スコアで測るものではありません。
- 言語ごとのフィクスチャスイート:ハンドラーが正しく抽出すべきエッジとシンボルを定義したもの
- リリースゲート:フィクスチャでの精度・再現率・F1 が公開されたしきい値(フィクスチャ上で precision ≥ 0.95、recall ≥ 0.99、F1 ≥ 0.97、かつ統計的信頼性のための最小エッジ数)を満たした言語のみが提供されます
- Language-audit の評価軸:検証ボード上での正確性、構造的整合性、網羅性、品質、パフォーマンス
- コーパスおよびスポットチェックのループ:実リポジトリからサンプリングしたエッジをルーブリックに従って分類(正しい/偽陽性/型・スコープ・メタデータの誤り)。詳細は language-grind に関するブログ記事で説明しています
- プロダクトの機能フラグ:サーバーが公表する機能(AST、ローカル変数、グラフ抽出)を、カタログの規模とは切り離して示すもの
重要: フィクスチャは、私たちが書いたフィクスチャに対して検証を行います。グリーンとは既知のケースが通過したことを意味します。現実世界のあらゆる書き方が完璧に抽出できることを自動的に意味するわけではありません。この区別は意図的であり、公開しています。
3. グリーン vs 独立検証済み
language-audit ボードは複数の評価軸を用いるため、単一のグリーンをもって「完璧が証明された」と読むことはできません。ボード上の主要な数値は、通常次のように分けられます:
- overall_green — 自己スナップショットのフィクスチャおよび関連するコーパスゲートに対してリグレッションがない状態(必要条件であって十分条件ではない)
- independently_verified — スポットチェックのシードなど、強い判断シグナルを備えた状態(判定済みの誤りがまだ残る言語も含む)
- verified_clean/サンプリングしたエッジで判定済みの誤りがゼロ — 判定対象言語のうち、より厳しい部分集合
- curation/oracle trust — フィクスチャ自体を信頼できるオラクルとして扱うかどうか
- structural flags — グラフ抽出や AST の対応状況は、カタログへの登録とは同一ではない
マーケティング上の言語数(例:「279以上の言語」)はカタログの規模、つまり設定済みの言語とサーバーエントリの数です。カタログの規模は AST の品質 SLA ではありません。単一の見栄えのよい数値よりも、段階的なレポートを重視してください。現在のプロダクトの状況については互換性ページと言語ガイドを、詳しい経緯についてはブログの「言語の再帰的自己改善」に関する記事をご覧ください。
4. 検索と情報取得の品質
セマンティック検索の品質はマルチモーダルです。テキスト、AST、グラフ、埋め込みを融合させています。私たちは無敵の情報取得を主張するのではなく、意図的なエンジニアリング上のトレードオフを明文化します:
- 埋め込みには商用モデルファミリー(2026年6月のブログ時点では voyage-4-large)を使用しており、これは意思決定時点で公開されている情報取得リーダーボードを基に選定したものです
- ベクトルはストレージとコストのためにバイナリ量子化されています。これは、専用のベクトルデータベースなしで、より安価かつ高速なハミング検索を実現するために、情報取得の精度を意図的に一部犠牲にするものです
- インテントルーティングと融合の重み付けは、運用上の効果を計測したエンジニアリング上のヒューリスティック(例:インテントルーティング導入後のゼロ件ヒット率の低下)であり、顧客のコーパスに対する公開された独立の IR 評価スイートではありません
- ブログ記事には「まだ不完全な点」というセクションを設けています。不完全なシグナルは隠すための脚注ではなく、記録の一部です
5. コストに関する主張
Maguyva におけるコストに関する記述は、料金体系と運用の透明性についてのものであり、第三者によって認証された正式な TCO 調査ではありません。
- ワークスペースの料金:リポジトリ数、インデックス化した行数、再構築の頻度に基づいて課金され、人単位やエージェント単位の席数では課金されません。FAQ とプラン説明に各項目を明記しています。
- 料金ページにある「およそ10〜30分の1」といった比較は、比較対象となる席課金型ツールに応じた、一般的な席単価の範囲に対する例示的な試算です。確定した独立の競合ベンチマークパッケージではありません。
- 運用コストの正直さ:/team ページでは、実際の月間ソフトウェア支出の内訳(サブスクリプション、MCP・検索ツール、利用量に応じたコスト)を公開しています。これは「顧客ゼロ号」としての透明性であり、監査済みの財務諸表ではありません。
- 埋め込みとインフラのコストは、受け入れているプロダクトコストです(プレミアムな埋め込み、ストレージ、グラフの再構築)。私たちはこれらを意図的に負担しており、その旨を voyage-4-large の記事と料金の説明で述べています。
6. 主張しないこと
このページは、主張しないことのリストでもあります。計測ボードに載っていないものについては、マーケティング上の言い回しを証拠として扱わないでください。
- すべての言語に対する一律の絶対精度保証はありません。フィクスチャのしきい値は既知のケースについて言語ごとに適用されるものであり、現実世界に残る誤りは想定済みであり、かつ明示しています。
- overall_green が、あらゆるリポジトリの書き方に対して本番環境で完璧な抽出を意味する、とは主張しません
- 第三者によるコンプライアンス認証パッケージを、このページ上で方法論の成果物として主張することはありません(データ取り扱いの事実についてはセキュリティのページを参照してください。コンプライアンスのバッジではありません)
- 共有コーパスを用いた独立の複数ベンダー比較テストを、常設のスコアカードとして公開することはしていません
- 検索結果と分析は、利用規約のもとでベストエフォートにとどまります。Maguyva は、コードレビュー、テスト、セキュリティ監査の代わりにはなりません
7. 自分で検証する方法
想定している購入検討者の進め方は変わりません。すでに理解しているリポジトリをインデックス化し、実際の質問を1つ投げかけ、引用(出典)を確認することです。
- 無料で始める:初日は、全社規模のインデックスよりも、代表的な小さなリポジトリのほうが効果的です
- MCP ツール(intelligent_search、find_symbol、dependency_search)を使い、引用されたパスを開いてください
- 取り込みと情報取得のアーキテクチャについては「仕組み」(How It Works)をお読みください
- 機能の段階(capability tier)については、カタログの規模だけでなく「互換性」ページと言語ガイドをお読みください
- データの取り扱いについては「セキュリティ」と「プライバシー」をお読みください。このページはそれらの代わりにはなりません