> methodology.md
Comment nous mesurons
Cette page est littéralement l'endroit où lire comment les affirmations de qualité et de coût de Maguyva sont ancrées. Elle est strictement factuelle : ce que nous mesurons, comment nous le notons, et ce que nous ne prétendons pas avoir audité.
En vigueur à partir du 17 juillet 2026. Aucun nouveau benchmark non audité n'est inventé ici. Les chiffres actuels vivent sur des surfaces produit qui se régénèrent à partir des données source ; cette page explique le modèle de mesure.
Ceci est une traduction assistée par IA fournie pour votre confort. La version anglaise officielle est la seule contraignante — tout accord conclu lors de votre inscription est régi par le texte anglais. Lire la version anglaise officielle
tl;dr — Les affirmations de qualité reposent sur des fixture release gates et des tableaux de bord language-audit multidimensionnels — pas sur une seule preuve de « précision à 100 % ». Être vert sur les fixtures n'équivaut pas à une extraction correcte vérifiée de façon indépendante. Les affirmations de coût relèvent du calcul de tarification par workspace et de la transparence publique des coûts opérationnels, pas d'un audit concurrentiel par un tiers.
1. Pourquoi cette page existe
Les acheteurs sceptiques ne devraient pas avoir à rétro-ingénierer un texte marketing. Maguyva indexe des dépôts et affiche, sur l'ensemble du site, des affirmations de précision, de couverture linguistique et de coût. Ces affirmations ont besoin d'une page de méthodologie honnête sur le périmètre de la mesure : ce qui repose sur des fixtures, ce qui repose sur un jugement, et ce qui relève de la mise en forme plutôt que d'une certification indépendante.
2. Ce que nous mesurons
La qualité de l'intelligence du code se mesure principalement sur le moteur de langages — l'extraction de symboles, de relations et de graphes depuis le code source — pas sur des scores subjectifs de « satisfaction des agents ».
- Suites de fixtures par langage : les edges et symboles attendus que le handler doit extraire correctement
- Release gates : un langage n'est livré que lorsque la précision, le rappel et le F1 des fixtures dépassent les seuils publiés (précision ≥ 0,95, rappel ≥ 0,99, F1 ≥ 0,97 sur les fixtures, avec un nombre minimum d'edges pour la fiabilité statistique)
- Dimensions du language-audit : exactitude, intégrité structurelle, exhaustivité, qualité et performance sur le tableau de validation
- Boucles de corpus et de contrôle par échantillonnage : des edges échantillonnés dans de vrais dépôts, classés par rubrique (correct, faux positif, erreur de type/scope/métadonnée) — décrites dans nos articles de blog sur le language-grind
- Indicateurs de capacité produit : ce que le serveur annonce (AST, locals, extraction de graphe), distinct de la taille du catalogue
Important : Les fixtures valident par rapport à des fixtures que nous avons nous-mêmes écrites. VERT signifie que les cas connus passent. Cela ne signifie pas automatiquement que chaque cas réel s'extrait proprement. Cette distinction est délibérée et publique.
3. Vert vs vérifié de façon indépendante
Le tableau du language-audit utilise plusieurs axes, afin qu'un simple voyant vert ne puisse pas être lu comme « prouvé parfait ». Les chiffres clés du tableau se répartissent généralement ainsi :
- overall_green — sans régression par rapport aux fixtures self-snapshot et aux gates de corpus associés (nécessaire, mais pas suffisant)
- independently_verified — dispose d'un signal de jugement fort tel qu'une graine de contrôle par échantillonnage (inclut des langages qui présentent encore des erreurs jugées)
- verified_clean / zéro erreur jugée sur les edges échantillonnés — un sous-ensemble plus strict des langages jugés
- curation / confiance oracle — si les fixtures elles-mêmes sont traitées comme des oracles de confiance
- indicateurs structurels — l'extraction de graphe et la capacité AST ne sont pas identiques à l'appartenance au catalogue
Le nombre de langages affiché en marketing (par exemple « 279+ langages ») correspond à la taille du catalogue : langages configurés et entrées serveur. La taille du catalogue n'est pas un SLA de qualité AST. Nous préférons un reporting par niveaux à un simple chiffre vitrine. Pour l'état actuel du produit, voir Compatibilité et Guides de langages ; pour le détail narratif, voir l'article de blog sur l'auto-amélioration récursive des langages.
4. Qualité de la recherche et du retrieval
La qualité de la recherche sémantique est multimodale : texte, AST, graphe et embeddings sont fusionnés. Nous documentons des compromis d'ingénierie délibérés plutôt que de revendiquer un retrieval imbattable :
- Les embeddings utilisent une famille de modèles commerciaux (voyage-4-large à la date de l'article de blog de juin 2026), choisie sur la base des classements publics de retrieval au moment de la décision
- Les vecteurs sont quantifiés en binaire pour le stockage et le coût ; cela échange délibérément un peu de précision de retrieval contre une recherche de Hamming moins chère et plus rapide, sans base de données vectorielle séparée
- Le routage d'intention et les pondérations de fusion sont des heuristiques conçues avec des effets opérationnels mesurés (par exemple une baisse du taux de résultats nuls après le routage d'intention), pas une suite d'évaluation IR indépendante publiée sur des corpus clients
- Les articles de blog incluent des sections « ce qui reste imparfait » — les signaux imparfaits font partie du dossier, ce ne sont pas des notes de bas de page qu'on cache
5. Affirmations de coût
Le discours sur le coût chez Maguyva porte sur la structure tarifaire et la transparence opérationnelle, pas sur une étude formelle de TCO certifiée par un tiers.
- Tarification par workspace : facturée en fonction des dépôts, des lignes indexées et de la fréquence de reconstruction — pas par siège humain ou agent. La FAQ et les descriptions des offres détaillent ces dimensions.
- Les comparaisons du type « environ 10 à 30 fois moins cher » sur la page Tarifs sont des calculs illustratifs face à des fourchettes de prix par siège typiques, selon l'outil facturé au siège auquel on compare. Ce n'est pas un pack de benchmark concurrentiel indépendant figé.
- Honnêteté sur les coûts opérationnels : la page /team publie une véritable ventilation mensuelle du burn logiciel (abonnements, outillage MCP/recherche, coûts liés à l'usage). C'est de la transparence customer-zero, pas un état financier audité.
- Les coûts d'embedding et d'infrastructure sont des coûts produit assumés (embeddings premium, stockage, reconstructions de graphe). Nous les payons délibérément et le disons dans l'article voyage-4-large et dans le discours sur la tarification.
6. Ce que nous ne prétendons pas
Cette page est aussi une liste de non-affirmations. Si quelque chose n'apparaît pas sur le tableau de mesure, ne prenez pas le ton marketing pour une preuve.
- Aucune garantie générale de précision absolue pour chaque langage. Les seuils des fixtures s'appliquent par langage sur des cas connus ; une part résiduelle d'erreur en conditions réelles est attendue et assumée.
- Aucune affirmation selon laquelle overall_green équivaut à une extraction parfaite en production pour chaque idiome de dépôt
- Aucun pack de certification de conformité par un tiers n'est présenté comme un artefact de méthodologie sur cette page (voir Sécurité pour les faits sur le traitement des données, pas pour des badges de conformité)
- Aucun comparatif multi-fournisseurs indépendant avec corpus partagés publié comme scorecard permanente
- Les résultats de recherche et les analyses restent du best-effort au titre des Conditions d'utilisation — Maguyva ne remplace ni la revue de code, ni les tests, ni les audits de sécurité
7. Comment vérifier par vous-même
Le parcours prévu pour un acheteur reste le même : indexer un dépôt que vous connaissez déjà, poser une vraie question, et inspecter les citations.
- Commencez gratuitement : de petits dépôts représentatifs valent mieux qu'un index de toute l'entreprise dès le premier jour
- Utilisez les outils MCP (intelligent_search, find_symbol, dependency_search) et ouvrez les chemins cités
- Lisez Comment ça marche pour l'architecture d'ingestion et de retrieval
- Lisez Compatibilité et Guides de langages pour les niveaux de capacité, pas seulement la taille du catalogue
- Lisez Sécurité et Confidentialité pour le traitement des données ; cette page ne les remplace pas