> methodology.md
Как мы измеряем
Эта страница — буквально то место, где можно прочитать, на чём основаны заявления Maguyva о качестве и стоимости. Здесь только факты: что мы измеряем, как это оцениваем и что мы не притворяемся проверившими аудитом.
Действует с 17 июля 2026 года. Здесь не выдумываются новые непроверенные бенчмарки. Текущие показатели находятся на продуктовых поверхностях, которые перегенерируются из исходных данных; эта страница объясняет модель измерения.
Это перевод с помощью ИИ, предоставленный для удобства. Официальной и юридически обязывающей является только английская версия — любое соглашение, которое вы заключаете при регистрации, регулируется английским текстом. Читать официальную английскую версию
tl;dr — Заявления о качестве опираются на fixture-гейты релиза и многомерные доски language-audit, а не на единственное доказательство «100% точности». Зелёный статус на fixtures — не то же самое, что независимо подтверждённое корректное извлечение. Заявления о стоимости — это расчёт цен рабочего пространства и публичная прозрачность операционных затрат, а не конкурентный аудит третьей стороны.
1. Зачем нужна эта страница
Скептически настроенным покупателям не следует расшифровывать маркетинговый текст в обратную сторону. Maguyva индексирует репозитории и представляет по всему сайту заявления о точности, охвате языков и стоимости. Этим заявлениям нужна методологическая поверхность, честная относительно границ измерения: что подкреплено fixtures, что подкреплено экспертной оценкой, а что является лишь подачей, а не независимой сертификацией.
2. Что мы измеряем
Качество интеллектуального анализа кода измеряется прежде всего на языковом движке — извлечение символов, связей и графов из исходного кода, — а не по субъективным оценкам «удовлетворённости агента».
- Наборы fixtures по каждому языку: ожидаемые рёбра и символы, которые обработчик обязан извлечь корректно
- Гейты релиза: языки выпускаются только тогда, когда точность, полнота и F1 на fixtures превышают опубликованные пороги (точность ≥ 0,95, полнота ≥ 0,99, F1 ≥ 0,97 на fixtures, с минимальным числом рёбер для статистической достоверности)
- Измерения language-audit: точность, структурная целостность, полнота, качество и производительность на доске валидации
- Циклы по корпусам и выборочным проверкам: рёбра из реальных репозиториев, взятые как выборка и классифицированные по рубрике (верно, ложноположительно, ошибка типа/области/метаданных), — описаны в наших постах блога о language-grind
- Флаги возможностей продукта: то, что заявляет сервер (AST, локальные переменные, извлечение графа), отдельно от размера каталога
Важно: Fixtures проверяются относительно fixtures, которые написали мы сами. Зелёный статус означает, что известные случаи проходят. Он не означает автоматически, что каждая реальная идиома извлекается чисто. Это различие сделано намеренно и является публичным.
3. Зелёный статус против независимо подтверждённого
Доска language-audit использует несколько осей, чтобы один зелёный индикатор нельзя было прочитать как «доказанно безупречно». Ключевые числа на доске обычно разбиты на:
- overall_green — отсутствие регрессий относительно fixtures собственного снимка и связанных корпусных гейтов (необходимое, но не достаточное условие)
- independently_verified — есть сильный сигнал экспертной оценки, например начальная выборка для выборочной проверки (включает языки, где всё ещё видны оценённые ошибки)
- verified_clean / ноль оценённых ошибок на выборочных рёбрах — более строгое подмножество оценённых языков
- curation / доверие к эталону — считаются ли сами fixtures доверенными эталонами
- структурные флаги — извлечение графа и возможность AST не тождественны членству в каталоге
Маркетинговый счётчик языков (например, «279+ языков») — это размер каталога: настроенные языки и записи сервера. Размер каталога не является SLA качества AST. Предпочитайте многоуровневую отчётность единственной эффектной цифре. Актуальную продуктовую поверхность см. в разделах «Совместимость» и «Руководства по языкам»; повествовательные детали — в посте блога о рекурсивном самоулучшении языков.
4. Качество поиска и извлечения
Качество семантического поиска мультимодально: объединяются текст, AST, граф и эмбеддинги. Мы документируем осознанные инженерные компромиссы, а не заявляем о непревзойдённом извлечении:
- Эмбеддинги используют коммерческое семейство моделей (voyage-4-large по состоянию на снимок блога за июнь 2026 года), выбранное относительно публичных лидербордов извлечения на момент принятия решения
- Векторы бинарно квантуются ради хранения и стоимости; это осознанно жертвует частью точности извлечения ради более дешёвого и быстрого поиска Хэмминга без отдельной векторной базы данных
- Маршрутизация намерения и веса слияния — это инженерные эвристики с измеренными операционными эффектами (например, более низкая доля нулевых результатов после маршрутизации намерения), а не опубликованный независимый набор для оценки IR на корпусах клиентов
- Посты блога включают разделы «что всё ещё несовершенно» — несовершенные сигналы являются частью записи, а не сносками для сокрытия
5. Заявления о стоимости
Язык стоимости в Maguyva касается структуры ценообразования и операционной прозрачности, а не формального исследования TCO, сертифицированного третьей стороной.
- Ценообразование рабочего пространства: счёт выставляется по репозиториям, проиндексированным строкам и частоте пересборки, а не за место человека или агента. FAQ и текст тарифов подробно описывают эти измерения.
- Сравнения вида «примерно в 10–30 раз меньше» на странице цен — это иллюстративный расчёт относительно типичных диапазонов цен за место, в зависимости от того, с каким инструментом с оплатой за место вы сравниваете. Это не зафиксированный независимый пакет конкурентных бенчмарков.
- Честность операционных затрат: страница /team публикует реальную помесячную разбивку расходов на ПО (подписки, инструменты MCP/поиска, затраты, зависящие от использования). Это прозрачность «клиента номер ноль», а не аудированная финансовая отчётность.
- Затраты на эмбеддинги и инфраструктуру — это принятые продуктовые издержки (премиальные эмбеддинги, хранение, пересборка графа). Мы несём их намеренно и говорим об этом в посте про voyage-4-large и в описании ценообразования.
6. Что мы не заявляем
Эта страница также является перечнем того, чего мы не заявляем. Если чего-то нет на доске измерений, не принимайте маркетинговый тон за доказательство.
- Никакой всеобъемлющей гарантии абсолютной точности для каждого языка. Пороги fixtures применяются по каждому языку к известным случаям; остаточная реальная ошибка ожидаема и открыто признаётся.
- Никакого заявления, что overall_green равен идеальному в продакшене извлечению для каждой идиомы репозитория
- Никакого пакета сертификации соответствия от третьей стороны, заявленного как методологический артефакт на этой поверхности (факты об обработке данных см. в разделе «Безопасность», а не значки соответствия)
- Никакого независимого многопоставщического сравнения на общих корпусах, опубликованного как постоянная оценочная таблица
- Результаты поиска и анализа остаются работой по принципу наилучших усилий согласно Условиям обслуживания — Maguyva не заменяет ревью кода, тестирование или аудит безопасности
7. Как проверить самостоятельно
Предполагаемый сценарий покупателя по-прежнему таков: проиндексируйте репозиторий, который вы уже понимаете, задайте один реальный вопрос и изучите ссылки на источники.
- Начните бесплатно: небольшие репрезентативные репозитории в первый же день лучше, чем индекс всей компании
- Используйте инструменты MCP (intelligent_search, find_symbol, dependency_search) и открывайте процитированные пути
- Прочитайте «Как это работает», чтобы понять архитектуру приёма и извлечения данных
- Прочитайте «Совместимость» и «Руководства по языкам», чтобы узнать уровни возможностей, а не только размер каталога
- Прочитайте «Безопасность» и «Конфиденциальность» об обработке данных; эта страница их не заменяет