> methodology.md
측정 방식
이 페이지는 Maguyva의 품질 및 비용 주장이 어떻게 뒷받침되는지 실제로 확인할 수 있는 곳입니다. 오직 사실만 다룹니다. 무엇을 측정하고, 어떻게 채점하며, 무엇을 감사했다고 주장하지 않는지를 밝힙니다.
2026년 7월 17일부터 유효합니다. 여기서 감사받지 않은 새로운 벤치마크를 지어내지 않습니다. 현재 수치는 소스 데이터로부터 재생성되는 제품 화면에 표시되며, 이 페이지는 그 측정 모델을 설명합니다.
이 번역은 편의를 위해 AI의 도움을 받아 제공됩니다. 공식 버전은 영어 원문뿐이며 — 가입 시 체결하는 모든 계약은 영어 원문의 적용을 받습니다. 공식 영어 버전 읽기
tl;dr — 품질 주장은 픽스처 릴리스 게이트와 다차원 language-audit 보드에 기반하며, “100% 정밀도”라는 단일 증명에 의존하지 않습니다. 픽스처가 초록불이라는 것이 추출의 정확성이 독립적으로 검증되었다는 뜻은 아닙니다. 비용 주장은 워크스페이스 요금 계산과 공개된 운영 비용 투명성이며, 제3자 경쟁 감사가 아닙니다.
1. 이 페이지가 존재하는 이유
회의적인 구매자가 마케팅 문구를 역으로 분석할 필요는 없어야 합니다. Maguyva는 저장소를 색인하고, 사이트 전반에 걸쳐 정밀도, 언어 커버리지, 비용에 관한 주장을 제시합니다. 이러한 주장에는 측정 범위에 대해 정직한 방법론 페이지가 필요합니다. 즉 무엇이 픽스처로 뒷받침되고, 무엇이 판단으로 뒷받침되며, 무엇이 독립적인 인증이 아니라 표현 방식에 불과한지를 밝히는 것입니다.
2. 무엇을 측정하는가
코드 인텔리전스 품질은 주로 언어 엔진에서 측정됩니다. 즉 소스에서 심볼, 관계, 그래프를 추출하는 능력이며, 주관적인 “agent 만족도” 점수가 아닙니다.
- 언어별 픽스처 스위트: 핸들러가 올바르게 추출해야 하는 예상 엣지와 심볼
- 릴리스 게이트: 픽스처상의 정밀도, 재현율, F1이 공개된 임계값(픽스처에서 precision ≥ 0.95, recall ≥ 0.99, F1 ≥ 0.97, 그리고 통계적 신뢰를 위한 최소 엣지 수)을 통과한 언어만 출시됩니다
- Language-audit 차원: 검증 보드상의 정확성, 구조적 무결성, 완전성, 품질, 성능
- 코퍼스 및 스팟체크 루프: 실제 저장소에서 샘플링한 엣지를 루브릭에 따라 분류(정답, 오탐, 타입/스코프/메타데이터 오류)—language-grind 관련 블로그 글에서 설명합니다
- 제품 기능 플래그: 서버가 광고하는 기능(AST, 지역 변수, 그래프 추출)을 카탈로그 규모와 분리하여 나타냅니다
중요: 픽스처는 우리가 작성한 픽스처를 기준으로 검증됩니다. 초록불은 알려진 케이스가 통과했음을 의미합니다. 현실 세계의 모든 관용적 표현이 깔끔하게 추출된다는 것을 자동으로 의미하지는 않습니다. 이 구분은 의도적이며 공개되어 있습니다.
3. 초록불 vs 독립 검증
language-audit 보드는 여러 축을 사용하므로, 하나의 초록불을 “완벽함이 입증되었다”고 읽을 수는 없습니다. 보드의 대표 수치는 일반적으로 다음과 같이 나뉩니다:
- overall_green — 자체 스냅샷 픽스처 및 관련 코퍼스 게이트에 대해 회귀가 없는 상태(필요조건이지 충분조건은 아님)
- independently_verified — 스팟체크 시드와 같은 강한 판단 신호를 갖춘 상태(판정된 오류가 여전히 남아 있는 언어 포함)
- verified_clean / 샘플링된 엣지에서 판정된 오류 0건 — 판정 대상 언어 중 더 엄격한 부분집합
- curation / oracle trust — 픽스처 자체를 신뢰할 수 있는 오라클로 취급하는지 여부
- structural flags — 그래프 추출 및 AST 기능은 카탈로그 등재와 동일하지 않습니다
마케팅상의 언어 수(예: “279개 이상의 언어”)는 카탈로그 규모, 즉 구성된 언어와 서버 항목 수입니다. 카탈로그 규모는 AST 품질 SLA가 아닙니다. 단일한 보기 좋은 숫자보다 단계별 보고를 선호합니다. 현재 제품 화면은 호환성과 언어 가이드를 참조하고, 자세한 경위는 블로그의 언어 재귀적 자기 개선 글을 참조하세요.
4. 검색 및 정보 인출 품질
시맨틱 검색 품질은 멀티모달입니다. 텍스트, AST, 그래프, 임베딩이 융합됩니다. 우리는 무적의 인출 능력을 주장하기보다, 의도적인 엔지니어링 상의 절충을 문서화합니다:
- 임베딩은 상용 모델 제품군(2026년 6월 블로그 스냅샷 기준 voyage-4-large)을 사용하며, 이는 의사결정 시점에 공개된 인출 리더보드를 기준으로 선정한 것입니다
- 벡터는 저장 공간과 비용을 위해 이진 양자화됩니다. 이는 별도의 벡터 데이터베이스 없이 더 저렴하고 빠른 해밍 검색을 위해 인출 정밀도의 일부를 의도적으로 절충한 것입니다
- 의도 라우팅과 융합 가중치는 측정된 운영 효과(예: 의도 라우팅 도입 후 무결과 비율 감소)를 지닌 엔지니어링된 휴리스틱이며, 고객 코퍼스에 대해 공개된 독립 IR 평가 스위트가 아닙니다
- 블로그 글에는 “아직 불완전한 부분” 섹션이 포함되어 있습니다. 불완전한 신호는 감추기 위한 각주가 아니라 기록의 일부입니다
5. 비용 주장
Maguyva의 비용 관련 표현은 가격 구조와 운영 투명성에 관한 것이며, 제3자가 인증한 공식 TCO 연구가 아닙니다.
- 워크스페이스 요금: 사람이나 agent 좌석 단위가 아니라 저장소 수, 색인된 라인 수, 재빌드 빈도로 청구됩니다. FAQ와 요금제 설명에 각 항목이 명시되어 있습니다.
- 요금 페이지의 “약 10~30배 저렴” 식의 비교는, 비교 대상이 되는 좌석 과금형 도구에 따라 일반적인 좌석 단가 범위에 대한 예시적 계산입니다. 확정된 독립 경쟁 벤치마크 패키지가 아닙니다.
- 운영 비용에 대한 정직함: /team 페이지에는 실제 월간 소프트웨어 지출 내역(구독, MCP/검색 도구, 사용량에 따른 비용)이 공개되어 있습니다. 이는 “0번 고객” 수준의 투명성이며, 감사받은 재무제표가 아닙니다.
- 임베딩 및 인프라 비용은 우리가 받아들인 제품 비용입니다(프리미엄 임베딩, 저장, 그래프 재빌드). 우리는 이를 의도적으로 부담하며, voyage-4-large 글과 요금 설명에서 그렇게 밝히고 있습니다.
6. 우리가 주장하지 않는 것
이 페이지는 “주장하지 않는 것”의 목록이기도 합니다. 어떤 것이 측정 보드에 없다면, 마케팅 어조를 증거로 취급하지 마세요.
- 모든 언어에 대한 포괄적인 절대 정밀도 보장은 없습니다. 픽스처 임계값은 알려진 케이스에 대해 언어별로 적용되며, 현실 세계에 남는 오류는 예상된 것이고 또한 밝히고 있습니다.
- overall_green이 모든 저장소 관용 표현에 대해 프로덕션 수준의 완벽한 추출과 같다고 주장하지 않습니다
- 제3자 컴플라이언스 인증 패키지를 이 화면에서 방법론 산출물로 주장하지 않습니다(데이터 처리 관련 사실은 보안 페이지를 참조하세요. 컴플라이언스 배지가 아닙니다)
- 공유 코퍼스를 사용한 독립적인 다중 벤더 비교 테스트를 상설 스코어카드로 공개하지 않습니다
- 검색 결과와 분석은 서비스 약관에 따라 최선의 노력에 그칩니다. Maguyva는 코드 리뷰, 테스트, 보안 감사를 대체하지 않습니다
7. 직접 검증하는 방법
권장하는 구매자 동선은 여전히 다음과 같습니다. 이미 잘 아는 저장소를 색인하고, 실제 질문 하나를 던지고, 인용된 출처를 확인하는 것입니다.
- 무료로 시작: 첫날에는 회사 전체를 색인하는 것보다 대표적인 소규모 저장소가 더 낫습니다
- MCP 도구(intelligent_search, find_symbol, dependency_search)를 사용하고 인용된 경로를 열어 보세요
- 수집 및 인출 아키텍처는 “작동 방식”(How It Works)을 읽어 보세요
- 카탈로그 규모만이 아니라 기능 계층에 대해서는 “호환성”과 “언어 가이드”를 읽어 보세요
- 데이터 처리는 “보안”과 “개인정보 보호”를 읽어 보세요. 이 페이지는 그것들을 대체하지 않습니다