> methodology.md
Cách chúng tôi đo lường
Trang này là nơi thực sự để đọc về cách các tuyên bố chất lượng và chi phí của Maguyva được xác lập cơ sở. Trang chỉ trình bày sự thật: chúng tôi đo lường gì, chúng tôi chấm điểm như thế nào, và những gì chúng tôi không giả vờ là đã được kiểm toán.
Có hiệu lực từ ngày 17 tháng 7 năm 2026. Không có benchmark mới chưa được kiểm toán nào được bịa ra ở đây. Số liệu hiện tại nằm trên các bề mặt sản phẩm được tái tạo từ dữ liệu nguồn; trang này giải thích mô hình đo lường.
Đây là bản dịch có sự hỗ trợ của AI, được cung cấp để tiện cho bạn. Chỉ có phiên bản tiếng Anh chính thức mới có giá trị ràng buộc — mọi thỏa thuận bạn tham gia khi đăng ký đều chịu sự điều chỉnh của văn bản tiếng Anh. Đọc phiên bản tiếng Anh chính thức
tl;dr — Các tuyên bố về chất lượng dựa trên cổng phát hành fixture và bảng language-audit đa chiều — chứ không dựa trên một bằng chứng “độ chính xác 100%” duy nhất. Xanh trên fixture không giống với việc trích xuất chính xác đã được xác minh độc lập. Các tuyên bố về chi phí là phép tính giá workspace và minh bạch chi phí vận hành công khai, không phải một cuộc kiểm toán cạnh tranh của bên thứ ba.
1. Vì Sao Trang Này Tồn Tại
Người mua hoài nghi không nên phải làm reverse-engineering nội dung tiếp thị. Maguyva lập chỉ mục các repository và trình bày các tuyên bố về độ chính xác, phạm vi ngôn ngữ và chi phí trên toàn trang web. Những tuyên bố đó cần một bề mặt phương pháp luận trung thực về phạm vi đo lường: điều gì được fixture hỗ trợ, điều gì dựa trên đánh giá chuyên môn, và điều gì chỉ là cách trình bày chứ không phải chứng nhận độc lập.
2. Chúng Tôi Đo Lường Điều Gì
Chất lượng code intelligence chủ yếu được đo trên language engine — việc trích xuất ký hiệu (symbol), quan hệ và đồ thị từ mã nguồn — chứ không phải trên điểm số “mức độ hài lòng của agent” mang tính chủ quan.
- Bộ fixture theo từng ngôn ngữ: các cạnh (edge) và ký hiệu kỳ vọng mà handler phải trích xuất chính xác
- Cổng phát hành: các ngôn ngữ chỉ được phát hành khi độ chính xác, recall và F1 trên fixture vượt qua ngưỡng đã công bố (độ chính xác ≥ 0,95, recall ≥ 0,99, F1 ≥ 0,97 trên fixture, với số lượng cạnh tối thiểu để đảm bảo độ tin cậy thống kê)
- Các chiều language-audit: độ chính xác, tính toàn vẹn cấu trúc, tính đầy đủ, chất lượng và hiệu năng trên bảng xác thực
- Vòng lặp corpus và kiểm tra ngẫu nhiên: các cạnh được lấy mẫu từ repository thực tế, phân loại theo tiêu chí (đúng, dương tính giả, lỗi loại/phạm vi/metadata) — được mô tả trong các bài blog language-grind của chúng tôi
- Cờ khả năng sản phẩm: những gì server thực sự cung cấp (AST, biến cục bộ, trích xuất đồ thị) — tách biệt khỏi kích thước danh mục
Quan trọng: Fixture được xác thực dựa trên chính các fixture mà chúng tôi viết. XANH nghĩa là các trường hợp đã biết đều đạt. Điều này không tự động có nghĩa là mọi cách diễn đạt mã trong thế giới thực đều được trích xuất sạch sẽ. Sự phân biệt này là có chủ đích và được công khai.
3. Xanh So Với Đã Xác Minh Độc Lập
Bảng language-audit sử dụng nhiều trục để một đèn xanh duy nhất không thể được hiểu là “đã chứng minh hoàn hảo”. Các con số tiêu đề trên bảng thường được chia thành:
- overall_green — không có hồi quy so với fixture self-snapshot và các cổng corpus liên quan (cần thiết, nhưng chưa đủ)
- independently_verified — có tín hiệu đánh giá mạnh như một seed kiểm tra ngẫu nhiên (bao gồm cả các ngôn ngữ vẫn còn lỗi đã được đánh giá)
- verified_clean / không lỗi nào được đánh giá trên các cạnh lấy mẫu — tập con nghiêm ngặt hơn của các ngôn ngữ đã được đánh giá
- curation / độ tin cậy oracle — liệu bản thân fixture có được coi là oracle đáng tin cậy hay không
- cờ cấu trúc — trích xuất đồ thị và khả năng AST không giống với việc chỉ đơn thuần thuộc danh mục
Số lượng ngôn ngữ trong ngôn ngữ tiếp thị (ví dụ “279+ ngôn ngữ”) là kích thước danh mục: các ngôn ngữ được cấu hình và các mục trên server. Kích thước danh mục không phải là SLA chất lượng AST. Chúng tôi ưu tiên báo cáo theo tầng hơn là một con số ấn tượng duy nhất. Để biết bề mặt sản phẩm hiện tại, xem Khả năng tương thích và Hướng dẫn ngôn ngữ; để biết chi tiết tường thuật, xem bài viết về tự cải thiện đệ quy ngôn ngữ trên blog.
4. Chất Lượng Tìm Kiếm Và Truy Xuất
Chất lượng semantic search mang tính đa phương thức: văn bản, AST, đồ thị và embedding được kết hợp. Chúng tôi ghi lại các đánh đổi kỹ thuật có chủ đích thay vì tuyên bố khả năng truy xuất bất khả chiến bại:
- Embedding sử dụng một dòng mô hình thương mại (voyage-4-large tính đến thời điểm chụp nhanh blog tháng 6 năm 2026), được chọn dựa trên bảng xếp hạng truy xuất công khai tại thời điểm quyết định
- Vector được lượng tử hóa nhị phân để lưu trữ và tiết kiệm chi phí; điều này chủ động đánh đổi một phần độ chính xác truy xuất để có tìm kiếm Hamming rẻ hơn, nhanh hơn mà không cần cơ sở dữ liệu vector riêng
- Định tuyến ý định và trọng số kết hợp là các heuristic kỹ thuật với hiệu ứng vận hành đã được đo lường (ví dụ tỷ lệ không có kết quả thấp hơn sau khi định tuyến ý định), chứ không phải một bộ đánh giá IR độc lập đã công bố trên corpus khách hàng
- Các bài blog bao gồm phần “những gì vẫn chưa hoàn hảo” — các tín hiệu chưa hoàn hảo là một phần của hồ sơ, không phải là chú thích bị che giấu
5. Tuyên Bố Về Chi Phí
Ngôn ngữ về chi phí trên Maguyva liên quan đến cấu trúc giá và minh bạch vận hành, chứ không phải một nghiên cứu TCO chính thức được chứng nhận bởi bên thứ ba.
- Giá workspace: tính phí theo số repository, số dòng đã lập chỉ mục và tần suất rebuild — không tính theo mỗi ghế người dùng hoặc agent. FAQ và nội dung gói dịch vụ nêu rõ các chiều này.
- Các so sánh kiểu “rẻ hơn khoảng 10–30 lần” trên trang Pricing là phép tính minh họa so với các khoảng giá theo ghế điển hình, tùy thuộc vào công cụ tính phí theo ghế mà bạn so sánh. Đây không phải là một gói benchmark cạnh tranh độc lập đã chốt.
- Sự trung thực về chi phí vận hành: trang /team công bố bảng phân tích chi phí phần mềm hàng tháng thực tế (đăng ký, công cụ MCP/search, chi phí theo mức sử dụng). Đây là minh bạch kiểu “customer zero”, không phải báo cáo tài chính được kiểm toán.
- Chi phí embedding và hạ tầng là chi phí sản phẩm được chấp nhận (embedding cao cấp, lưu trữ, rebuild đồ thị). Chúng tôi chủ động chi trả và nói rõ điều đó trong bài viết về voyage-4-large và phần trình bày về giá.
6. Những Điều Chúng Tôi Không Tuyên Bố
Trang này cũng là một danh sách những điều không tuyên bố. Nếu điều gì đó không có trên bảng đo lường, đừng coi giọng điệu tiếp thị là bằng chứng.
- Không có bảo đảm chung về độ chính xác tuyệt đối cho mọi ngôn ngữ. Ngưỡng fixture áp dụng cho từng ngôn ngữ trên các trường hợp đã biết; lỗi thực tế còn sót lại là điều được dự đoán và có căn cứ thực tế.
- Không tuyên bố rằng overall_green tương đương với trích xuất hoàn hảo ở môi trường production cho mọi cách diễn đạt trong mọi repository
- Không có gói chứng nhận tuân thủ bên thứ ba nào được trình bày như một sản phẩm phương pháp luận trên bề mặt này (xem Bảo mật để biết sự thật về xử lý dữ liệu, không phải huy hiệu tuân thủ)
- Không có so sánh độc lập nhiều nhà cung cấp với corpus chung được công bố như một bảng điểm thường trực
- Kết quả tìm kiếm và phân tích vẫn ở mức nỗ lực tối đa (best-effort) theo Điều khoản Dịch vụ — Maguyva không thay thế cho việc rà soát mã, kiểm thử hoặc kiểm toán bảo mật
7. Cách Tự Xác Minh
Hành trình mua hàng dự kiến vẫn là: lập chỉ mục một repository mà bạn đã hiểu rõ, đặt một câu hỏi thực tế, và kiểm tra các trích dẫn.
- Bắt đầu miễn phí: các repository nhỏ, đại diện sẽ hiệu quả hơn việc lập chỉ mục toàn bộ công ty ngay ngày đầu
- Sử dụng các công cụ MCP (intelligent_search, find_symbol, dependency_search) và mở các đường dẫn được trích dẫn
- Đọc Cách Thức Hoạt Động để biết kiến trúc ingestion và truy xuất
- Đọc Khả năng tương thích và Hướng dẫn ngôn ngữ để biết các cấp độ khả năng, không chỉ kích thước danh mục
- Đọc Bảo mật và Quyền riêng tư để biết cách xử lý dữ liệu; trang này không thay thế cho các trang đó