> methodology.md
เราวัดผลอย่างไร
หน้านี้คือสถานที่ตามตัวอักษรสำหรับอ่านว่าคำกล่าวอ้างด้านคุณภาพและต้นทุนของ Maguyva ตั้งอยู่บนพื้นฐานใด เป็นข้อเท็จจริงล้วน ๆ ได้แก่ เราวัดอะไร ให้คะแนนอย่างไร และสิ่งใดที่เราไม่ได้แสร้งว่าได้ตรวจสอบแล้ว
มีผลตั้งแต่วันที่ 17 กรกฎาคม 2026 ที่นี่ไม่มีการกุเกณฑ์เปรียบเทียบใหม่ที่ยังไม่ได้ตรวจสอบขึ้นมา ตัวเลขปัจจุบันอยู่บนพื้นผิวผลิตภัณฑ์ที่สร้างใหม่จากข้อมูลต้นทาง หน้านี้อธิบายแบบจำลองการวัดผล
นี่คือคำแปลที่ช่วยด้วย AI จัดทำขึ้นเพื่อความสะดวกของคุณ เวอร์ชันภาษาอังกฤษอย่างเป็นทางการเท่านั้นที่มีผลผูกพัน — ข้อตกลงใด ๆ ที่คุณทำเมื่อสมัครใช้งานจะอยู่ภายใต้เนื้อหาภาษาอังกฤษ อ่านเวอร์ชันภาษาอังกฤษฉบับทางการ
tl;dr — คำกล่าวอ้างด้านคุณภาพวางอยู่บน ด่านตรวจการเผยแพร่ของ fixture และกระดาน language-audit หลายมิติ ไม่ใช่บนหลักฐาน “ความแม่นยำ 100%” เพียงชิ้นเดียว การได้สถานะเขียวบน fixtures ไม่เหมือนกับการสกัดที่ถูกต้องซึ่งได้รับการยืนยันโดยอิสระ ส่วนคำกล่าวอ้างด้านต้นทุนคือการคำนวณราคาพื้นที่ทำงานและความโปร่งใสของต้นทุนดำเนินงานที่เปิดเผยต่อสาธารณะ ไม่ใช่การตรวจสอบเชิงแข่งขันโดยบุคคลที่สาม
1. เหตุใดจึงมีหน้านี้
ผู้ซื้อที่ตั้งข้อสงสัยไม่ควรต้องมานั่งถอดรหัสข้อความการตลาดย้อนกลับ Maguyva ทำดัชนีที่เก็บโค้ดและนำเสนอคำกล่าวอ้างเรื่องความแม่นยำ ความครอบคลุมภาษา และต้นทุนทั่วทั้งไซต์ คำกล่าวอ้างเหล่านั้นต้องการพื้นผิวเชิงระเบียบวิธีที่ซื่อสัตย์เกี่ยวกับขอบเขตการวัดผล ว่าสิ่งใดมี fixture รองรับ สิ่งใดมีวิจารณญาณรองรับ และสิ่งใดเป็นเพียงการนำเสนอ ไม่ใช่การรับรองโดยอิสระ
2. เราวัดอะไร
คุณภาพของระบบวิเคราะห์โค้ดอัจฉริยะวัดกันที่เอนจินภาษาเป็นหลัก ได้แก่ การสกัดสัญลักษณ์ ความสัมพันธ์ และกราฟจากซอร์สโค้ด ไม่ใช่คะแนน “ความพึงพอใจของเอเจนต์” เชิงอัตวิสัย
- ชุด fixture ต่อภาษา: เอดจ์และสัญลักษณ์ที่คาดหวังซึ่งตัวจัดการต้องสกัดออกมาให้ถูกต้อง
- ด่านตรวจการเผยแพร่: ภาษาจะถูกปล่อยออกก็ต่อเมื่อค่าความแม่นยำ ความครบถ้วน และ F1 บน fixture ผ่านเกณฑ์ที่เผยแพร่ไว้ (ความแม่นยำ ≥ 0.95, ความครบถ้วน ≥ 0.99, F1 ≥ 0.97 บน fixture พร้อมจำนวนเอดจ์ขั้นต่ำเพื่อความเชื่อมั่นทางสถิติ)
- มิติของ language-audit: ความถูกต้อง ความสมบูรณ์เชิงโครงสร้าง ความครบถ้วน คุณภาพ และประสิทธิภาพบนกระดานตรวจสอบ
- ลูป ชุดข้อมูล และการสุ่มตรวจ: เอดจ์จากที่เก็บโค้ดจริงที่สุ่มมาและจำแนกตามเกณฑ์ (ถูกต้อง, ผลบวกลวง, ข้อผิดพลาดด้านชนิด/ขอบเขต/เมทาดาทา) ตามที่อธิบายไว้ในโพสต์บล็อก language-grind ของเรา
- ธงความสามารถของผลิตภัณฑ์: สิ่งที่เซิร์ฟเวอร์ประกาศ (AST, ตัวแปรท้องถิ่น, การสกัดกราฟ) แยกต่างหากจากขนาดแคตตาล็อก
สำคัญ: fixture ตรวจสอบเทียบกับ fixture ที่เราเขียนขึ้นเอง สถานะเขียวหมายความว่ากรณีที่รู้จักผ่าน มันไม่ได้หมายความโดยอัตโนมัติว่าสำนวนในโลกจริงทุกแบบจะถูกสกัดออกมาอย่างสะอาด ความแตกต่างนี้เป็นสิ่งที่ตั้งใจและเปิดเผยต่อสาธารณะ
3. สถานะเขียว เทียบกับ การยืนยันโดยอิสระ
กระดาน language-audit ใช้หลายแกน เพื่อไม่ให้ไฟเขียวเพียงดวงเดียวถูกตีความว่า “พิสูจน์แล้วว่าสมบูรณ์แบบ” ตัวเลขหลักบนกระดานมักแบ่งออกเป็น:
- overall_green — ปราศจากการถดถอยเมื่อเทียบกับ fixture แบบสแนปช็อตของตัวเองและ ด่านตรวจชุดข้อมูล ที่เกี่ยวข้อง (จำเป็นแต่ไม่เพียงพอ)
- independently_verified — มีสัญญาณวิจารณญาณที่หนักแน่น เช่น ตัวอย่างตั้งต้นสำหรับการสุ่มตรวจ (รวมภาษาที่ยังคงแสดงข้อผิดพลาดที่ประเมินแล้ว)
- verified_clean / ศูนย์ข้อผิดพลาดที่ประเมินแล้วบนเอดจ์ที่สุ่มมา — เซตย่อยที่เข้มงวดกว่าของภาษาที่ประเมินแล้ว
- curation / ความน่าเชื่อถือของข้อมูลอ้างอิง — ว่า fixture เองถือเป็นข้อมูลอ้างอิงที่เชื่อถือได้หรือไม่
- ธงเชิงโครงสร้าง — การสกัดกราฟและความสามารถ AST ไม่เหมือนกันกับการเป็นสมาชิกในแคตตาล็อก
จำนวนภาษาเชิงการตลาด (เช่น “279+ ภาษา”) คือขนาดแคตตาล็อก ได้แก่ ภาษาที่กำหนดค่าไว้และรายการในเซิร์ฟเวอร์ ขนาดแคตตาล็อกไม่ใช่ SLA ด้านคุณภาพ AST เราชอบการรายงานแบบแบ่งระดับมากกว่าจำนวนหัวเดียวที่ดูโก้เก๋ สำหรับพื้นผิวผลิตภัณฑ์ปัจจุบัน ดู «ความเข้ากันได้» และ «คู่มือภาษา» สำหรับรายละเอียดเชิงเล่าเรื่อง ดูโพสต์เรื่องการพัฒนาตนเองแบบเวียนซ้ำของภาษาบนบล็อก
4. คุณภาพของการค้นหาและการดึงข้อมูล
คุณภาพของการค้นหาเชิงความหมายเป็นแบบหลายรูปแบบ: ข้อความ, AST, กราฟ และเวกเตอร์ฝังตัวถูกหลอมรวมเข้าด้วยกัน เราจัดทำเอกสารการแลกเปลี่ยนเชิงวิศวกรรมที่ตั้งใจไว้ แทนที่จะกล่าวอ้างว่าการดึงข้อมูลของเราไร้ผู้ใดเทียบ:
- เวกเตอร์ฝังตัว ใช้ตระกูลโมเดลเชิงพาณิชย์ (voyage-4-large ตามสแนปช็อตบล็อกเดือนมิถุนายน 2026) ซึ่งเลือกโดยเทียบกับลีดเดอร์บอร์ดการดึงข้อมูลสาธารณะ ณ เวลาที่ตัดสินใจ
- เวกเตอร์ถูกควอนไทซ์แบบไบนารีเพื่อการจัดเก็บและต้นทุน ซึ่งจงใจแลกความแม่นยำในการดึงข้อมูลบางส่วนไปกับการค้นหาแบบ Hamming ที่ถูกกว่าและเร็วกว่า โดยไม่ต้องมีฐานข้อมูลเวกเตอร์แยกต่างหาก
- การกำหนดเส้นทางตามเจตนาและน้ำหนักการหลอมรวมเป็นฮิวริสติกเชิงวิศวกรรมที่มีผลเชิงปฏิบัติการที่วัดได้ (เช่น อัตราผลลัพธ์เป็นศูนย์ที่ต่ำลงหลังการกำหนดเส้นทางตามเจตนา) ไม่ใช่ชุดประเมิน IR อิสระที่เผยแพร่บนคลังข้อมูลของลูกค้า
- โพสต์บล็อกมีส่วน “อะไรที่ยังไม่สมบูรณ์” สัญญาณที่ยังไม่สมบูรณ์เป็นส่วนหนึ่งของบันทึก ไม่ใช่เชิงอรรถที่ไว้ซ่อน
5. คำกล่าวอ้างด้านต้นทุน
ภาษาด้านต้นทุนบน Maguyva เป็นเรื่องของโครงสร้างการตั้งราคาและความโปร่งใสในการดำเนินงาน ไม่ใช่การศึกษา TCO อย่างเป็นทางการที่ได้รับการรับรองโดยบุคคลที่สาม
- การตั้งราคาพื้นที่ทำงาน: คิดค่าบริการตามที่เก็บโค้ด จำนวนบรรทัดที่ทำดัชนี และความถี่ในการสร้างใหม่ ไม่ใช่ตามที่นั่งของคนหรือเอเจนต์ คำถามที่พบบ่อยและข้อความของแพ็กเกจอธิบายมิติเหล่านี้ไว้อย่างชัดเจน
- การเปรียบเทียบทำนอง “น้อยกว่าราว 10–30 เท่า” บนหน้าราคาเป็นการคำนวณเชิงตัวอย่างเทียบกับช่วงราคาต่อที่นั่งโดยทั่วไป ขึ้นอยู่กับว่าคุณเทียบกับเครื่องมือที่คิดราคาต่อที่นั่งตัวใด สิ่งเหล่านี้ไม่ใช่แพ็กเกจเกณฑ์เปรียบเทียบเชิงแข่งขันอิสระที่ถูกล็อกไว้
- ความซื่อสัตย์เรื่องต้นทุนดำเนินงาน: หน้า /team เผยแพร่รายละเอียดค่าใช้จ่ายซอฟต์แวร์รายเดือนจริง (การสมัครสมาชิก, เครื่องมือ MCP/การค้นหา, ต้นทุนที่ผันตามการใช้งาน) นั่นคือความโปร่งใสของ “ลูกค้าหมายเลขศูนย์” ไม่ใช่งบการเงินที่ผ่านการตรวจสอบ
- ต้นทุนเวกเตอร์ฝังตัวและโครงสร้างพื้นฐานเป็นต้นทุนผลิตภัณฑ์ที่ยอมรับ (เวกเตอร์ฝังตัวระดับพรีเมียม, การจัดเก็บ, การสร้างกราฟใหม่) เราจ่ายมันโดยตั้งใจและกล่าวเช่นนั้นไว้ในโพสต์ voyage-4-large และในคำบรรยายเรื่องราคา
6. สิ่งที่เราไม่กล่าวอ้าง
หน้านี้ยังเป็นรายการของสิ่งที่เราไม่กล่าวอ้างด้วย หากสิ่งใดไม่อยู่บนกระดานการวัดผล อย่าถือเอาน้ำเสียงการตลาดเป็นข้อพิสูจน์
- ไม่มีการรับประกันความแม่นยำสัมบูรณ์แบบครอบจักรวาลสำหรับทุกภาษา เกณฑ์ fixture ใช้กับกรณีที่รู้จักในแต่ละภาษา ข้อผิดพลาดในโลกจริงที่ยังหลงเหลือเป็นสิ่งที่คาดหมายและยอมรับอย่างเปิดเผย
- ไม่มีการกล่าวอ้างว่า overall_green เท่ากับการสกัดที่สมบูรณ์แบบระดับโปรดักชันสำหรับทุกสำนวนในที่เก็บโค้ด
- ไม่มีการอ้างแพ็กเกจการรับรองความสอดคล้องจากบุคคลที่สามในฐานะสิ่งประดิษฐ์เชิงระเบียบวิธีบนพื้นผิวนี้ (ดูข้อเท็จจริงการจัดการข้อมูลได้ที่ «ความปลอดภัย» ไม่ใช่ตราสัญลักษณ์ความสอดคล้อง)
- ไม่มีการเปรียบเทียบข้ามผู้จำหน่ายหลายรายอย่างอิสระบนคลังข้อมูลร่วมที่เผยแพร่เป็นตารางคะแนนถาวร
- ผลการค้นหาและการวิเคราะห์ยังคงเป็นการทำอย่างสุดความสามารถภายใต้ข้อกำหนดในการให้บริการ Maguyva ไม่ใช่สิ่งทดแทนการรีวิวโค้ด การทดสอบ หรือการตรวจสอบความปลอดภัย
7. วิธีตรวจสอบด้วยตนเอง
ขั้นตอนที่ตั้งใจไว้สำหรับผู้ซื้อยังคงเป็น: ทำดัชนีที่เก็บโค้ดที่คุณเข้าใจอยู่แล้ว ถามคำถามจริงหนึ่งข้อ และตรวจสอบการอ้างอิง
- เริ่มฟรี: ที่เก็บโค้ดขนาดเล็กที่เป็นตัวแทนได้ดีกว่าดัชนีทั้งบริษัทในวันแรก
- ใช้เครื่องมือ MCP (intelligent_search, find_symbol, dependency_search) และเปิดเส้นทางที่ถูกอ้างอิง
- อ่าน «วิธีการทำงาน» เพื่อดูสถาปัตยกรรมการนำเข้าและการดึงข้อมูล
- อ่าน «ความเข้ากันได้» และ «คู่มือภาษา» เพื่อดูระดับความสามารถ ไม่ใช่เพียงขนาดแคตตาล็อก
- อ่าน «ความปลอดภัย» และ «ความเป็นส่วนตัว» เกี่ยวกับการจัดการข้อมูล หน้านี้ไม่ได้แทนที่เอกสารเหล่านั้น