หากคะแนนแบบจำลองสองคะแนนมาจากงาน ชุดข้อมูล หรือโครงร่างตัวแทนที่แตกต่างกัน คะแนนเหล่านั้นจะไม่ใช่บอร์ดผู้นำเดียว วิธีการวัดประสิทธิภาพ AI นี้ทำให้การเปรียบเทียบมีประโยชน์โดยทำให้มองเห็นตัวแปรที่ซ่อนอยู่ได้
เป้าหมายไม่ใช่การสร้างผู้ชนะเพียงคนเดียว เป้าหมายคือการตอบคำถามที่แท้จริงของผู้ซื้อหรือวิศวกร: ระบบใดที่เชื่อถือได้เพียงพอสำหรับขั้นตอนการทำงานนี้ ในราคาเท่านี้ พร้อมการควบคุมดูแลในระดับนี้
ห้าชั้นทุกคะแนนต้องการ
ก่อนที่จะบันทึกตัวเลข ให้จับภาพห้าเลเยอร์:
- งาน — ระบบต้องทำอะไรบ้าง: ซ่อมแซมพื้นที่เก็บข้อมูล แก้ไขไฟล์ แก้อัลกอริธึม ตอบคำถามทางวิทยาศาสตร์ หรือใช้งานเทอร์มินัล
- ชุดข้อมูล — มีการใช้เวอร์ชัน ช่วงวันที่ การผสมภาษา และการควบคุมการปนเปื้อนใด
- ระบบ — มันเป็นโมเดลดิบ, การกำหนดค่า API, ตัวช่วย IDE หรือเอเจนต์การเขียนโค้ดพร้อมเครื่องมือหรือไม่
- ตัวชี้วัด — เปอร์เซ็นต์ผลลัพธ์ได้รับการแก้ไขแล้ว ตรงกันทุกประการ อัตราการส่งบอล อัตราการชนะ เวลาแฝง ต้นทุน หรือคะแนนความชอบของมนุษย์
- หลักฐาน — ผู้อ่านสามารถตรวจสอบการ์ดโมเดล แถวกระดานผู้นำ กระดาษ หรือสมุดบันทึกที่ทำสำเนาได้หรือไม่
หากช่องใดช่องหนึ่งหายไป ให้ติดป้ายกำกับหมายเลขว่าไม่สมบูรณ์ แทนที่จะนำเสนอเป็นการเปรียบเทียบแบบจำลองที่ชัดเจน
แยกคลาสแหล่งที่มา
การตัดสินใจครั้งแรกของบรรณาธิการคือการจำแนกแหล่งที่มา แยกแถวออกจากกันแม้ว่าจะพูดถึงโมเดลเดียวกันก็ตาม
| คลาสต้นทาง | มันสามารถบอกคุณอะไรได้บ้าง | สิ่งที่พิสูจน์ไม่ได้ |
|---|---|---|
| รายงานการออกของผู้ขาย | งานที่ผู้ขายเลือก การกำหนดค่า และผลลัพธ์ที่ดีที่สุด | ผลลัพธ์เดียวกันนั้นจะถ่ายโอนไปยังขั้นตอนการทำงานของคุณ |
| ลีดเดอร์บอร์ดบุคคลที่สาม | มุมมองที่เป็นอิสระมากขึ้นภายใต้การควบคุมที่เผยแพร่ | ว่าทุกแถวใช้เครื่องมือหรืองบประมาณการอนุมานเดียวกัน |
| การประเมินชุมชน | สัญญาณที่รวดเร็วเกี่ยวกับโมเดลที่เกิดขึ้นใหม่และแรงเสียดทานในทางปฏิบัติ | ความสามารถในการทำซ้ำทางวิทยาศาสตร์ที่มั่นคง |
| การสืบพันธุ์ภายใน | โมเดลทำงานอย่างไรในสภาพแวดล้อมที่แน่นอนของคุณ | ประสิทธิภาพทั่วไปนอกตัวอย่างงานของคุณ |
การเปรียบเทียบเกณฑ์มาตรฐาน LLM ใช้การแยกนี้ในตาราง ตัวชี้วัดผู้จัดจำหน่ายจะอยู่ในแถวผู้ขาย Aider และ SWE-bench ยังคงเชื่อมโยงกับบริบทการประเมินสาธารณะของตนเอง
บันทึกโครงนั่งร้าน ไม่ใช่แค่โมเดล
คะแนนการเข้ารหัสเอเจนต์มักจะรวมถึงการเรียกค้น การเลือกไฟล์ การดำเนินการเชลล์ การทดสอบการทำงาน การลองใหม่ การซ่อมแซมแพตช์ และนโยบายการอนุมัติ ชั้นเหล่านั้นไม่ใช่เสียงรบกวน พวกเขาเป็นส่วนหนึ่งของผลิตภัณฑ์ที่ทีมนำมาใช้จริง
สำหรับเกณฑ์มาตรฐานตัวแทนทุกรายการ ให้บันทึก:
- ชื่อรุ่นและเวอร์ชัน
- หน้าต่างบริบทและโหมดการใช้เหตุผล
- เครื่องมือที่มีอยู่ในระบบ
- กฎการดึงข้อมูลหรือการทำดัชนีพื้นที่เก็บข้อมูล
- จำนวนเทิร์นสูงสุด การลองใหม่ และงบประมาณโทเค็น
- แซนด์บ็อกซ์และการอนุญาตเครือข่าย
- ทดสอบคำสั่งและนโยบายผ่าน/ไม่ผ่าน
- ไม่ว่ามนุษย์จะเข้ามาแทรกแซงได้หรือไม่
นี่คือเหตุผลว่าทำไม การเปรียบเทียบเครื่องมือตัวแทน AI อยู่ถัดจากคะแนนโมเดล: อินเทอร์เฟซจะเปลี่ยนผลลัพธ์
ใช้กลุ่มการวัดประสิทธิภาพที่ตรงกับงาน
อย่าเฉลี่ยคะแนนที่ไม่เกี่ยวข้องกันลงในองค์ประกอบที่ประดิษฐ์ขึ้น ใช้ตระกูลเกณฑ์มาตรฐานที่คล้ายกับงานที่ตั้งใจไว้
| การตัดสินใจ | หลักฐานเบื้องต้น | หลักฐานรอง |
|---|---|---|
| ซ่อมแซมพื้นที่เก็บข้อมูลการผลิต | SWE-bench หรือชุดปัญหาภายใน | อัตราการผ่านการทดสอบ เวลาในการทบทวน อัตราการย้อนกลับ |
| ทำการแก้ไขหลายภาษาที่สะอาดตา | การประเมินการแก้ไขแบบ Aider | ขนาดส่วนต่าง ลูปการแก้ไข ต้นทุนต่อการเปลี่ยนแปลงที่ยอมรับ |
| แก้ไขปัญหาอัลกอริทึมใหม่ | การทดสอบสไตล์ LiveCodeBench | อัตราการรวบรวม ระยะเวลาในการแก้ปัญหา การตรวจสอบการปนเปื้อน |
| ดำเนินการตัวแทนเทอร์มินัล | งานสไตล์ Terminal-Bench | การแจ้งเตือนการอนุญาต อัตราการฟื้นตัว อัตราการครอบครองของมนุษย์ |
| เลือกแบบจำลองการให้เหตุผล | เกณฑ์มาตรฐานทางคณิตศาสตร์/วิทยาศาสตร์ที่ตรงกับโดเมน | การสอบเทียบ คุณภาพการอ้างอิง ความรุนแรงของข้อผิดพลาด |
ไดเร็กทอรีโมเดล AI เป็นจุดเริ่มต้นตามรูปแบบบัญญัติสำหรับแผนผังการตัดสินใจนี้ ควรนำผู้อ่านไปสู่การเปรียบเทียบเฉพาะงาน แทนที่จะกล่าวอ้างทั่วไปว่าเป็น "แบบจำลองที่ดีที่สุด"
เผยแพร่บัญชีแยกประเภทหลักฐาน
บัญชีแยกประเภทหลักฐานทำให้สามารถตรวจสอบการรีเฟรชได้ บันทึกขั้นต่ำมีลักษณะดังนี้:
textscore: 58.6% benchmark: SWE-Bench Pro source_type: vendor-reported source_url: https://example.com/model-card model: Example Model 1.0 scaffold: vendor agent, test execution enabled checked_at: 2026-08-20 reproducible: no public harness decision_use: directional signal only
ฟิลด์
decision_useรีเฟรชจังหวะและควบคุมการเปลี่ยนแปลง
ใช้การตรวจสอบ 7 วันสำหรับการเผยแพร่โมเดลที่ไม่สมบูรณ์ การตรวจสอบความสมบูรณ์ของแหล่งที่มาและลิงก์ 14 วัน และการตรวจสอบ 28 วันสำหรับหน้าการเปรียบเทียบทั้งหมด การรีเฟรชควรอัปเดตวันที่แหล่งที่มา ตารางคะแนน คำเตือน และข้อสรุปร่วมกัน
อย่าอัปเดตคะแนนโดยไม่อัปเดตร้อยแก้วที่อยู่รอบๆ แถวลีดเดอร์บอร์ดใหม่สามารถเปลี่ยนคำแนะนำได้แม้ว่าแผนภูมิจะยังดูคุ้นเคยก็ตาม เก็บ คู่มือการใช้งาน Claw Code ไว้ใกล้ๆ เมื่อมีการใช้การเปรียบเทียบเพื่อเลือกเวิร์กโฟลว์ของตัวแทน แทนที่จะเป็นโมเดล API แบบดิบ
บรรทัดล่าง
การเปรียบเทียบเกณฑ์มาตรฐานที่มีประโยชน์คือเครื่องมือวิจัยขนาดเล็ก โดยตั้งชื่องาน รักษาคลาสต้นทาง บันทึกโครงสร้าง แสดงวันที่ และอธิบายสิ่งที่คะแนนไม่สามารถพิสูจน์ได้ ซึ่งช้ากว่าการคัดลอกพาดหัวข่าวลีดเดอร์บอร์ด แต่จะสร้างการตัดสินใจที่สามารถอยู่รอดได้ในการเปิดตัวโมเดลครั้งถัดไป