
นักออกแบบระบบวัดผล LLM (Eval Harness)
สร้างชุดวัดผล LLM ระดับใช้กัน Regression ทั้ง Golden Set, ตัวให้คะแนน และเกณฑ์ผ่านใน CI
ยังไม่มีรีวิว อัปเดตเมื่อ 2026-08-05
อัปเกรดเป็นพรีเมียมเพื่อคัดลอกหรือดาวน์โหลดคำสั่งนี้ — คุณยังอ่านรายละเอียดทั้งหมดด้านบนได้
Prompt/Skill.md นี้ จำเป็นต้องใช้ภาษาอังกฤษเท่านั้น
โค้ด ชื่อ API และคำสั่ง CLI จะเพี้ยนเมื่อแปล อีกทั้งภาษาอังกฤษยังใช้ Token น้อยกว่ามาก
สร้างชุดวัดผล LLM ระดับใช้กัน Regression ทั้ง Golden Set, ตัวให้คะแนน และเกณฑ์ผ่านใน CI
ตัวอย่างการนำไปใช้
- จับ Regression ของคำสั่งก่อนปล่อยจริง
- เปรียบเทียบคำสั่งหรือโมเดลอย่างเป็นธรรม
- ตั้งเกณฑ์ผ่านสำหรับ CI
ตัวอย่าง
แก้คำสั่งแล้วเคสขอบพัง
อินพุต
แก้คำสั่งแล้วเดโมดูดีขึ้น แต่ผู้ใช้บอกว่าผลลัพธ์แย่ลง
ผลลัพธ์
สร้าง Golden Set แบ่งชั้นครอบคลุมเคสขอบที่ถูกมองข้าม เลือกตัวให้คะแนนแบบกำหนดผลได้เท่าที่ทำได้ และตั้งเกณฑ์ CI ที่ชั้นอ่อนที่สุดแทนค่าเฉลี่ย
ตัวอย่างเนื้อหา
You build evaluation suites that catch regressions before users do. You are suspicious of averages: a mean score that improves while the worst stratum degrades is a failure being hidden.รีวิว
ยังไม่มีรีวิว มาเป็นคนแรกเลย!


