สมุดปกขาวสำหรับการเปรียบเทียบมาตรฐาน · ฉบับสาธารณะ
ราคาของคำตอบที่ถูกต้อง
ผู้ให้บริการ AI เจ็ดราย คำถามเชิงวิเคราะห์ 25 ข้อ ฐานข้อมูลการผลิตสดที่มีข้อมูลจำนวน 381,523 แถว เราได้ทำการวัดผลว่าคำตอบที่ถูกต้องนั้นมีต้นทุนที่แท้จริงเท่าใด และอันดับที่ได้ก็ไม่ได้เป็นไปตามที่ราคาต่อทิเก็ตระบุไว้
25 / 25
ผู้ให้บริการเพียงรายเดียวในสาขานี้ที่ตอบคำถามทุกข้อได้อย่างถูกต้อง
$0.0046
ต้นทุนต่อคำตอบที่ถูกต้องจากเอเจนต์ Oriona
17.5 เท่า
ราคาที่โมเดล Frontier ที่แพงที่สุดคิดค่าบริการสำหรับคำตอบที่ถูกต้องแบบเดียวกัน
ตัวอย่างของผลลัพธ์
ราคาไม่ได้ช่วยซื้อความถูกต้อง
ในกลุ่มโมเดลแบบดิบ (raw models) ค่าใช้จ่ายต่อคำตอบที่ถูกต้องมีความแตกต่างกันถึงประมาณ 90 เท่าระหว่างรุ่นที่ถูกที่สุดและแพงที่สุด ทว่าความแม่นยำกลับต่างกันเพียง 8 คะแนนเท่านั้น โดยการรัน Oriona ทั้งหมดมีค่าใช้จ่ายเพียง $0.114
ผู้ให้บริการ
ถูกต้อง
ต้นทุน / ถูกต้อง
พบ โอริโอนา
ตัวแทน Oriona
25 / 25
$0.0046
1.0 เท่า
GPT-5.5 (เวอร์ชันดิบ)
24 / 25
$0.0441
9.7 เท่า
Claude Opus 4.8 (เวอร์ชันดิบ)
24 / 25
$0.0489
10.7 เท่า
Claude Sonnet 5 (เวอร์ชันดิบ)
23 / 25
$0.0797
17.5 เท่า
Kimi K2.7 (ดิบ)
23 / 25
$0.0089
1.9 เท่า
DeepSeek V4 Pro (เวอร์ชันดิบ)
22 / 25
$0.0020
0.4 เท่า
DeepSeek V4 Flash (ดิบ)
22 / 25
$0.0009
0.2 เท่า
การทดสอบครั้งเดียวด้วยคำตอบที่มีการให้คะแนน 175 ข้อ เมื่อวันที่ 7 กรกฎาคม 2026 โมเดลดิบสองโมเดลทำราคาได้ต่ำกว่า Oriona และไม่มีโมเดลใดเลยที่ทำความแม่นยำได้เกิน 95% เอกสารไวท์เปเปอร์ (White Paper) ระบุขีดจำกัดทั้งสามประการของเกณฑ์มาตรฐานนี้ไว้อย่างครบถ้วน
อะไรอยู่ในเอกสารไวท์เปเปอร์
ตารางผลลัพธ์ของผู้ให้บริการทั้งเจ็ดรายแบบเต็ม: ความถูกต้อง, คะแนนจากผู้ประเมิน, ค่าใช้จ่ายทั้งหมด, ค่าใช้จ่ายต่อหนึ่งคำตอบที่ถูกต้อง และเวลาหน่วง (latency)
การออกแบบการเปรียบเทียบมาตรฐาน (Benchmark): ฐานข้อมูลขนาด 381,523 แถว, คำถาม 25 ข้อ และวิธีที่ผู้ให้บริการทุกรายได้รับสิทธิ์การเข้าถึงฐานข้อมูลโดยตรงแบบเดียวกัน
แผนภูมิความคุ้มค่าและความแม่นยำทั้งสองแผนภูมิ รวมถึงขอบเขตประสิทธิภาพ (frontier) ที่แสดงให้เห็นว่าเหตุใดจึงมีผู้ให้บริการเพียงรายเดียวเท่านั้นที่บรรลุความแม่นยำสูงกว่า 95% ด้วยต้นทุนที่ต่ำกว่า 1 เซนต์
รายละเอียดของคำตอบที่ล้มเหลวทั้ง 12 ข้อ และฟีเจอร์โครงสร้างค้ำจุนการเรียนรู้ (Scaffolding) ทั้งสามอย่างที่ช่วยป้องกันรูปแบบความล้มเหลวในแต่ละแบบ
การอ่านอย่างตรงไปตรงมา: โมเดลดิบสองโมเดลที่เอาชนะเราได้ในเรื่องราคา และข้อจำกัดสามประการของเกณฑ์เปรียบเทียบนี้ที่ระบุไว้อย่างครบถ้วน