เซอร์ไพรส์! GPT-5.5 เฉือนชนะ Claude Fable 5 ในเบนช์มาร์กสุดโหดตัวใหม่ 'ALE'
นักวิจัยจาก UC Berkeley เปิดตัว 'Agents’ Last Exam' (ALE) เบนช์มาร์กสุดหินเพื่อทดสอบการทำงานจริงของ AI ผลปรากฏว่า GPT-5.5 จาก OpenAI พลิกโผคว้าอันดับหนึ่งด้วยคะแนนผ่านเพียง 24% เฉือนชนะโมเดลใหม่อย่าง Claude Fable 5 ของ Anthropic ไปได้สำเร็จ สะท้อนให้เห็นว่า AI ยุคปัจจุบันยังคงสอบตกในการทำงานจริงระดับมืออาชีพ

