
รูปภาพเพื่อช่วยให้เข้าใจบทความ
Anthropic เปิดตัว Claude Opus 5.5 เมื่อวันที่ 22 กันยายนตามเวลาท้องถิ่น หรือวันที่ 23 กันยายนตามเวลาเกาหลี โดยเป็นโมเดลแรกในตระกูล 5.5 บริษัทระบุว่าโมเดลใหม่นี้ทำผลงานในงานส่วนใหญ่ได้ใกล้เคียง Claude Fable 5.1 แต่มีต้นทุนการใช้งานต่ำกว่า Opus 5 ราว 40%
ลดราคา API พร้อมเพิ่มความเร็วในการสร้างคำตอบ
Anthropic ระบุว่า Claude Opus 5.5 สร้างผลลัพธ์ได้เร็วกว่า Opus 5 มากกว่า 30% ขณะที่ค่าบริการ API ต่อ 1 ล้านโทเคนอยู่ที่ 4 ดอลลาร์สหรัฐสำหรับข้อมูลนำเข้า และ 20 ดอลลาร์สำหรับผลลัพธ์ ลดลงจาก Opus 5 ซึ่งคิดราคา 5 ดอลลาร์และ 25 ดอลลาร์ตามลำดับ
โมเดลใหม่นี้ให้บริการผ่านแพลตฟอร์ม Claude ของ Anthropic รวมถึง Amazon Web Services หรือ AWS, Google Cloud และ Microsoft Azure โดยใช้รหัสโมเดล API ว่า claude-opus-5-5
ผลทดสอบเขียนโค้ดยังสูสีกับ GPT-6 Astra
ผลประเมิน FrontierCode v1.1 ที่ Anthropic เปิดเผยระบุว่า Opus 5.5 ทำคะแนนได้ 54.4% สูงกว่า GPT-6 Astra ซึ่งได้ 53.3% เล็กน้อย บริษัทกล่าวว่าโมเดลของตนสามารถทำคะแนนเหนือระดับสูงสุดของ Astra ได้แม้ใช้การตั้งค่าความพยายามระดับกลาง และมีต้นทุนต่อภารกิจประมาณหนึ่งในห้า
สำหรับ Terminal-Bench 4.0 บริษัทระบุว่า Opus 5.5 มีประสิทธิภาพใกล้เคียง GPT-6 Astra โดยใช้ต้นทุนราว 40% ของคู่แข่ง ขณะที่ตารางผลทดสอบในการตั้งค่าความพยายามสูงสุดแสดงคะแนน Opus 5.5 ที่ 66.4% เทียบกับ Astra ที่ 57.9%
อย่างไรก็ตาม Astra ยังทำคะแนนสูงกว่าในบางด้าน โดย Terminal-Bench-Science 0.1 ให้ Astra 64.6% และ Opus 5.5 ที่ 58.7% ส่วน AutomationBench อยู่ที่ 41.4% และ 40.0% ตามลำดับ ด้าน CursorBench 4.0 นั้น Opus 5.5 ได้ 57.8% ขณะที่ GPT-5.6 Sol ได้ 41.7% โดยไม่มีการเปิดเผยคะแนนของ Astra
ตัวเลขเปรียบเทียบเหล่านี้มาจากข้อมูลที่แต่ละบริษัทเผยแพร่และยังไม่ได้รับการทำซ้ำอย่างเป็นอิสระ ส่วนการทดสอบโดย Vals AI ซึ่งนำสองโมเดลมาเปรียบเทียบโดยตรง พบว่าประสิทธิภาพเกือบอยู่ในระดับเดียวกัน โดย Astra นำอยู่เล็กน้อย ขณะที่ Digital Applied แนะนำว่า หากคะแนนต่างกันไม่ถึง 5 จุด ยังไม่ควรสรุปผลแพ้ชนะจนกว่าจะผ่านการทดสอบใช้งานจริง พร้อมประเมินว่า Opus 5.5 ได้เปรียบด้านราคาและแบบทดสอบร่วมส่วนใหญ่ แต่ Astra ยังนำในงานอัตโนมัติและงานวิทยาศาสตร์
อ้างความปลอดภัยดีขึ้น แต่ยอมรับข้อจำกัดของการประเมิน
Anthropic ระบุว่า Opus 5.5 ทำคะแนนสูงที่สุดในบรรดาโมเดลของบริษัทจากการตรวจสอบพฤติกรรมอัตโนมัติ โดยความพยายามทำสิ่งที่อยู่นอกขอบเขตที่อนุญาตลดลงราว 85% เมื่อเทียบกับ Opus 5 และมีอัตราความสำเร็จของการโจมตีแบบพรอมป์อินเจ็กชันต่ำที่สุดในระดับเดียวกับ Fable 5.1 นอกจากนี้ งานที่เกี่ยวข้องกับความมั่นคงปลอดภัยไซเบอร์และชีววิทยาจะถูกส่งต่อไปยังโมเดลอื่นผ่านระบบป้องกันที่กำหนดไว้
บริษัทเปิดเผยข้อจำกัดของการทดสอบด้วย โดยยอมรับว่าการสร้างระบบประเมินที่สามารถตรวจพบความล้มเหลวทุกกรณีได้อย่างน่าเชื่อถือก่อนนำโมเดลออกใช้งานยังเป็นปัญหาที่ยังไม่มีคำตอบ พร้อมระบุว่าพบสัญญาณว่า Opus 5.5 มักสงสัยว่าตนกำลังอยู่ในสถานการณ์การประเมิน ซึ่งอาจมีผลต่อการตีความผลทดสอบ
เปิดตัวหลังซีอีโอเสนอให้ชะลอจังหวะพัฒนา AI
Claude Opus 5.5 เป็นโมเดลแรกที่ Anthropic เปิดตัวหลังดาริโอ อาโมเดอี ประธานเจ้าหน้าที่บริหารของบริษัท แสดงจุดยืนว่าควรปรับจังหวะความก้าวหน้าด้านขีดความสามารถของ AI เพื่อเปิดเวลาให้มาตรการป้องกันความเสี่ยงพัฒนาได้ทัน
ก่อนหน้านี้ OpenAI เปิดให้ใช้งาน GPT-6 Astra แบบจำกัดเมื่อวันที่ 3 กันยายน ขณะที่ Anthropic เปิดตัว Claude Fable 5.1 และ Claude Mythos 5.1 ในช่วงต้นเดือนเดียวกัน การแข่งขันครั้งนี้จึงไม่ได้วัดเฉพาะคะแนนความสามารถของโมเดล แต่ยังรวมถึงต้นทุน ความเร็ว และความน่าเชื่อถือของระบบประเมินความปลอดภัยด้วย
ความคิดเห็น
แสดงความคิดเห็น