
รูปภาพเพื่อช่วยให้เข้าใจบทความ
Anthropic เปิดตัว Claude Sonnet 5.5 เมื่อวันที่ 28 กันยายน 2569 ตามเวลาท้องถิ่น โดยวางจุดขายไว้ที่คะแนนทดสอบซึ่งสูงกว่า Sonnet รุ่นก่อน ควบคู่กับความคุ้มค่าด้านต้นทุน บริษัทระบุว่าแม้ใช้งานด้วยการตั้งค่าระดับความพยายามต่ำหรือปานกลาง โมเดลใหม่ก็สามารถทำคะแนนเหนือระดับสูงสุดของ Sonnet 5 ได้ด้วยต้นทุนต่อภารกิจที่ต่ำกว่าประมาณ 10 เท่า
ค่าบริการและช่องทางใช้งาน
โมเดลใหม่นี้ใช้รหัส claude-sonnet-5-5 และเปิดให้บริการผ่าน Claude Platform รวมถึง AWS, Google Cloud และ Microsoft Azure โดยรองรับการตั้งค่าแบบไม่เก็บรักษาข้อมูล
ค่าบริการ API อยู่ที่ 2 ดอลลาร์สหรัฐต่อโทเค็นขาเข้า 1 ล้านโทเค็น และ 10 ดอลลาร์ต่อโทเค็นขาออก 1 ล้านโทเค็น ส่วนการอ่านข้อมูลจากแคชคิด 0.20 ดอลลาร์ต่อ 1 ล้านโทเค็น และการเขียนแคชอยู่ที่ 2.50 ดอลลาร์ VentureBeat รายงานว่าอัตราดังกล่าวเท่ากับ GPT-6 Sol และต่ำกว่า Opus 5.5 ซึ่งคิดค่าขาเข้า 4 ดอลลาร์และขาออก 20 ดอลลาร์
ด้าน SiliconANGLE รายงานว่า Claude Sonnet 5.5 สร้างผลลัพธ์เร็วขึ้นจากรุ่นก่อน 30% ใช้โทเค็นลดลง และทำให้ต้นทุนการใช้งานจริงต่ำลงประมาณ 30%
คะแนนทดสอบจาก Anthropic
จากผลที่บริษัทเปิดเผย Sonnet 5.5 ทำคะแนน Terminal-Bench 4.0 ได้ 70.6% สูงกว่า Sonnet 5 ที่ 10.3% และ Opus 5.5 ที่ 66.4% ส่วน FrontierCode 1.1 Main ภายใต้การตั้งค่า Max effort ทำได้ 46.2% สูงกว่า Sonnet 5 ซึ่งได้ 42.4% แต่ยังตามหลัง Opus 5.5 ที่ 54.4% และ GPT-6 Sol ที่ 49.3%
ในการทดสอบ GDPval-AA v2.1 โมเดลใหม่ได้ 1,844 คะแนน ใกล้เคียง Opus 5.5 ที่ 1,846 คะแนน และสูงกว่า Sonnet 5 กับ GPT-6 Sol ซึ่งได้ 1,449 และ 1,487 คะแนนตามลำดับ ขณะที่ Humanity's Last Exam ทำได้ 64.5% เทียบกับ Sonnet 5 ที่ 54.9% และ Opus 5.5 ที่ 67.7%
สำหรับ OSWorld 2.1 Sonnet 5.5 ได้ 80.1% สูงกว่า Sonnet 5 ที่ 57.0% แต่ต่ำกว่า Opus 5.5 ซึ่งได้ 81.8% ทั้งนี้ ตารางของ Anthropic แสดงให้เห็นว่า Opus 5.5 ยังนำหน้าใน FrontierCode, CursorBench, GDPval-AA, AA-Briefcase และ Humanity's Last Exam โดยบริษัทยอมรับว่า Opus 5.5 ยังแข็งแกร่งกว่าอย่างชัดเจนสำหรับงานซับซ้อนแบบปลายเปิดที่ต้องใช้วิจารณญาณต่อเนื่อง
ผลประเมินอิสระชี้ทั้งจุดเด่นและข้อจำกัด
Artificial Analysis ให้ Sonnet 5.5 ได้ 56 คะแนนใน Intelligence Index รั้งอันดับ 3 จากโมเดล 216 รุ่น และสูงกว่าค่ามัธยฐานที่ 26 คะแนน ต้นทุนต่อภารกิจที่วัดได้อยู่ที่ 7.60 ดอลลาร์ ขณะที่โมเดลสร้างโทเค็นขาออกรวม 410 ล้านโทเค็น เทียบกับค่ามัธยฐาน 88 ล้านโทเค็น ทำให้หน่วยงานดังกล่าวประเมินว่าโมเดลนี้ให้คำตอบยืดยาวมาก
ความเร็วในการสร้างผลลัพธ์อยู่ที่ 141.9 โทเค็นต่อวินาที จัดเป็นอันดับ 28 จาก 216 รุ่น ส่วนระยะเวลารอจนถึงโทเค็นแรกอยู่ที่ 353.32 วินาที
Vals AI ให้คะแนน Vals Index แก่ Sonnet 5.5 ที่ 69.22% บวกลบ 0.96 รั้งอันดับ 2 จาก 66 โมเดล ตามหลัง Claude Opus 5.5 ซึ่งได้ 69.69% อยู่ 0.47 จุด อย่างไรก็ตาม ต้นทุนต่อการทดสอบของ Sonnet 5.5 อยู่ที่ 20.80 ดอลลาร์ ต่ำกว่า Opus 5.5 ที่ 32.77 ดอลลาร์
โมเดลใหม่ยังมีข้อจำกัดในการทดสอบเฉพาะทาง โดยได้ 59.58% ใน CyberBench อยู่อันดับ 31 จาก 41 โมเดล และทำได้ 2.92% ใน Harvey's Legal Agent Benchmark อยู่อันดับ 36 จาก 70 โมเดล
เสียงจากผู้ใช้งานและมาตรการความปลอดภัย
Yashodha Bhavnani รองประธานของ Box ให้ข้อมูลผ่าน VentureBeat ว่า Sonnet 5.5 ทำงานเร็วขึ้น 2.4 เท่า และใช้โทเค็นรวมน้อยลง 12% ขณะที่ผู้อำนวยการฝ่าย AI ของ Zendesk ระบุกับ SiliconANGLE ว่าความเร็วในการจัดการทิกเก็ตเพิ่มขึ้น 20% ช่วยให้ลูกค้าได้รับความช่วยเหลือโดยไม่ต้องรอนาน นอกจากนี้ SiliconANGLE ยังรายงานว่าโมเดลดังกล่าวเป็น Sonnet รุ่นแรกที่สามารถเล่นเกม Pokémon Red จบได้โดยอาศัยเพียงภาพหน้าจอ
Anthropic ระบุว่ามาตรการด้านความปลอดภัยทางชีวภาพอาจปิดกั้นคำขอบางประเภทในสาขาจุลชีววิทยาและไวรัสวิทยาโดยผิดพลาดได้ ส่วน SiliconANGLE รายงานว่าระบบป้องกันอาจทำงานเมื่อพบเนื้อหาด้านความมั่นคงไซเบอร์ ชีววิทยา หรือเนื้อหาอ่อนไหว แต่ไม่น่ากระทบงานพัฒนาซอฟต์แวร์และงานวิทยาศาสตร์ชีวภาพส่วนใหญ่
ความคิดเห็น
แสดงความคิดเห็น