Mistral AI เปิดตัว Mistral Large 4 โมเดลล้านล้านพารามิเตอร์ ชูจุดเด่นด้านโค้ดและไซเบอร์

Mistral AI เปิดตัว Mistral Large 4 โมเดลล้านล้านพารามิเตอร์ ชูจุดเด่นด้านโค้ดและไซเบอร์

รูปภาพเพื่อช่วยให้เข้าใจบทความ

Mistral Large 4 เปิดให้ทดลองผ่าน API

Mistral AI บริษัทปัญญาประดิษฐ์จากฝรั่งเศส เปิดตัว Mistral Large 4 เมื่อวันที่ 6 ตุลาคม 2026 ตามเวลาท้องถิ่น โดยใช้ชื่อเล่นว่า “le Chonk” โมเดลนี้มีพารามิเตอร์รวม 1 ล้านล้านตัว แต่จะเรียกใช้งาน 49,000 ล้านตัวในแต่ละครั้งตามสถาปัตยกรรมแบบผู้เชี่ยวชาญผสม หรือ Mixture of Experts บริษัทวางตำแหน่งให้รองรับงานสำคัญทั้งเอเจนต์เขียนโค้ด งานความรู้ ความมั่นคงปลอดภัยไซเบอร์ และการให้เหตุผลจากตำแหน่งของวัตถุในภาพ

โมเดลใช้รหัส mistral-large-4-0 และเปิดให้เข้าถึงผ่าน API รุ่นพรีวิวใน Mistral Studio ค่าบริการอยู่ที่ 1.36 ดอลลาร์สหรัฐต่อโทเคนขาเข้า 1 ล้านโทเคน และ 4.18 ดอลลาร์ต่อโทเคนขาออก 1 ล้านโทเคน ขณะเปิดตัว บริษัทยังไม่ได้เผยแพร่ค่าน้ำหนักของโมเดล แต่กำหนดเปิดในวันที่ 27 ตุลาคม หลังผ่านช่วงทดสอบประมาณ 3 สัปดาห์

Mistral Large 4 ฝึกด้วยจีพียู Nvidia Grace Blackwell จำนวน 4,000 ตัวเป็นเวลาราว 2 เดือน รองรับมากกว่า 160 ภาษา รับข้อมูลได้หลายรูปแบบ แต่ส่งผลลัพธ์เป็นข้อความเท่านั้น และอยู่ภายใต้สัญญาอนุญาตเฉพาะของ Mistral ปัจจุบันผู้ใช้เข้าถึงได้เฉพาะพรีวิวสาธารณะและช่องทางที่มีมาตรการควบคุมความปลอดภัย

Mistral AI ระบุว่าจะทำงานร่วมกับพันธมิตรที่เชื่อถือได้และหน่วยงานรัฐบาล พร้อมทดสอบความปลอดภัยก่อนปล่อยค่าน้ำหนัก เพื่อให้โมเดลถูกนำไปใช้ในงานป้องกันมากกว่าการโจมตีที่มุ่งร้าย ก่อนหน้านี้บริษัทระดมทุนได้ 3,000 ล้านยูโรเมื่อเดือนกันยายน ด้วยมูลค่ากิจการ 21,000 ล้านยูโร

ผลทดสอบด้านโค้ดและงานอัตโนมัติ

ผลที่ Mistral AI เปิดเผยระบุว่า Mistral Large 4 ทำคะแนน DeepSWE v1.1 ได้ 61.7% สูงกว่า DeepSeek V4 Pro 0813 ส่วน Terminal Bench 4.0 ได้ 28.3% เหนือ Qwen3.8 Max และ SWE-Atlas-QnA ได้ 59.4% สูงกว่าโมเดลคู่แข่งที่บริษัทติดตาม เมื่อรวมเป็น Coding Agent Index โมเดลได้ 49.8% เหนือทั้ง DeepSeek V4 Pro และ Qwen3.8 Max

อย่างไรก็ตาม ผลประเมินแบบปกปิดชื่อโมเดลโดยมนุษย์ของ Surge AI ให้คะแนน Mistral Large 4 ที่ 3.74 จาก 5 คะแนน ต่ำกว่า Claude Opus 5 ซึ่งได้ 4.22 คะแนน ขณะที่ผลรวบรวม DeepSWE v1.1 อีกชุดระบุว่า Mistral Large 4 ได้ 62% เทียบกับ GLM-5.3 ที่ 61%, DeepSeek V4 Pro 0813 ที่ 57% และ Qwen 3.8 Max ที่ 51% แต่ GPT-6 Astra, Gemini 3.8 Flash และ Claude Opus 5 ทำได้ราว 74% ภายใต้การตั้งค่าที่ดีที่สุดซึ่งเปิดเผยต่อสาธารณะ

ในด้านระบบงานอัตโนมัติ บริษัทระบุว่าโมเดลได้คะแนน AutomationBench 59.9% สูงกว่า Kimi K3, MiMo-V2.6-Pro และ DeepSeek V4 Pro ส่วน AA-Briefcase ซึ่งวัดความสามารถในงานความรู้ ให้คะแนน Elo ที่ 1,393 เหนือ DeepSeek V4 Pro การทดสอบ Harvey Legal Agent ให้ Mistral Large 4 ที่ 15% เทียบกับ Kimi K3 ที่ 12.92% และ GLM-5.3 ที่ 8.33% ขณะที่ Finch Finance ให้ Mistral Large 4 และ DeepSeek V4 Pro 0813 เท่ากันที่ 67%

ชูความสามารถด้านไซเบอร์ วิทยาศาสตร์ และภาพ

Mistral AI ระบุว่า Mistral Large 4 ติด 5 อันดับแรกของโลกใน AA Cyber Index และได้คะแนนรวม Cybench 93% สูงกว่าโมเดลโอเพนเวตชั้นนำ ซึ่งหมายถึงโมเดลที่เปิดให้ดาวน์โหลดค่าน้ำหนักไปใช้งานได้ นอกจากนี้ยังได้คะแนนต้านทานการโจมตี 93.3% ใน B3 Security Benchmark และได้ 1.691 จาก 2 คะแนนในการประเมินการตอบสนองอย่างรับผิดชอบของ KORA Benchmark สูงกว่า GLM-5.2, GLM-5.3 และโมเดลตระกูล Kimi

ด้านการวิเคราะห์ภาพ โมเดลทำคะแนน Dense 200 ซึ่งทดสอบการให้เหตุผลเกี่ยวกับตำแหน่งในภาพได้ 42% สูงกว่า GPT-6 Astra ที่ 41% และทำได้ 73% ใน DIOR-RSVG ส่วน SciCode-Verified บริษัทระบุว่าโมเดลอยู่ในกลุ่มผลงานดีที่สุดของบรรดาโมเดลโอเพนเวต

อาร์ทูร์ เมนช์ ประธานเจ้าหน้าที่บริหารของ Mistral AI กล่าวว่า โมเดลที่เปิดตัวครั้งนี้นำหน้าโมเดลจากจีนในบางด้าน รวมถึงไซเบอร์ แต่ไม่ได้ระบุว่าเปรียบเทียบกับโมเดลใดหรือใช้วิธีใด

ผลอิสระสะท้อนภาพที่หลากหลาย

การประเมินจาก Vals AI ให้ Mistral Large 4 ได้ 48.05% ± 1.11 ใน Vals Index อยู่อันดับ 32 จาก 44 โมเดล ส่วน Harvey Legal Agent ได้ 15.83% ± 2.96 อยู่อันดับ 6 จาก 75 โมเดล และ Finance Agent v2 ได้ 54.68% ± 0.58 อยู่อันดับ 22 จาก 75 โมเดล

ผลทดสอบอื่นของ Vals AI ได้แก่ Tax Agent Bench ที่ 63.29% ± 3.23 อันดับ 25 จาก 66 โมเดล, EMB ที่ 56.21% ± 3.22 อันดับ 43 จาก 71 โมเดล และ Vibe Code Bench v1.1 ที่ 78.40% ± 3.55 อันดับ 25 จาก 109 โมเดล

ใน Artificial Analysis Intelligence Index โมเดลได้ 38.4 คะแนน อยู่อันดับ 8 ในกลุ่มโอเพนเวต ตามหลัง Xiaomi MiMo-V2.6-Pro ที่ 46.3 คะแนน, Z.ai GLM-5.3 ที่ 44.8 คะแนน และ Moonshot AI Kimi K3 ที่ 43.6 คะแนน แต่เหนือ DeepSeek V4 Pro ที่ 36.0 คะแนน, GLM-5.2 ที่ 33.7 คะแนน และ Motif 3 จากเกาหลีใต้ที่ 33.6 คะแนน ซึ่งก่อนหน้านี้เป็นโมเดลที่แข็งแกร่งที่สุดจากนอกจีนในดัชนีดังกล่าว

สำหรับโมเดลแบบปิด Claude Opus 5.5 ได้ 57.6 คะแนน, GPT-6 Astra ได้ 52.7 คะแนน และ Gemini 4 Argon ได้ 52.6 คะแนน ล้วนสูงกว่า Mistral Large 4 ขณะที่ Artificial Analysis ประเมินต้นทุนต่อหนึ่งงานของโมเดลไว้ที่ 1.13 ดอลลาร์ หรือ 1 ยูโร

ยังอยู่ระหว่างพัฒนาในช่วงพรีวิว

Mistral AI ระบุว่ากระบวนการเรียนรู้แบบเสริมกำลังสำหรับรุ่นพรีวิวยังไม่เสร็จสิ้น และโมเดลยังไม่แสดงสัญญาณว่าประสิทธิภาพถึงจุดอิ่มตัว จึงมีโอกาสปรับปรุงได้อีก ปิแอร์ สต็อก รองประธานฝ่ายวิทยาศาสตร์ของบริษัท กล่าวว่า การฝึกโมเดลใช้ทรัพยากรประมวลผลน้อยกว่าคู่แข่งแบบปิดอย่างมาก และน้อยกว่าคู่แข่งจากจีนประมาณ 2-3 เท่า อย่างไรก็ดี ผลทดสอบบางรายการและคะแนนที่แน่นอนของคู่แข่งบางรายยังไม่ได้รับการเปิดเผย

Source: Original Korean article - Trendy News Korea

ความคิดเห็น