Google DeepMind เปิดตัว EmbeddingGemma 2 โมเดล AI เปิด รองรับข้อความ ภาพ วิดีโอ และเสียงในระบบเดียว

Google DeepMind เปิดตัว EmbeddingGemma 2 โมเดล AI เปิด รองรับข้อความ ภาพ วิดีโอ และเสียงในระบบเดียว

รูปภาพเพื่อช่วยให้เข้าใจบทความ

Google DeepMind เปิดตัวโมเดล AI มัลติโมดอลรุ่นใหม่

Google DeepMind เปิดตัว EmbeddingGemma 2 โมเดลปัญญาประดิษฐ์แบบโอเพนซอร์สที่สามารถเปลี่ยนข้อมูลจากหลายรูปแบบ ทั้งข้อความ ภาพ วิดีโอ และเสียง ให้เป็นข้อมูลเวกเตอร์สำหรับการค้นหาและประมวลผลในโมเดลเดียว โดยประกาศเมื่อวันที่ 6 ตุลาคม 2026 ตามเวลาท้องถิ่น

โมเดลนี้มีขนาดรวม 740 ล้านพารามิเตอร์ และเปิดให้ดาวน์โหลดฟรีผ่าน Hugging Face และ Kaggle ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานเชิงพาณิชย์ได้ โดยรหัสโมเดลที่เผยแพร่คือ google/embeddinggemma-2

Google ระบุว่า EmbeddingGemma 2 เป็นหนึ่งในโมเดลโอเพนซอร์สด้านมัลติโมดอลเอมเบดดิงที่มีประสิทธิภาพสูงในกลุ่มเดียวกัน และเตรียมนำไปให้ใช้งานผ่าน Model Garden ของ Gemini Enterprise Agent Platform รวมถึงรองรับเครื่องมือประมวลผลอย่าง vLLM, llama.cpp และ Ollama

ออกแบบให้ทำงานบนอุปกรณ์ได้ ลดการพึ่งพาคลาวด์

โครงสร้างของ EmbeddingGemma 2 ประกอบด้วยส่วนประมวลผลข้อความขนาด 270 ล้านพารามิเตอร์ ตัวเข้ารหัสภาพ 170 ล้านพารามิเตอร์ และตัวเข้ารหัสเสียง 300 ล้านพารามิเตอร์ รวมทั้งหมด 740 ล้านพารามิเตอร์ นอกจากนี้ยังมีรุ่นที่ประมวลผลเฉพาะข้อความขนาด 270 ล้านพารามิเตอร์ด้วย

โมเดลรองรับบริบทขนาด 8K โทเคน และสร้างเวกเตอร์ขนาด 768 มิติ โดยใช้เทคนิค Matryoshka ที่ช่วยลดขนาดเวกเตอร์ลงเหลือ 512, 256 หรือ 128 มิติได้ตามความต้องการใช้งาน

Google เปิดเผยว่าหลังใช้เทคนิคควอนไทซ์ โมเดลสามารถทำงานบนอุปกรณ์ได้ โดยบน Google Pixel 11 Pro ใช้หน่วยความจำประมาณ 191MB สำหรับงานข้อความ และประมาณ 567MB เมื่อเปิดใช้ความสามารถมัลติโมดอลทั้งหมด นอกจากนี้ยังมีแอปจดบันทึกการประชุมบน Mac ที่ทำงานแบบโลคัลโดยไม่ต้องเชื่อมต่ออินเทอร์เน็ต โดยใช้ EmbeddingGemma 2 ขนาด 740M เพื่อช่วยจัดระเบียบข้อมูลจากการประชุม

ผลทดสอบและข้อจำกัดของโมเดล

Google ระบุผลการทดสอบโดยเปรียบเทียบกับ EmbeddingGemma รุ่นแรก โดยในมาตรฐาน MTEB Code (NDCG@10) EmbeddingGemma 2 ได้คะแนน 78.68 สูงกว่ารุ่นก่อนที่ได้ 68.76 คะแนน ขณะที่การทดสอบ MTEB ด้านข้อความหลายภาษา Mean(Task) ได้ 61.36 คะแนน ใกล้เคียงกับรุ่นแรกที่ 61.15 คะแนน

สำหรับการประเมินด้านภาพ วิดีโอ และเสียง Google เปิดเผยคะแนนเพิ่มเติม ได้แก่ MIEB(lite) ด้านภาพ 64.64 คะแนน, MMEB v2 Video Hit@1 ด้านวิดีโอ 50.67 คะแนน และ MSEB Retrieval MRR@10 ด้านการค้นหาเสียง 69.54 คะแนน อย่างไรก็ตาม ตัวเลขเหล่านี้ไม่ได้มีการเปรียบเทียบกับรุ่นก่อนหน้าหรือโมเดลจากบริษัทอื่นในข้อมูลที่เผยแพร่

Google ระบุว่าโมเดลนี้ให้ผลลัพธ์ที่โดดเด่นในกลุ่มโมเดลมัลติโมดอลที่มีขนาดต่ำกว่า 1 พันล้านพารามิเตอร์ แต่เอกสารเปรียบเทียบที่เผยแพร่ยังเน้นการเทียบกับ EmbeddingGemma 1 เป็นหลัก

บริษัทเตือนว่าการลดเวกเตอร์ลงเหลือ 128 มิติอาจทำให้คุณภาพลดลง โดยเฉพาะงานค้นหาภาพ วิดีโอ และเสียง ซึ่งอาจลดลงเหลือประมาณ 75% ของคุณภาพเดิม ขณะที่ขนาด 256 มิติยังคงรักษาคุณภาพได้ใกล้เคียงเดิม Google แนะนำให้นักพัฒนาทดสอบกับข้อมูลจริงก่อนนำไปใช้งาน

เอกสารของโมเดลยังระบุข้อจำกัด เช่น การประมวลผลเสียงรองรับได้ประมาณ 5.5 นาทีต่อครั้ง งานข้อความอาจมีคุณภาพลดลงหากไม่ใช้คำนำหน้าการทำงานที่แนะนำ และควรใช้ความแม่นยำแบบ bfloat16 หรือ float32 แทน float16 นอกจากนี้ Google ระบุว่าโมเดลไม่ได้รับประกันประสิทธิภาพเท่ากันในทุกภาษาที่รองรับ และอาจสะท้อนอคติทางสังคมหรือวัฒนธรรมจากข้อมูลที่ใช้ฝึก

Source: Original Korean article - Trendy News Korea

ความคิดเห็น