Alibaba เปิดตัวโมเดลปัญญาประดิษฐ์ใหม่ในตระกูล Qwen2.5 ชื่อว่า Qwen2.5-VL โดย VL ย่อมาจาก Vision Language เป็นรุ่นถัดจาก Qwen2-VL มีความสามารถเข้าใจวิดีโอ รูปภาพ ข้อความ และเป็น Agentic ที่ทำงานแทนได้ด้วย
ตัวอย่างความสามารถที่พิเศษขึ้นของ Qwen2.5-VL เช่น การรู้จักภาพสถานที่ ฉากภาพยนตร์ รายการทีวี สินค้า, สามารถระบุลักษณะวัตถุในภาพตามเงื่อนไข และส่งออกเป็นไฟล์ JSON ได้, ระบุตัวอักษรที่หลากหลายแบบในภาพเดียวได้, สามารถส่งออกไฟล์เอกสารออกมาเป็นฟอร์แมตที่ต้องการได้, สามารถดึงข้อมูลจากวิดีโอออกมาได้ และทำหน้าที่เป็น Agent รันบนคอมพิวเตอร์หรือสมาร์ทโฟนได้
Qwen2.5-VL มี 3 โมเดลย่อยแตกต่างที่ขนาดพารามิเตอร์ได้แก่ 3B, 7B และขนาดใหญ่ที่สุด 72B ดูข้อมูลเพิ่มเติมได้ที่ Hugging Face
ที่มา: Alibaba

ความสามารถของ 72B เทียบกับ Gemini 2 Flash ชนะหลายรายการ

โมเดลเล็ก 7B ก็สูงกว่า GPT-4o Mini ในหลายหัวข้อ

on
เมื่อไร AI model จีน
may2190 Sun, 16/02/2025 - 11:25
เมื่อไร AI model จีน จะเลิกตาม เป็นผู้นำบ้าง
อยากเห็น Feature AI ใหม่ๆ