DeepSeek ปล่อยโมเดล DeepSeek V4.1 Flash โมเดลขนาดกลางระหว่าง V4 Pro กับ V4 Flash เดิม แต่กลับมีต้นทุนการให้บริการต่ำ ทำให้ค่าโทเค็นมีราคาถูกและโดยเฉพาะค่าแคชมีราคาถูกมากเนื่องจากปริมาณหน่วยความจำที่ใช้เก็บแคชแต่ละโทเค็นนั้นเล็กลงมาก
ในแง่ของความเก่งโมเดล DeepSeek V4.1 Flash ทำคะแนนทดสอบได้ดีกว่า DeepSeek V4 Pro แทบทุกรายการ คะแนนทดสอบขึ้นไปเทียบชั้นกับ GLM-5.3, Kimi K3, หรือแม้แต่ Claude Opus 5
สถาปัตยกรรมของโมเดลเป็นแบบ 552B-A8B/A16B โดยช่วง prefill (ประมวลพรอมต์เดิม) จะใช้พารามิเตอร์ 8B และช่วง decode (สร้างโทเค็นใหม่) ใช้พารามิเตอร์ 16B ส่วน Compressed Sparse Attention 2 (CSA2) ใช้ร่วมกับ FP4 KV Caching ทำให้หน่วยความจำที่ใช้ในการแคชโทเค็นเหลือเพียง 890 ไบต์ต่อโทเค็นเล็กกว่า DeepSeek V4 Flash ถึง 4 เท่าตัว ความประหยัดแรมเช่นนี้ทำให้ค่าแคชของโมเดลเหลือเพียง 1/50 ของค่าอินพุตเท่านั้น ทำให้การรันงานแบบ agentic ถูกลงอย่างมาก
ตอนนี้ DeepSeek เริ่มให้บริการ V4.1 Flash แล้ว โดยผู้ที่ซื้อ API จาก DeepSeek โดยตรงจะใช้โมเดลนี้แทนที่ DeepSeek V4 Pro ไปเลยโดยไม่ต้องคอนฟิกอะไรเพิ่มเติม ราคาเต็มของ API อยู่ที่ 0.3/1.2 ดอลลาร์ต่อล้านโทเค็น และแคช 0.006 ดอลลาร์ต่อล้านโทเค็น
ที่มา - @deepseek_ai

on