Image

Large Language Model

By mk Founder on Tag: Claude, LLM, Anthropic
Claude

Anthropic เปิดตัวโมเดล Claude Opus 4.1 เวอร์ชันอัพเกรดจาก Claude Opus 4 ที่เปิดตัวในเดือนพฤษภาคม

Claude Opus 4.1 อัพเกรดฟีเจอร์ด้านการเขียนโค้ด (ซึ่ง Claude เก่งอยู่แล้ว) ตอนนี้ทำคะแนนเบนช์มาร์ค SWE-bench Verified เพิ่มเป็น 74.5% เทียบกับของเดิม 72.5%

นอกจากนี้ Claude Opus 4.1 ยังเก่งขึ้นเรื่องการค้นคว้าข้อมูลเชิงลึก (deep research), การวิเคราะห์ข้อมูล และการทำงานแบบ agentic ด้วย

Claude Opus 4.1 เปิดให้เช่าใช้งานแล้วผ่าน Claude Code, Claude API, Google Vertex AI, Amazon Bedrock โดยคิดราคาเท่ากับ Claude Opus 4

By lew Founder on Tag: OpenAI, LLM
OpenAI

OpenAI เปิดโมเดลปัญญาประดิษฐ์แบบเปิด gpt-oss-120b และ gpt-oss-20b โดยเน้นการใช้งานชิปเดียว โดยรุ่น 120B ต้องการชิป H100 และรุ่น 20B สามารถรันในชิปกราฟิกตามบ้านได้

By arjin Writer on Tag: Kaggle, Google, Artificial Intelligence, DeepMind, LLM
Kaggle

กูเกิลเปิดตัวแพลตฟอร์มสำหรับทดสอบความสามารถโมเดลปัญญาประดิษฐ์แบบเปิดเผยต่อสาธารณะ ด้วยการเล่นเกมแข่งกัน Kaggle Game Arena ซึ่งเป็นความร่วมมือของ DeepMind แผนกปัญญาประดิษฐ์ของกูเกิล และ Kaggle ชุมชน Data Science ที่เป็นหน่วยงานของกูเกิลเช่นกัน

กูเกิลอธิบายว่ารูปแบบการทดสอบความสามารถโมเดล AI ปัจจุบันมักจำกัดเฉพาะหัวข้อ แม้โมเดล AI จะทำคะแนนได้สูงก็ไม่สามารถพิสูจน์ได้ชัดว่าคิดเองหรือจำคำตอบมา แนวทางของกูเกิลคือสร้างรูปแบบทดสอบที่สะท้อนว่าโมเดลสามารถคิดได้รอบด้านขึ้นจริง มีสภาพแวดล้อมของคำถามที่ไม่ตายตัว มีเป้าหมายที่ปรับได้ตลอด เป็นการทดสอบความคิดวางแผนระยะยาว การวัดผลด้วยเกมจึงตอบโจทย์เรื่องนี้

By lew Founder on Tag: Qwen, LLM, Alibaba Cloud
Qwen

LM Arena เว็บทดสอบประสิทธิภาพปัญญาประดิษฐ์แบบทดลองจากผู้ใช้ รายงานผลการทดสอบ Qwen3-235B-A22B-Instruct-2507 ที่เพิ่งอัพเดตไป ได้ผลแซงหน้า Grok-4 ไปเล็กน้อย ทำให้ตอนนี้มันเป็นโมเดลแบบเปิดที่อันดับสูงสุด

ก่อนหน้านี้โมเดลที่อยู่ใน 10 อันดับแรกและเป็นโมเดลเปิด เช่น Kimi K2 และ DeepSeek-R1 แต่ผลทดสอบก็มีระยะห่างกับโมเดลปิดตัวอื่นๆ

By mk Founder on Tag: Gemini, Google, LLM, Mathematics
Gemini

กูเกิลเริ่มเปิดบริการ Gemini 2.5 Deep Think กับลูกค้าแพ็กเกจ Google AI Ultra หลังส่งโมเดลเวอร์ชันใกล้เคียงกันไปสอบคณิตศาสตร์โอลิมปิกแล้วได้เหรียญทอง

โมเดลกลุ่ม Deep Think คือการเปิดโอกาสให้ AI คิดคำตอบได้หลายแนวทาง ถึงแม้ใช้เวลามากกว่า แต่โมเดลมีเวลาสอบทาน ตรวจสอบแนวทางต่างๆ เพื่อให้ตอบคำถามที่ซับซ้อนได้ กูเกิลโชว์ตัวเลขการทดสอบว่า Gemini 2.5 Deep Think ทำผลงานเบนช์มาร์คได้ดีกว่า Gemini 2.5 Pro มาก รวมถึงเอาชนะโมเดลยี่ห้ออื่นๆ เช่น OpenAI o3 และ Grok 4 ได้ทั้งหมด

By lew Founder on Tag: Cerebras, LLM, Programming
Cerebras

Cerebras ผู้พัฒนาชิปที่ผันตัวมาให้บริการ LLM เปิดบริการ Cerebras Code ด้วยโมเดล Qwen3-Coder ที่เริ่มใกล้เคียงกับ Claude 4 Sonnet อย่างไรก็ดี Cerebras ให้บริการโมเดลย่อแบบ FP8 ทำให้ประสิทธิภาพลดลง

จุดขายของ Cerebras Code คือ ความเร็วที่สูงมาก ระดับ 2,000 token/s ทำให้ระยะเวลารอโค้ดสั้นลง นอกจากนี้ยังมีข้อจำกัดเฉพาะโควต้าข้อความรายวันเท่านั้น

แพ็กเกจมีสองระดับ ได้แก่

By lew Founder on Tag: LLM, Programming
LLM

เมื่อวานนี้ OpenRouter เปิดบริการโมเดลแบบปิดบังตัวตนผู้ให้บริการ (stealth mode) ในโมเดลชื่อ Horizon Alpha โดยไม่มีข้อมูลอะไรมากนัก นอกจากว่ามันรองรับอินพุต 256,000 โทเค็น แต่หลังจากหลายคนเริ่มทดสอบก็พบว่าโมเดลนี้ประสิทธิภาพดีมาก โดยเฉพาะงานสายโปรแกรมมิ่ง แถมยังทำงานได้รวดเร็วทำให้การตอบสนองดีมาก

By lew Founder on Tag: KBTG, Programming, LLM
KBTG

KBTG บริษัทเทคโนโลยีในกลุ่มธนาคารกสิกรไทย จัดงานแถลงข่าว Banking on Agentic AI เปิดเผยถึงกระบวนการพัฒนาซอฟต์แวร์ภายในที่เปลี่ยนไป และใช้ Agentic AI มาเป็นส่วนประกอบในการพัฒนาเต็มรูปแบบ ผลที่ได้คือประสิทธิภาพการทำงานเพิ่มขึ้นช่วยลดต้นทุนการทำงานไปได้ถึง 32 ล้านบาท

ระบบช่วยเขียนโค้ดเป็นตัวหนึ่งที่ KBTG ใช้งาน ตัว Agent เชื่อมต่อกับ Jira ภายในของ KBTG ที่นักพัฒนาสามารถสั่งงานให้ปัญญาประดิษฐ์เขียนโค้ดจนเสร็จแล้วส่งงานมาให้รีวิวภายหลัง

By mk Founder on Tag: AMD, LLM, Ryzen, Artificial Intelligence, Llama, Mistral
AMD

AMD โชว์การรันโมเดลภาษาขนาดใหญ่ Llama 4 Scout ขนาดพารามิเตอร์ 109B และ Mistral Large 2411 ขนาด 123B บนพีซีวินโดวส์ที่ใช้ชิป AMD Ryzen AI Max+ 395 แรม 128GB

แม้ต้องใช้ซีพียูตัวแรงสุด และอัดแรมให้เยอะถึง 128GB ซึ่งคนทั่วไปมักไม่ค่อยมีใช้กัน แต่ AMD ก็สามารถปรับแต่งซอฟต์แวร์ Adrenalin Edition WHQL driver เวอร์ชันใหม่ ให้สามารถรันโมเดลขนาดใหญ่สูงสุด 128B บนพีซีได้สำเร็จ

By lew Founder on Tag: LLM, Programming
LLM

Simon Willison โปรแกรมเมอร์สหราชอาณาจักรและผู้ร่วมสร้างเฟรมเวิร์ค Django ทดลองโมเดลปัญญาประดิษฐ์ GLM-4.5-Air ที่เพิ่งเปิดตัวมาเมื่อวานนี้ และพบว่าสามารถใช้งานได้จริงแม้เป็นโมเดลรุ่นย่อก็ตาม

By lew Founder on Tag: Z.ai, LLM, Artificial Intelligence

Z.ai บริษัทปัญญาประดิษฐ์จากปักกิ่งเปิดตัวปัญญาประดิษฐ์ GLM-4.5 โดยชูความสามารถในการเขียนโปรแกรมว่าอยู่ระดับเดียวกับ Kimi K2 ที่กำลังได้รับความนิยมอย่างสูง โดยโมเดลขนาดเล็กลงเหลือเพียง 1 ใน 3 เปิดโอกาสให้ขาย API ในราคาถูกกว่า

GLM-4.5 มีสองรุ่น คือ 335B-A32B และ GLM-4.5-Air 106B-A16B เมื่อเฉลี่ยผลทดสอบ 12 ชุด เช่น MMLU-Pro, GPQA, และชุดทดสอบด้านการเขียนโปรแกรม GLM-4.5 ทำคะแนนรวมระดับเดียวกับ OpenAI o3, Grok 4, หรือ Claude 4 Opus อย่างไรก็ดีหากนับคะแนนด้านการเขียนโปรแกรมอย่างเดียว GLM-4.5 ยังคงแพ้ Claude 4 Sonnet อยู่

By lew Founder on Tag: Anthropic, Claude, LLM
Anthropic

Anthropic ผู้สร้างปัญญาประดิษฐ์ Claude ประกาศเพิ่มเพดานการใช้งานรายสัปดาห์ จากที่ก่อนหน้านี้มีเพดานการใช้งานราย 5 ชั่วโมง หลังจากพบว่าผู้ใช้เปิดรัน agent ต่อเนื่อง

ตอนนี้แพ็กเกจ Max ที่ราคา 200 ดอลลาร์ต่อเดือนสามารถใช้งานได้ 900 ข้อความทุกๆ 5 ชั่วโมง ทำให้มีผู้ใช้สร้างสคริปต์ที่หยุดรันเมื่อครบโควต้าแล้วกลับมารันใหม่ทันทีที่โควต้ากลับมา นอกจากนี้ยังมีผู้ใช้บางส่วนนำบัญชีไปขายแชร์กัน

By lew Founder on Tag: Replit, LLM, Programming
Replit

ปีที่แล้ว Replit เปิดบริการ Replit Agent ที่สามารถเขียนโปรแกรมได้เต็มรูปแบบด้วยตัวเองโดยแทบไม่ต้องโค้ดเลย แต่สัปดาห์ที่ผ่านมา Jason Lemkin ผู้ก่อตั้งบริการ SaaStr ทดลองใช้งาน Replit Agent แล้วพบว่าปัญญาประดิษฐ์ล้างฐานข้อมูลของเขาไปทั้งหมด จนทาง Replit ต้องออกฟีเจอร์มาแก้ปัญหานี้

Jason พบว่า Replit Agent สั่ง npm run db:push ระหว่างทำงานทำให้ฐานข้อมูลหายไปทั้งหมด แม้ว่า Jason จะสั่งให้ห้ามเขียนข้อมูลลงฐานข้อมูลแล้วก็ตาม

By mk Founder on Tag: DeepMind, LLM, Archeology, Google, Natural Language
DeepMind

DeepMind เปิดตัว Aeneas โมเดลทำความเข้าใจภาษาละตินโบราณ ช่วยงานเวลานักโบราณคดีค้นพบโบราณวัตถุ ที่มีข้อความโบราณซึ่งอาจอ่านไม่ออก หรือมีข้อความบางส่วนขาดหายไป

ก่อนหน้านี้ DeepMind มีโมเดลชื่อ Ithaca สำหรับอ่านข้อความภาษากรีกโบราณ และนำมาพัฒนาต่อจนเป็น Aeneas สำหรับภาษาละตินในยุคโรมัน

จุดเด่นของ Aeneas คือการพยากรณ์ข้อความที่ขาดหายไปได้ โดยไม่รู้แม้กระทั่งความยาวของข้อความที่หายไปว่ายาวเท่าไร โมเดลยังรองรับอินพุตแบบ multimodal คือใช้ได้ทั้งภาพและข้อความพร้อมกัน, รองรับ parallel search ค้นหาข้อความลักษณะคล้ายๆ กันในคลังข้อความภาษาละตินโบราณอื่น

By lew Founder on Tag: Alibaba Cloud, Qwen, LLM, Programming
Alibaba Cloud

หลังจาก Alibaba Cloud เปิดตัว Qwen3-235B-A22B-Instruct-2507 ไปเมื่อวานนี้โดยระบุเน้นความสามารถในการเขียนโปรแกรม ตอนนี้ก็ออกโมเดล Qwen3-Coder ชุดโมเดลที่ฝึกสำหรับการเขียนโปรแกรมโดยเฉพาะ ตัวใหญ่ที่สุดคือ Qwen3-Coder-480B-A35B-Instruct มีความสามารถระดับเดียวกับ Claude 4 Sonnet

ชุดข้อมูลที่ใช้ฝึกมีขนาด 7.5T tokens โดย 70% ของชุดข้อมูลเป็นโค้ด และใช้ข้อมูลสังเคราะห์เพิ่มเติม พร้อมกับใช้ Qwen2.5-Coder มาคัดกรองข้อมูลคุณภาพต่ำออกไป จากนั้นฝึกแบบ reinforcement learning (RL) ด้วยปัญหาที่แก้ยากแต่ตรวจง่าย เร่งให้มีความสามารถสูงขึ้นไปอีก

By mk Founder on Tag: Gemini, Google, LLM
Gemini

กูเกิลปรับสถานะโมเดลรุ่นมหาชน Gemini 2.5 Flash-Lite ที่เปิดตัวช่วงกลางเดือนมิถุนายน จากสถานะ Preview มาเป็น General Available (GA) พร้อมใช้งานในระดับโปรดักชันเต็มตัว

By mk Founder on Tag: AMD, Stability AI, NPU, LLM, Artificial Intelligence
AMD

AMD จับมือกับ Stability AI บริษัทเจ้าของโมเดลสร้างภาพ Stable Diffusion ออกโมเดล Stable Diffusion 3 Medium เวอร์ชันปรับแต่งให้รันบน XDNA 2 NPU ของชิป Ryzen ได้จบในตัว ไม่ต้องพึ่งพาเซิร์ฟเวอร์ภายนอกเลย

โมเดล Stable Diffusion 3 Medium เวอร์ชันนี้ถูกปรับแต่งให้ลดหน่วยความจำลง (ตัวโมเดลใช้แรม 9GB) โดยยังรักษาความแม่นยำของทศนิยมแบบ FP16 (เป็น block FP16 หรือ BF16) ทำให้คุณภาพของภาพที่สร้างยังสูงอยู่ ภาพที่ได้เป็นภาพความละเอียดสูง 4MP (2048x2048)

By lew Founder on Tag: Qwen, Alibaba Cloud, LLM
Qwen

ทีม Qwen ของ Alibaba Cloud ปล่อยโมเดล Qwen3-235B-A22B-Instruct-2507 โมเดลปัญญาประดิษฐ์ที่ฝึกเพิ่มจาก Qwen3 ปรับปรุงความสามารถในการทำตามคำสั่ง และเพิ่มความยาวอินพุตรวมเป็น 256K token

ผลทดสอบของโมเดลนี้ในกลุ่มเขียนโปรแกรม อยู่ระดับเดียวกับ Kimi K2 ที่ได้รับความนิยมสูงขึ้นอย่างรวดเร็วในช่วงหลัง คะแนนนี้พัฒนาขึ้นอย่างมากเมื่อเทียบกับ Qwen3 แบบ non-thinking เดิม โดยข้อได้เปรียบของ Qwen3 คือโมเดลขนาดเล็กกว่า และมี activated parameter เพียง 22B ทำให้ต้นทุนการรันต่ำกว่า Kimi K2 ที่มีพารามิเตอร์รวม 1T และรันจริง 32B

By mk Founder on Tag: DeepMind, Gemini, Mathematics, LLM, Artificial Intelligence, Google
DeepMind

การสอบคณิตศาสตร์โอลิมปิก (International Mathematical Olympiad) กลายเป็นสมรภูมิใหม่ของวงการ LLM ไปแล้ว หลัง OpenAI ประกาศว่าโมเดลของตัวเองสอบได้เหรียญทอง ฝั่ง Google DeepMind ก็ประกาศความสำเร็จแบบเดียวกัน

By mk Founder on Tag: OpenAI, Mathematics, LLM, Artificial Intelligence
OpenAI

Alexander Wei นักวิจัยของ OpenAI เปิดเผยว่าโมเดลให้เหตุผลเวอร์ชันทดลอง (experimental) ของบริษัท สามารถสอบคณิตศาสตร์โอลิมปิก (International Math Olympiad หรือ IMO) ได้รางวัลเหรียญทองแล้ว

โมเดลของ OpenAI ตัวนี้ยังไม่เปิดเผยชื่อเรียก ถูกนำไปทำข้อสอบ IMO ปี 2025 ภายใต้เงื่อนไขเดียวกับมนุษย์ นั่นคือ ให้เวลา 4.5 ชั่วโมง 2 เซสชัน และไม่สามารถเข้าถึงอินเทอร์เน็ตได้

Wei บอกว่าข้อสอบ IMO มีความซับซ้อน และต้องการความสร้างสรรค์อย่างต่อเนื่อง ดังนั้นโมเดลให้เหตุผลจะต้องทำงานเป็นเวลานานประมาณ 100 นาที ซึ่งต่างจากข้อสอบคณิตศาสตร์ระดับอื่นๆ ที่ง่ายกว่านี้

Subscribe to LLM