Image

Large Language Model

By mk Founder on Tag: OpenAI, LLM, Speech Synthesis
OpenAI

ข่าวโมเดลใหม่ประจำวัน จากบ้าน OpenAI เปิดตัวโมเดลเสียงตอบเสียง (speech-to-speech) ตัวใหม่ gpt-realtime ความสำคัญตามชื่อคือตอบโต้ด้วยเสียงที่ซับซ้อนได้แบบเรียลไทม์ และเก่งกว่าโมเดลแบบเดียวกันรุ่นก่อนๆ

OpenAI บอกว่าเทรนโมเดล gpt-realtime ตามความต้องการของลูกค้าจริงในสถานการณ์จริงต่างๆ เช่น งานบริการลูกค้า ผู้ช่วยส่วนตัว และภาคการศึกษา เพื่อสร้างโมเดลที่เหมาะกับการใช้เป็น voice agent ตอบโจทย์ทั้งแง่คุณภาพเสียง ความฉลาด สามารถปฏิบัติตามคำสั่งได้ไม่แหกกฎ ผลการทดสอบเบนช์มาร์คด้านเสียง Big Bench Audio⁠(opens in a new window) ออกมาดีกว่า gpt-4o-realtime ตัวเก่า

By mk Founder on Tag: Microsoft AI, Microsoft, LLM, Artificial Intelligence
Microsoft AI

ข่าวโมเดลใหม่รายวัน วันนี้มีหลายตัว เริ่มจาก Microsoft AI ภายใต้การนำของ Mustafa Suleyman เปิดตัวโมเดลที่ไมโครซอฟท์พัฒนาเอง 2 ตัวคือ

By mk Founder on Tag: Nano Banana, Gemini, Google, LLM, Artificial Intelligence
Nano Banana

ข่าวโมเดลใหม่รายวัน วันนี้ขอเสนอ Gemini 2.5 Flash Image (โค้ดเนมภายใน nano-banana) โมเดลสร้างและแก้ไขภาพตัวใหม่ของกูเกิล สามารถนำภาพหลายๆ ภาพมารวมกันเป็นภาพเดียว และอัพเกรดความสามารถทั้งการสั่งแก้ไข-ดัดแปลงภาพด้วยภาษาธรรมชาติ และการรักษาคาแรกเตอร์ในภาพให้คงเส้นคงวา

จากภาพตัวอย่างของกูเกิล เห็นการรวม 3 ภาพเข้าด้วยกันคือ ใบหน้าผู้หญิง ตัวเครื่องโทรศัพท์มือถือ และบันไดทางเดิน รวมแล้วได้ภาพผู้หญิงคนเดียวกันกำลังคุยโทรศัพท์ (แต่มีร่างกายครึ่งตัว ไม่ได้มีเฉพาะใบหน้า) อยู่ในฉากบันไดที่เตรียมไว้ให้

By mk Founder on Tag: DeepSeek, LLM
DeepSeek

หลังจากเงียบหายไปหลายเดือน DeepSeek กลับมาแล้วกับโมเดลเวอร์ชันใหม่ DeepSeek-V3.1 ที่เพิ่มฟีเจอร์ hybrid thinking mode ใช้โมเดลตัวเดียวเลือกโหมดได้ระหว่าง thinking (สำหรับงาน research) กับ non-thinking (สำหรับงาน chat ทั่วไป)

เดิมทีนั้น โมเดลสายหลักของ DeepSeek คือ V3 ที่พัฒนาต่อจาก V2 แต่เมื่อต้นปีนี้ บริษัทสร้างชื่อในระดับโลก จากโมเดลสาย R1 ที่มี reasoning และทำคะแนนในเบนช์มาร์คต่างๆ ได้สูง

By arjin Writer on Tag: Qwen, Alibaba Cloud, Artificial Intelligence, LLM
Qwen

Alibaba เปิดตัวโมเดล AI ใหม่ Qwen-Image-Edit ซึ่งเป็นโมเดลย่อยของโมเดล AI สร้างรูปภาพ Qwen-Image ที่เปิดตัวเมื่อต้นเดือน โดยเน้นความสามารถเรื่องการแก้ไขรูปภาพตามชื่อ

จุดเด่นของ Qwen-Image-Edit ที่ Alibaba บอก คือการแก้ไขรูปภาพโดยรักษาสภาพรูปต้นแบบไว้ได้ครบถ้วน จึงเหมาะกับงานสร้างสรรค์ที่ใช้รูปเริ่มต้นด้วยคาแรกเตอร์ลิขสิทธิ์ของผู้ใช้งาน (ดูตัวอย่างท้ายข่าว) มีความแม่นยำในการทำงานเมื่อระบุสิ่งที่ต้องการแก้ไขเช่น เพิ่ม ลบ ปรับเปลี่ยนวัตถุ นอกจากนี้ยังแก้ไขส่วนข้อความตัวหนังสือได้ตรงในภาษาอังกฤษและภาษาจีน ซึ่งเป็นจุดเด่นของโมเดลหลัก Qwen-Image อยู่แล้ว

By arjin Writer on Tag: ChatGPT, OpenAI, Artificial Intelligence, Chatbot, LLM
ChatGPT

อัปเดตข่าวสาร ChatGPT ประจำวัน ดูเหมือนประเด็นที่โมเดล GPT-5 ให้บทสนทนาแบบตรงประเด็นและจริงจังเกินไป จนทำให้ผู้ใช้งานจำนวนมากไม่ชอบนัก OpenAI เลยต้องเปิดให้กลับมาใช้โมเดลเก่าได้ด้วย แต่ขณะเดียวกัน OpenAI ก็บอกจะแก้ปัญหานี้ที่ GPT-5 ด้วย

OpenAI บอกว่าได้อัปเดตให้ GPT-5 ตอนนี้มีบทสนทนาที่ดู "อบอุ่นและเป็นมิตรมากขึ้น" จากก่อนหน้านี้การตอบจะดูเป็นทางการ สิ่งที่ผู้ใช้งานจะเห็นรายละเอียดเล็ก ๆ ระหว่างการสนทนา เช่นข้อความอย่าง "เป็นคำถามที่ดี" หรือ "เริ่มต้นได้ดี" โดย OpenAI บอกว่าผลทดสอบไม่พบว่า GPT-5 ใหม่นี้ประจบผู้ใช้งานกว่าเดิม

By mk Founder on Tag: Gemma, Google, LLM
Gemma

กูเกิลออกโมเดลใหม่ในชุด Gemma 3 คือ Gemma 3 270M ขนาดเล็กพิเศษ (หน่วยเป็น M ไม่ใช่ B) เล็กกว่าโมเดลตัวหลักขนาดพารามิเตอร์ 27B และ Gemma 3n ขนาด 2B สำหรับรันในมือถือ

กูเกิลบอกว่า Gemma 3 270M เป็นโมเดลเฉพาะทางมากๆ (highly specialized) ออกแบบมาเพื่อเป็นโมเดลพื้นฐาน (base model) ที่ขนาดเล็ก แต่ความสามารถสูง (compact and capable) สำหรับนำไป fine-tuned ต่อเพื่องานเฉพาะด้านอีกที

By arjin Writer on Tag: ChatGPT, OpenAI, Artificial Intelligence, LLM
ChatGPT

ข่าวสาร ChatGPT บนโมเดล GPT-5 ประจำวันนี้ โดย Sam Altman ซีอีโอ OpenAI พูดถึงฟีเจอร์ใหม่ที่เริ่มทยอยอัปเดตให้ผู้ใช้งานดังนี้

  • เพิ่มการเลือกโหมด "Auto", "Fast" และ "Thinking" เมื่อใช้งาน GPT-5 โดย Auto เป็นโหมดแนะนำสำหรับผู้ใช้งานทั่วไป
  • เพิ่มโควต้าการใช้งานโหมด Thinking บน GPT-5 เป็น 3,000 ข้อความต่อสัปดาห์ คิดเป็นโทเค็น 196k ถ้าเกินนั้นจะปรับมาเป็น Thinking mini อีกจำนวนหนึ่ง
By lew Founder on Tag: Claude, Anthropic, LLM
Claude

Anthropic ประกาศขยายขนาด context ของ Claude 4 Sonnet จากเดิม 200,000 โทเค็น เป็น 1 ล้านโทเค็นรองรับการใช้งานที่ต้องประมวลผลข้อมูลขนาดใหญ่ เช่น อ่านโค้ดจำนวนมากเพื่อทำความเข้าใจภาพรวมโครงการ, วิเคราะห์เอกสารขนาดใหญ่เช่นเอกสารทางกฎหมาย, และการทำงานแบบ Agent ที่ต้องใช้เครื่องมือจำนวนมากๆ

ค่าใช้งานเมื่อใส่ context ใหญ่กว่า 200,0000 โทเค็นจะเป็นราคาใหม่อยู่ที่ 6 ดอลลาร์ต่อล้านโทเค็นสำหรับอินพุต และ 22.50 ดอลลาร์ต่อล้านโทเค็นสำหรับเอาท์พุต โดยได้ส่วนลด prompt caching และ batch processing เหมือนเดิม

By mk Founder on Tag: Microsoft Defender, Microsoft, Research, LLM, Security, Malware
Microsoft Defender

ทีมวิจัย Microsoft Research โชว์ Project Ire ต้นแบบการนำ LLM มาใช้ตรวจสอบไฟล์ว่าเป็นมัลแวร์หรือไม่ ทำงานอัตโนมัติ

เดิมทีนั้น กระบวนการตรวจสอบว่าไฟล์ซอฟต์แวร์สักตัวเป็นมัลแวร์หรือไม่ (malware classification) ค่อนข้างยุ่งยาก ต้องทำ reverse engineering ดูข้างในไฟล์ว่าทำอะไรบ้าง โดยไม่รู้บริบทใดๆ ต้องใช้ความเชี่ยวชาญสูง และสิ้นเปลืองเวลาของผู้เชี่ยวชาญความปลอดภัยอย่างมาก

By mk Founder on Tag: Google Cloud, LLM, OpenAI, Google
Google Cloud

Google Cloud ประกาศให้บริการ โมเดล OpenAI GPT-OSS เวอร์ชันโอเพนซอร์ส ถือเป็นครั้งแรกที่เราได้เห็นโมเดลของ OpenAI มารันบนบริการของกูเกิลที่เป็นคู่แข่งกันโดยตรง

กูเกิลบอกว่าแนวทางของตัวเองคือสนับสนุนโมเดลที่หลากหลาย ในกลุ่มโมเดลโอเพนซอร์สมีทั้ง Gemma ของตัวเอง, Meta Llama 4 และล่าสุดคือ gpt-oss

By mk Founder on Tag: Grok, LLM, xAI
Grok

xAI เปิดบริการ โมเดล Grok 4 รุ่นใหม่ล่าสุด ให้ผู้ใช้ทุกคนใช้งานฟรี จากเดิมที่ก่อนหน้านี้จำกัดเฉพาะผู้ใช้แพ็กเกจแบบเสียเงิน SuperGrok เท่านั้น

การใช้งาน Grok 4 สามารถทำผ่านเว็บหรือแอพ Grok ได้เลย โดยระบบจะเลือกโมเดลให้อัตโนมัติ ระหว่าง Grok 3 ตัวเดิมหากเป็นคำถามทั่วไป และ Grok 4 หากเป็นคำถามที่ซับซ้อนขึ้น แต่ผู้ใช้ก็สามารถเลือกเองได้ผ่านเมนูโมเดล

By lew Founder on Tag: Qwen, LLM, Programming
Qwen

Alibaba Cloud แยกโครงการ Gemini CLI ออกมาเป็น Qwen Code แล้วนำมาให้บริการกับโมเดล Qwen Code โดยชูจุดเด่นให้บริการฟรีวันละ 2,000 ครั้ง นับเป็นสองเท่าของบริการฟรีจากกูเกิล

โมเดล Qwen3-Coder มีความสามารถใกล้เคียงกับ Claude 4 Sonnet มากขึ้นในช่วงหลัง ทำให้บริการนี้น่าสนใจมากขึ้น

By arjin Writer on Tag: OpenAI, ChatGPT, LLM
OpenAI

มีประเด็นเล็ก ๆ จากงานเปิดตัวโมเดล GPT-5 ของ OpenAI เมื่อคืนนี้ เมื่อทีมงานพูดถึงผลการทดสอบความสามารถโมเดล AI ในด้านต่าง ๆ และเปรียบเทียบกับโมเดลรุ่นก่อนหน้า ด้วยกราฟแท่งของคะแนนเปรียบเทียบกัน แต่มีอะไรให้เอ๊ะอยู่บ้าง

กราฟแรกเป็นอัตราการสร้างผลลัพธ์ลวงที่ไม่สามารถทำได้จริง (Deception Rate) ซึ่งระบุว่า GPT-5 ทำได้ที่ 50% แต่กราฟที่แสดงนั้นดูเพี้ยนไปเมื่อเทียบกับ o3 ที่ 47.4% ทั้งนี้ในรายงานฉบับเต็มของ OpenAI ตัวเลขจริงอยู่ที่ 16.5% ด้วย

By arjin Writer on Tag: OpenAI, ChatGPT, Artificial Intelligence, LLM
OpenAI

OpenAI เปิดตัว GPT-5 โมเดลปัญญาประดิษฐ์เรือธงรุ่นล่าสุด โดยบอกว่ามีความฉลาดและความสามารถรอบด้านเหนือกว่าทุกโมเดลที่เคยพัฒนา เก่งทั้งการเขียนโค้ด คณิตศาสตร์ เขียนบทความ วิเคราะห์ข้อมูลสุขภาพ อ่านข้อมูลรูปภาพ และอื่น ๆ

GPT-5 มีจุดเด่นเรื่องการทำงานผสมผสาน สามารถคิดได้เองว่าแต่ละคำถามควรตัดสินตอบทันที หรือใช้เวลาคิดเพื่อหาเหตุผลเชิงลึกมากขึ้น ทำให้ผู้ใช้งานไม่ต้องเลือกว่าจะใช้โมเดลแบบใดอย่างในอดีต แต่ขณะเดียวกับก็สามารถกำหนดใน prompt ได้ว่าต้องการให้คิดตอบไว หรือให้วิเคราะห์นานขึ้นได้

By mk Founder on Tag: Qualcomm, OpenAI, Snapdragon, LLM
Qualcomm

Qualcomm ประกาศรองรับการรันโมเดลเปิด OpenAI GPT OSS บนชิป Snapdragon ถือเป็นครั้งแรกที่เราได้เห็นโมเดลจาก OpenAI รันแบบ on-device ได้

โมเดลที่รันได้เป็นรุ่นเล็ก gpt-oss-20b ขนาดพารามิเตอร์ 20B โดย Qualcomm บอกว่ารันได้บน Snapdragon รุ่น "เรือธง" แต่ไม่บอกรายชื่อว่ามีรุ่นใดบ้าง ตัวอย่างที่ Qualcomm นำมาโชว์คือการรันบน Surface Laptop 7 ที่ใช้ Snapdragon X Elite และแรม 32GB

การทำงานต้องมี Qualcomm AI Stack เข้าช่วย และแนะนำให้ใช้ผ่าน Ollama จะง่ายที่สุด

ที่มา - Qualcomm

By mk Founder on Tag: AWS, OpenAI, LLM, Amazon
AWS

AWS บริการให้บริการโมเดล OpenAI open weight หรือ GPT OSS บนบริการ Amazon Bedrock และ Amazon SageMaker ซึ่งถือเป็นครั้งแรกที่ AWS มีโมเดลของ OpenAI ให้บริการ

ก่อนหน้านี้ OpenAI มีสัญญาเอ็กซ์คลูซีฟกับไมโครซอฟท์ ทำให้มีแต่ Microsoft Azure เท่านั้นที่มีโมเดลของ OpenAI ให้เช่าใช้งาน ในขณะที่ AWS ต้องไปใช้โมเดลของ Anthropic ที่เข้าไปลงทุนไว้ รวมถึงโมเดลจากพาร์ทเนอร์รายอื่นๆ

By arjin Writer on Tag: Gemini, Google, Artificial Intelligence, LLM
Gemini

กูเกิลเพิ่มความสามารถให้ Gemini ในการสร้างหนังสือนิทาน (Storybook) จากเรื่องราวที่ผู้ใช้งานอธิบายเข้าไป ซึ่งผลลัพธ์จะได้เป็นหนังสือนิทานตามเรื่องที่ระบุ พร้อมกับภาพวาดประกอบ

Storybook ที่ได้จะเป็นหนังสือ 10 หน้า มีภาพประกอบ และเสียงบรรยาย สามารถใส่อินพุทรูปภาพหรือเอกสารของผู้ใช้งานเองเพื่อให้ได้ผลลัพธ์ตรงตามต้องการมากขึ้นได้ ภาพประกอบในหนังสือยังสามารถกำหนดสไตล์ไม่ว่าจะเป็น รูปพิกเซล การ์ตูน ภาพปั้นนูน ไปจนถึงหนังสือภาพวาดสำหรับระบายสี

By mk Founder on Tag: Google, LLM, Security, Artificial Intelligence
Google

กูเกิลเพิ่งเปิดตัว Big Sleep ปัญญาประดิษฐ์ช่วยหาช่องโหว่ความปลอดภัย ไปเมื่อเดือนที่แล้ว (ชื่อหมายถึงว่า ปัญญาประดิษฐ์ทำงานได้เอง มนุษย์นอนไปได้เลย)

ล่าสุด Heather Adkins ผู้บริหารฝ่ายความปลอดภัยของกูเกิล เปิดเผยว่า Big Sleep หาช่องโหว่ได้ครบ 20 ตัวแรกแล้ว ช่องโหว่ส่วนใหญ่อยู่ในโครงการซอฟต์แวร์โอเพนซอร์ส เช่น FFmpeg, ImageMagick, CUPS, QuickJS, Redis

By arjin Writer on Tag: Qwen, Alibaba Cloud, Artificial Intelligence, LLM
Qwen

Alibaba เปิดตัวโมเดล AI สร้างรูปภาพใหม่ Qwen-Image ในโมเดลตระกูล Qwen โดยมีจุดขายสองอย่างคือ ใส่ข้อความที่ซับซ้อนได้อย่างถูกต้อง และ สั่งแก้ไขภาพได้แม่นยำ ซึ่งทำงานได้ดีในข้อความภาษาจีน แต่ก็รองรับภาษาอังกฤษเช่นกัน

ด้วยความสามารถการใส่ข้อความในรูปภาพที่แม่นยำ ทำให้ Alibaba ชูว่า Qwen-Image เหมาะสำหรับงานทำโปสเตอร์ สไลด์ รูปภาพที่ต้องแก้ไขป้ายหน้าร้าน ภาพที่มีลายมือ และอินโฟกราฟิก

Subscribe to LLM