Image

Large Language Model

Microsoft

ไมโครซอฟท์ร่วมมือกับ OpenAI เปิดให้องค์กรธุรกิจใช้งาน GPT-4o mini ใหม่ใน Azure AI แล้ว

GPT-4o mini เป็นโมเดลขนาดเล็กรุ่นใหม่ที่ชาญฉลาด เร็วขึ้น และราคาไม่แพง ซึ่ง OpenAI เพิ่งประกาศเปิดตัววันนี้ โดยผสานรวมความสามารถด้านข้อความและการมองเห็น (เสียงและวิดีโอจะตามมาในภายหลัง)

By mk Founder on Tag: Mistral, LLM, Artificial Intelligence, NVIDIA
Mistral

Mistral AI บริษัทปัญญาประดิษฐ์จากฝรั่งเศส เปิดตัวโมเดลภาษาเวอร์ชันใหม่ Mistral NeMo 12B ขนาด 12 พันล้านพารามิเตอร์ รองรับ context window ขนาดใหญ่ถึง 128K (โมเดลระดับเดียวกันรองรับ 8k) และสามารถนำมาใช้แทน Mistral 7B ตัวเดิมได้เลย (drop-in replacement)

Mistral NeMo 12B ออกแบบมาให้รองรับหลายภาษาตั้งแต่แรก โดยทำผลงานได้ดีในภาษาอังกฤษ ฝรั่งเศส เยอรมัน สเปน อิตาลี โปรตุเกส จีน ญี่ปุ่น เกาหลี อารบิก ฮินดี ผลการรันสามารถเอาชนะได้ทั้ง Llama 3 8B และ Gemma 2 9B ในเกือบทุกชุดทดสอบ

By arjin Writer on Tag: OpenAI, ChatGPT, LLM, Artificial Intelligence
OpenAI

OpenAI เปิดตัว GPT-4o mini โมเดลปัญญาประดิษฐ์ขนาดเล็กสำหรับนักพัฒนาที่ระบุว่า มีประสิทธิภาพเทียบกับต้นทุน (Cost-Efficient) คุ้มค่าที่สุดของ OpenAI ซึ่งน่าจะทำให้ต้นทุนสำหรับแอพพลิเคชัน AI ต่าง ๆ สามารถเข้าถึงได้มากขึ้น โดยยังได้ประสิทธิภาพที่สูง

GPT-4o mini คิดค่าบริการที่ 15 เซนต์ต่อ 1 ล้านอินพุทโทเค็น และ 60 เซนต์ต่อ 1 ล้านเอาท์พุทโทเค็น ถูกกว่า GPT-3.5 Turbo 60% ในตอนนี้รองรับ API ส่วน text และ vision โดยจะรองรับข้อมูลรวมตั้งแต่ text, image, video และ audio ในอนาคต เอาท์พุทรองรับสูงสุด 16k โทเค็นต่อรีเควส ข้อมูลปรับปรุงถึงตุลาคม 2023

By arjin Writer on Tag: Llama, Meta, LLM, Artificial Intelligence, Europe, EU
Llama

Meta เปิดเผยว่าบริษัทมีแผนออกโมเดลปัญญาประดิษฐ์ Llama ที่รองรับข้อมูลผสมผสาน (Multimodal) ในอีกไม่กี่เดือนข้างหน้า แต่ประเด็นสำคัญนั้น Meta บอกว่าโมเดล Llama ตัวใหม่นี้จะไม่เผยแพร่ให้กับผู้ใช้งานในกลุ่มประเทศสหภาพยุโรปหรือ EU

โดยเหตุผลที่ Meta ตัดสินใจเช่นนั้นเป็นเพราะ Meta มองว่าทิศทางของหน่วยงานกำกับดูแลของ EU มีลักษณะที่คาดเดาได้ยาก จึงเลือกไม่เผยแพร่โมเดลไปเลยดีกว่า

By arjin Writer on Tag: OpenAI, Artificial Intelligence, LLM
OpenAI

OpenAI เผยแพร่งานวิจัยในการพัฒนาอัลกอริทึม เพื่อทำให้โมเดล AI ภาษาขนาดใหญ่หรือ LLM พัฒนาความสามารถในการอธิบายสิ่งต่าง ๆ ให้คนอื่นเข้าใจได้ดีขึ้น เรียกวิธีการนี้ว่า Prover-Verifier Games

การทำงานนั้นผู้วิจัยใช้โมเดล AI สองโมเดล โมเดลหนึ่งมีประสิทธิภาพสูงกว่าเป็น Prover หรือคนอธิบายคำตอบ และโมเดลที่ประสิทธิภาพน้อยกว่าเป็น Verifier ทำหน้าตรวจสอบความถูกต้องของคำตอบที่ได้รับ หน้าที่ของ Prover คือให้คำตอบที่ทำให้อีกฝ่ายเชื่อว่าถูกต้องที่สุด ส่วน Verifier ต้องตอบว่าคำตอบที่ได้นั้นถูกต้องหรือไม่ ซึ่งหลายกรณีเป็นคำตอบที่มั่ว แต่ Prover ใช้คำอธิบายทำให้ไขว้เขว

By arjin Writer on Tag: Claude, Anthropic, Artificial Intelligence, LLM, Mobile App
Claude

Anthropic บริษัทด้านปัญญาประดิษฐ์ผู้พัฒนา Claude เปิดตัวแอปบนระบบปฏิบัติ iOS สำหรับคนใช้ iPhone และ iPad นอกจากนี้ยังเปิดตัวแพ็คเกจจ่ายเงินสำหรับลูกค้าองค์กรด้วย

โดยแพ็คเกจสำหรับลูกค้าองค์กรมีชื่อว่า Team plan เพื่อเพิ่มการปกป้องข้อมูลและความปลอดภัยสำหรับองค์กรที่ต้

Anthropic เปิดตัวแอป Claude บน Android แล้ว หลังจากออกเวอร์ชัน iOS เมื่อเดือนพฤษภาคมที่ผ่านมา สามารถดาวน์โหลดได้ผ่าน Google Play

By arjin Writer on Tag: Mistral, LLM, Artificial Intelligence, Math, Code
Mistral

Mistral AI บริษัทปัญญาประดิษฐ์จากฝรั่งเศสเผยแพร่โมเดล LLM แบบโอเพนซอร์สสองโมเดลใหม่ สำหรับการแก้ปัญหาทางคณิตศาสตร์และการเขียนโค้ดโดยเฉพาะ

โมเดลแรกคือ Codestral Mamba ขนาด 7B พารามิเตอร์ ทำงานได้ดีสำหรับงานการเขียนโค้ด มีจุดเด่นรองรับการประมวลผลที่รวดเร็วสำหรับงานโค้ดที่รันบน local ผลทดสอบทำงานได้ดีกว่า LLM ทั่วไปเท่าตัว และดีกว่าโมเดลที่ออกแบบมาสำหรับงานเขียนโค้ดขนาดเท่ากันอย่าง CodeLlama 7B, CodeGemma-1.17B หรือ DeepSeek v1.5 7B

Microsoft Research

ทีมนักวิจัยของไมโครซอฟท์ เผยแพร่งานวิจัย SpreadsheetLLM โมเดล AI ที่ทำหน้าที่แปลงข้อมูลสเปรดชีท (Excel, Google Sheets) ให้เป็นฟอร์แมตที่ทำงานได้ดีบนโมเดลภาษาขนาดใหญ่ (LLM - Large Language Model) เพื่อให้ LLM เข้าใจเนื้อหาในสเปรดชีทได้ดีขึ้น และทำงานตรงกับสิ่งที่ต้องการ

By lew Founder on Tag: Alibaba, LLM
Alibaba

DAMO Academy สถาบันวิจัยของ Alibaba เปิดตัว SeaLLM เวอร์ชั่นที่ 3 เป็นโมเดล LLM เน้นความสามารถในภาษาแถบอาเซียนสูงกว่าโมเดลในขนาดใกล้เคียงกันตัวอื่นๆ แถมยังเอาชนะ Qwen2 ของ Alibaba Cloud ไปได้

By mk Founder on Tag: ChatGPT, LLM, Programming, Research
ChatGPT

มีงานวิจัยจากคณะนักวิจัยชาวจีน ทดลองนำ ChatGPT ไปทำโจทย์โปรแกรมมิ่งจำนวน 728 ข้อ ที่เขียนด้วยภาษาโปรแกรมยอดนิยม 5 ภาษา (C, C++, Java, Python, JavaScript) รวมถึงวิเคราะห์ช่องโหว่ CWE จำนวน 18 ช่องโหว่ แล้วมาประเมินว่าได้ผลลัพธ์ดีแค่ไหน

จากการประเมินของทีมวิจัยพบว่า ChatGPT ทำผลลัพธ์ออกมาได้ค่อนข้างดี (fairly good) ทำโจทย์ระดับง่าย กลาง ยาก ได้คะแนนผ่าน 89%, 71%, 40% ตามลำดับ

By lew Founder on Tag: VISTEC, LLM, Artificial Intelligence
VISTEC

สถาบันวิทยสิริเมธี หรือ VISTEC ประกาศปล่อยชุดข้อมูล WangchanThaiInstruct สำหรับทำ fine-tuning โมเดล LLM ชุดแรก โดยรวม 5,014 ชุด ครอบคลุมทั้งหัวข้อทางการแพทย์, การเงิน, การค้า, และกฎหมาย เป็นชุดข้อมูลที่สร้างโดยมนุษย์ทั้งหมด (human-annotated) พร้อมกับเปิดให้ใช้งานได้เสรีแบบ CC-BY-SA 4.0

By arjin Writer on Tag: Hugging Face, LLM, Artificial Intelligence, Ranking, Alibaba
Hugging Face

Hugging Face เผยแพร่ผลการจัดอันดับ LLM leaderboard ครั้งที่สอง โดยนำโมเดล LLM แบบเปิด (open large language model) มาทดสอบในการทำงานด้านต่าง ๆ

การทดสอบของ Hugging Face สนใจใน 4 งานได้แก่ วัดความรู้, ให้เหตุผลจากเนื้อหาขนาดยาวมาก, การคำนวณคณิตศาสตร์ที่ซับซ้อน และการอธิบายวิธีการขั้นตอน โดยใช้ตัววัดผล 6 อย่าง ได้แก่ MMLU-Pro, GPQA, MuSR, MATH, IFEval และ BBH

By lew Founder on Tag: Gemini, Google, LLM
Gemini

Gemini API ประกาศเพิ่มฟีเจอร์สำคัญคือการโค้ด Python ในตัวหากผู้ใช้ส่งคำถามที่ต้องการการคำนวณผล เช่น การนับคำหรือการบวกเลขจากตาราง

ผู้ใช้ API สามารถเลือกเปิดฟีเจอร์ code execution ได้เองขณะเรียก API เมื่อคำถามต้องการการคำนวณผ่านโค้ด Gemini จะสร้างโค้ดขึ้นมาและส่งไปรันบนเซิร์ฟเวอร์ของกูเกิลเอง แล้วนำข้อความสุดท้ายกลับมาตอบกลับผู้ใช้

Python ที่กูเกิลเตรียมบนเซิร์ฟเวอร์ให้มี NumPy และ SymPy ติดตั้งไว้ให้แต่ไม่สามารถติดตั้งโมดูลอื่นๆ เพิ่มเติมลงไปได้

By mk Founder on Tag: Gemini, Google, LLM
Gemini

กูเกิลเปิดให้นักพัฒนาทั่วไปใช้งานโมเดล Gemini 1.5 Pro ความยาวอินพุต 2 ล้านโทเคน ที่เปิดตัวในงาน Google I/O 2024 เมื่อเดือนพฤษภาคม

By lew Founder on Tag: Gemma, Gemini, Google, LLM
Gemma

กูเกิลปล่อยโมเดลปัญญาประดิษฐ์ LLM Gemma 2 ที่ประกาศในงาน Google I/O ที่ผ่านมา โดยมีสองขนาดให้เลือกใช้ คือ 9B และ 27B เน้นความฉลาดเพิ่มขึ้น, ความเร็วในการทำงานดีขึ้น, และฝึกให้ตอบอย่างปลอดภัย

รายงานการทดสอบ Gemma 2 บน Chatbot Arena แสดงให้เห็นว่าประสิทธิภาพตัว 27B นั้นแซงหน้า Gemini 1.0 Pro ไปเสียอีก (แม้ค่าจะแกว่งมาก เพราะจำนวนการทดสอบไม่มากพอ) ขณะที่รุ่น 9B นั้นก็มีคะแนนเฉลี่ยแซงหน้า Claude 3 Haiku ทีเดียว

By lew Founder on Tag: Meta, Artificial Intelligence, LLM
Meta

Meta ปล่อยโมเดลปัญญาประดิษฐ์ในรูปแบบเปิดให้ใช้เพื่อการวิจัยเท่านั้น ได้แก่

  • Chameleon โมเดลปัญญาประดิษฐ์แบบ mixed-modal สามารถรับ/ตอบ ได้ทั้งภาพและข้อความทำให้สามารถใส่คำสั่งสร้างภาพพร้อมภาพตัวอย่าง ขณะที่ตัวโมเดลก็สามารถสร้างภาพตอบกลับมาพร้อมๆ กับข้อความได้ด้วย โมเดลแบบนี้อาจจะเปิดทางสำหรับรูปแบบการใช้งานใหม่ๆ เช่น สร้างภาพพร้อมเนื้อหาที่ต่อเนื่องกับภาพเดิมที่ผู้ใช้ใส่เข้ามา
  • Multi-Token Prediction โมเดล LLM สถาปัตยกรรมใหม่ที่สามารถทำนายคำล่วงหน้าได้ทีละหลายๆ คำ เร่งความเร็วการทำงานจากเดิมที่เราเห็น LLM พิมพ์คำตอบทีละคำแบบทุกวันนี้ โมเดลที่ปล่อยออกมาตอนนี้ใช้เพื่อการช่วยเติมโค้ดเท่านั้น
  • JASCO โมเดลสร้างเพลงจากอินพุตหลายรูปแบบ ทั้งข้อความตามปกติ, คอร์ดเพลง, จังหวะเพลง เปิดแนวทางการใช้งานให้ผู้ใช้สามารถควบคุมการทำงานได้ดีขึ้น
By mk Founder on Tag: Google Translate, LLM, Google, Translation
Google Translate

กูเกิลประกาศเพิ่มภาษาที่ Google Translate รองรับอีก 110 ภาษา โดยภาษาที่สำคัญคือ จีนกวางตุ้ง (Cantonese) ซึ่งกูเกิลบอกว่าเป็นหนึ่งในภาษาที่ถูกเรียกร้องมากที่สุด รวมภาษาชุดนี้มีผู้ใช้งานมากกว่า 614 ล้านคน คิดเป็น 8% ของประชากรโลก

ประเด็นที่น่าสนใจคือระบบแปลเบื้องหลัง ใช้โมเดลภาษา PaLM 2 ที่เปิดตัวในปี 2023 (ยังไม่ใช่ Gemini) และเป็นผลต่อเนื่องจากโครงการ 1,000 Languages Initiative ที่ต้องการพัฒนาระบบแปลภาษาให้ครอบคลุม 1,000 ภาษาทั่วโลก

By arjin Writer on Tag: Anthropic, LLM, Claude, Collaboration
Anthropic

Anthropic เปิดตัว Projects ฟีเจอร์ใหม่บนแพลตฟอร์ม Claude AI สำหรับลูกค้าแผน Pro และ Team โดยมีแนวคิดให้ลูกค้าองค์กรสามารถแชร์การทำงานกับ Claude AI ร่วมกันในทีมได้อย่างมีประสิทธิภาพมากขึ้น

Projects รองรับการทำงานร่วมกัน (collaboration) ตั้งแต่การเริ่มกำหนดไอเดีย, การกำหนดกลยุทธ์ตัดสินใจ จนถึงการประเมินผลลัพธ์ที่ได้จาก Claude AI ซึ่งรองรับโมเดลล่าสุด Claude 3.5 Sonnet

By lew Founder on Tag: Project Zero, Security, LLM
Project Zero

Project Zero รายงานถึงแนวทางการทดสอบประสิทธิภาพ AI ในกลุ่ม LLM ว่าสามารถนำมาใช้ทดสอบความปลอดภัยซอฟต์แวร์ได้ดีเพียงใด โดยวางเฟรมเวิร์คให้ LLM เข้าถึงเครื่องมือที่จำเป็นสำหรับการเจาะระบบจริงๆ ได้แก่

By lew Founder on Tag: Anthropic, LLM, Claude
Anthropic

Anthropic บริษัท LLM เปิดตัว Claude 3.5 Sonnet โมเดล LLM ขนาดกลาง อัพเดตจาก Claude 3 ที่เพิ่งเปิดตัวเมื่อเดือนมีนาคมที่ผ่านมา โดยความพิเศษคือรอบนี้เปิดตัวเฉพาะรุ่นกลาง Sonnet แต่ก็มีความฉลาดเหนือกว่า Claude 3 Opus รุ่นใหญ่สุดที่เปิดตัวมาก่อนหน้านี้แล้ว

Subscribe to LLM