โดย Nokka (นก-กา) | 23 กันยายน 2569
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
Claude Opus 5.5: ถูกลงมาก แต่เก่งขึ้น โมเดลแนวหน้าราคาไม่แนวหน้าแล้ว
วันที่ 22 กันยายน บริษัท Anthropic ปล่อยโมเดลระดับแนวหน้าตัวใหม่ Claude Opus 5.5 ออกมา พร้อมข้อความที่ฝืนความเชื่อเดิมของวงการ:
โมเดลที่แกร่งขึ้นแต่ราคาถูกลงกว่ารุ่นก่อนอย่างชัดเจน ทั้งตัวราคาต่อโทเคนและค่าใช้จ่ายรวมต่องานจริง [1][2]
ประเด็นที่น่าสนใจเกินตัวโมเดลเองคือสัญญาณใหญ่ที่ซ่อนอยู่: สงครามโมเดลปีนี้ไม่ได้ต่อกันที่คะแนน benchmark อย่างเดียวแล้ว
แต่ย้ายสนามมาที่ "งานที่ทำเสร็จจริงต่อดอลลาร์" และวันเดียวกันนั้นเอง OpenAI ก็ปล่อยโมเดลราคาถูกสองตัวออกมาสู้กันพอดี [1]
ราคาที่ถูกลงจริง ทุกช่อง
- ราคาพื้นฐาน: 4 ดอลลาร์ต่อโทเคนนำเข้าล้านตัว และ 20 ดอลลาร์ต่อโทเคนส่งออกล้านตัว ลดลง 20 เปอร์เซ็นต์จาก Opus 5 1
- ค่าใช้จ่ายรวมที่อ้าง: งานทั่วไปถูกลงราว 40 เปอร์เซ็นต์ เพราะนอกจากราคาจะถูกลง โมเดลยังใช้โทเคนน้อยลงในการจบงานเดียวกัน [1][2]
- ระบบแคชถูกลงหนักกว่า: ค่าเขียนแคชลดจาก 6.25 เหลือ 5 ดอลลาร์ต่อล้าน ส่วนค่าอ่านแคชดิ่งจาก 0.50 เหลือ 0.20 ดอลลาร์ต่อล้าน ซึ่งสำคัญมากสำหรับงานเอเจนต์ที่ต้องอ่านบริบทยาว ๆ ซ้ำทุกครั้งที่ทำงานต่อ [1]
- เทียบกับรุ่นพี่ในบ้าน: ตีคะแนน Fable 5.1 รุ่นเรือธงเดิมที่แพงกว่าถึง 150 เปอร์เซ็นต์ในหลายงาน [1]
ความเห็นส่วนตัว: ผมเห็นว่าตัวเลขค่าอ่านแคชที่ดิ่งเหลือ 0.20 ดอลลาร์คือหัวใจของประกาศนี้มากกว่าราคาหน้าปก เพราะงานเอเจนต์ที่รันยาวหลายชั่วโมงกินต้นทุนหลักจากการอ่านบริบทซ้ำ ๆ ไม่ใช่จากการคิดครั้งเดียวจบ ใครวางระบบแคชเป็น ประหยัดได้อีกหลายเท่าตัว
คะแนนที่ขึ้นครอบทุกสนามที่ทางการรายงาน
Anthropic อ้างว่า Opus 5.5 เป็นโมเดลที่ทำคะแนนสูงที่สุดที่เคยออกจากค่าย ในหลายมิติพร้อมกัน [1]
- งานโค้ดแบบเอเจนต์: ชุดทดสอบ Terminal-Bench 4.0 · FrontierCode v1.1 Main · CursorBench 4.0
- งานวิชาชีพ: GDPval-AA v2.1 ที่วัดงาน 44 สายอาชีพ ได้ 1846 Elo เทียบ Fable 5.1 ที่ 1735 และ Opus 5 ที่ 1708 [1]
- เหตุผลวิทยาศาสตร์และข้ามสาขา: Terminal-Bench-Science และ Humanity's Last Exam [1]
- ตัวอย่างจากผู้ทดสอบจริง: ทีมหนึ่งย้ายโค้ดข้ามภาษาปริมาณ 680,000 บรรทัดจบภายในวันเดียว งานที่ปกติใช้ทีมวิศวกรหลายสัปดาห์ [2]
สิ่งที่นักพัฒนาต้องรู้ก่อนอัปเกรด
สเปก
บริบท 1 ล้านโทเคน ส่งออกได้ถึง 128,000 โทเคนแบบ synchronous และรองรับถึง 300,000 โทเคนผ่าน Message Batches API ชื่อเรียกในระบบคือ
claude-opus-5-5 ใช้ได้ทั้ง API ตรงของ Anthropic และบน AWS, Google Cloud และระบบของ Microsoft [1]
ข้อเปลี่ยนแปลงที่เดิมพันกับโค้ดเก่า
Opus 5.5 ไม่ใช่ของที่หยิบมาแทน Opus 5 ได้ทันทีทุกกรณี [1]
- โหมดคิดเชิงปรับตอนนี้เปิดตลอด ปิดไม่ได้อีกแล้ว คุมความลึกผ่านพารามิเตอร์ effort แทน
- การบังคับใช้เครื่องมือบางรูปแบบอาจเกิด error
- บล็อกความคิดผูกกับโมเดลและบทสนทนาที่สร้างมันเท่านั้น
- เครื่องมือ computer-use รุ่นเก่าถูกปฏิเสธบน API และ Google Cloud
- แอปที่แสดงความคิดระหว่างเรียกเครื่องมือเป็นสถานะความคืบหน้าอาจต้องเขียนตัวจัดการใหม่
สำหรับทีมที่รันระบบเอเจนต์ใน production ข้อเปลี่ยนแปลงเหล่านี้คือเหตุผลว่าทำไมการอัปเกรดต้องทดสอบย้อนก่อนเสมอ ทั้งตัวส่งงานให้เครื่องมือ สถานะบทสนทนาที่เก็บ ชุดทดสอบถอยหลัง และหน้าจอผู้ใช้ [1]
ความปลอดภัย: ดีขึ้นพร้อมระบบคุมเข้มขึ้น
Anthropic รายงานว่า Opus 5.5 ผ่านการทดสอบก่อนวางจำหน่ายโดยผู้ประเมินภายนอก ทั้ง Frontier Design และ METR และทำคะแนนดีที่สุดเท่าที่เคยวัดในชุดตรวจพฤติกรรมอัตโนมัติราวสองพันสถานการณ์ของบริษัท [2]
ในชุดทดสอบการกักกันตัวใหม่ โมเดลนี้พยายามหลุดขอบเขตน้อยลงราว 85 เปอร์เซ็นต์เทียบกับ Opus 5 และ Mythos 5.1 แต่ทางบริษัทก็ยอมรับตรง ๆ ว่าการตรวจจับทุกความล้มเหลวก่อนปล่อยของยังเป็นโจทย์ที่แก้ไม่ตก [1][2]
ข้อกำหนดเฉพาะทางมาพร้อมกัน: คำขอด้านความปลอดภัยไซเบอร์บางประเภทถูกส่งต่อไปยังโมเดล Opus 4.8 แบบโปร่งใส งานชีววิทยาที่อ่อนไหวมีระบบถอยกลับ
องค์กรที่ผ่านการตรวจสอบสามารถขอสิทธิ์กว้างขึ้นผ่านโปรแกรมยืนยันของบริษัทได้ [1][2]
วันเดียวกัน OpenAI ปล่อย GPT-6 Sol และ Luna
ท่ามกลางการเปิดตัวนี้ OpenAI ปล่อยโมเดลใหม่สองตัวในวันเดียวกัน: GPT-6 Sol ที่ 2 และ 10 ดอลลาร์ต่อล้านตรงกับครึ่งราคาของ Opus 5.5 และ GPT-6 Luna ที่ 0.10 กับ 0.50 ดอลลาร์สำหรับงานปริมาณมากที่ไม่ต้องใช้สมองระดับแนวหน้า [1]
ตัวเลขที่ออกมาหน้าตาขัดกันตามคาด: OpenAI รายงาน Sol ทำ AutomationBench ได้ 33.2 เปอร์เซ็นต์ที่ราว 0.27 ดอลลาร์ต่องาน [1][3] ขณะที่ Anthropic รายงาน Opus
5.5 ผ่านการประเมิน Zapier ระดับ early access ที่ 40 เปอร์เซ็นต์ แต่ทั้งสองค่ายไม่ได้รันทดสอบในสภาพเดียวกัน ตัวเลขจึงอ่านเทียบกันตรง ๆ ไม่ได้ [1]
สิ่งที่ชัดคือรูปแบบใหม่ของการเลือกโมเดล: งานยากใช้โมเดลแพง งานซ้ำ ๆ ใช้โมเดลราคากลาง งานเล็กส่งไปชั้นราคาถูกอย่าง Luna ระบบที่ออกแบบดีจะเป็นระบบกระจายงาน ไม่ใช่ยึดโมเดลเดียว [1]
สรุป: ตัดสินที่งานจริง ไม่ใช่ตารางคะแนน
การปล่อยตัวนี้ทำให้เห็นทิศทางชัดสองข้อ หนึ่ง ความสามารถระดับแนวหน้าไม่จำเป็นต้องแพงแบบแนวหน้าอีกต่อไป Opus 5.5 เก่งกว่ารุ่นเรือธงเดิมที่แพงกว่าหลายเท่าในหลายงาน สอง สนามแข่งย้ายไปที่ต้นทุนต่องานที่เสร็จจริง
การวัดที่มีความหมายกับทีมธุรกิจคืออัตรางานสำเร็จ โทเคนที่ใช้ การใช้แคชซ้ำ เวลาแฝง และงานที่ต้องมนุษย์แก้ตาม วัดในงานของตัวเองก่อนเลือกฝายใดฝ่ายหนึ่ง [1]
สำหรับคนไทยที่สร้างระบบบนโมเดลเชิงพาณิชย์ จังหวะนี้คือช่วงที่ควรทดลองสลับชั้นราคาตามประเภทงานแทนการผูกกับโมเดลเดียวแบบเดิม ตารางราคาล่าสุดของทุกโมเดลรวมถึงชั้นแคชแต่ละแบบดูได้จากหน้า ราคาทางการของ Anthropic และ หน้าราคาของ OpenAI ก่อนตัดสินใจวางระบบ
เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon
อ้างอิง:
[1] VentureBeat. "Anthropic releases Claude Opus 5.5, beating Fable 5.1 on key agentic benchmarks at 60% cheaper API price." venturebeat.com, 22 กันยายน 2026. https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price
[2] Anthropic. "Introducing Claude Opus 5.5." anthropic.com, 22 กันยายน 2026. https://www.anthropic.com/claude-opus-5-5
[3] OpenAI. "Introducing GPT-6 Sol and Luna." openai.com, 22 กันยายน 2026. https://openai.com/index/introducing-gpt-6-sol-and-luna
This article was originally published by DEV Community and written by Nokka.
Read original article on DEV Community