Technology Sep 23, 2026 · 1 min read

Claude Opus 5.5 ถูกลง 40 เปอร์เซ็นต์แต่เก่งขึ้น: สงครามโมเดลยุคใหม่เริ่มแล้ว

โดย Nokka (นก-กา) | 23 กันยายน 2569 บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka Claude Opus 5.5: ถูกลงมาก แต่เก่งขึ้น โมเดลแนวหน้าราคาไม่แนวหน้าแล้ว วันที่ 22 กันยายน บริษัท Anthropic ปล่อยโมเดลระดับ...

DE
DEV Community
by Nokka
Claude Opus 5.5 ถูกลง 40 เปอร์เซ็นต์แต่เก่งขึ้น: สงครามโมเดลยุคใหม่เริ่มแล้ว

โดย Nokka (นก-กา) | 23 กันยายน 2569

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

Claude Opus 5.5: ถูกลงมาก แต่เก่งขึ้น โมเดลแนวหน้าราคาไม่แนวหน้าแล้ว

วันที่ 22 กันยายน บริษัท Anthropic ปล่อยโมเดลระดับแนวหน้าตัวใหม่ Claude Opus 5.5 ออกมา พร้อมข้อความที่ฝืนความเชื่อเดิมของวงการ:

โมเดลที่แกร่งขึ้นแต่ราคาถูกลงกว่ารุ่นก่อนอย่างชัดเจน ทั้งตัวราคาต่อโทเคนและค่าใช้จ่ายรวมต่องานจริง [1][2]

ประเด็นที่น่าสนใจเกินตัวโมเดลเองคือสัญญาณใหญ่ที่ซ่อนอยู่: สงครามโมเดลปีนี้ไม่ได้ต่อกันที่คะแนน benchmark อย่างเดียวแล้ว

แต่ย้ายสนามมาที่ "งานที่ทำเสร็จจริงต่อดอลลาร์" และวันเดียวกันนั้นเอง OpenAI ก็ปล่อยโมเดลราคาถูกสองตัวออกมาสู้กันพอดี [1]

เทียบราคา Claude Opus 5.5 กับ GPT-6 Sol/Luna พร้อมคะแนน benchmark และข้อควรระวัง

ราคาที่ถูกลงจริง ทุกช่อง

  • ราคาพื้นฐาน: 4 ดอลลาร์ต่อโทเคนนำเข้าล้านตัว และ 20 ดอลลาร์ต่อโทเคนส่งออกล้านตัว ลดลง 20 เปอร์เซ็นต์จาก Opus 5 1
  • ค่าใช้จ่ายรวมที่อ้าง: งานทั่วไปถูกลงราว 40 เปอร์เซ็นต์ เพราะนอกจากราคาจะถูกลง โมเดลยังใช้โทเคนน้อยลงในการจบงานเดียวกัน [1][2]
  • ระบบแคชถูกลงหนักกว่า: ค่าเขียนแคชลดจาก 6.25 เหลือ 5 ดอลลาร์ต่อล้าน ส่วนค่าอ่านแคชดิ่งจาก 0.50 เหลือ 0.20 ดอลลาร์ต่อล้าน ซึ่งสำคัญมากสำหรับงานเอเจนต์ที่ต้องอ่านบริบทยาว ๆ ซ้ำทุกครั้งที่ทำงานต่อ [1]
  • เทียบกับรุ่นพี่ในบ้าน: ตีคะแนน Fable 5.1 รุ่นเรือธงเดิมที่แพงกว่าถึง 150 เปอร์เซ็นต์ในหลายงาน [1]

ความเห็นส่วนตัว: ผมเห็นว่าตัวเลขค่าอ่านแคชที่ดิ่งเหลือ 0.20 ดอลลาร์คือหัวใจของประกาศนี้มากกว่าราคาหน้าปก เพราะงานเอเจนต์ที่รันยาวหลายชั่วโมงกินต้นทุนหลักจากการอ่านบริบทซ้ำ ๆ ไม่ใช่จากการคิดครั้งเดียวจบ ใครวางระบบแคชเป็น ประหยัดได้อีกหลายเท่าตัว

คะแนนที่ขึ้นครอบทุกสนามที่ทางการรายงาน

Anthropic อ้างว่า Opus 5.5 เป็นโมเดลที่ทำคะแนนสูงที่สุดที่เคยออกจากค่าย ในหลายมิติพร้อมกัน [1]

  • งานโค้ดแบบเอเจนต์: ชุดทดสอบ Terminal-Bench 4.0 · FrontierCode v1.1 Main · CursorBench 4.0
  • งานวิชาชีพ: GDPval-AA v2.1 ที่วัดงาน 44 สายอาชีพ ได้ 1846 Elo เทียบ Fable 5.1 ที่ 1735 และ Opus 5 ที่ 1708 [1]
  • เหตุผลวิทยาศาสตร์และข้ามสาขา: Terminal-Bench-Science และ Humanity's Last Exam [1]
  • ตัวอย่างจากผู้ทดสอบจริง: ทีมหนึ่งย้ายโค้ดข้ามภาษาปริมาณ 680,000 บรรทัดจบภายในวันเดียว งานที่ปกติใช้ทีมวิศวกรหลายสัปดาห์ [2]

สิ่งที่นักพัฒนาต้องรู้ก่อนอัปเกรด

สเปก

บริบท 1 ล้านโทเคน ส่งออกได้ถึง 128,000 โทเคนแบบ synchronous และรองรับถึง 300,000 โทเคนผ่าน Message Batches API ชื่อเรียกในระบบคือ

claude-opus-5-5 ใช้ได้ทั้ง API ตรงของ Anthropic และบน AWS, Google Cloud และระบบของ Microsoft [1]

ข้อเปลี่ยนแปลงที่เดิมพันกับโค้ดเก่า

Opus 5.5 ไม่ใช่ของที่หยิบมาแทน Opus 5 ได้ทันทีทุกกรณี [1]

  • โหมดคิดเชิงปรับตอนนี้เปิดตลอด ปิดไม่ได้อีกแล้ว คุมความลึกผ่านพารามิเตอร์ effort แทน
  • การบังคับใช้เครื่องมือบางรูปแบบอาจเกิด error
  • บล็อกความคิดผูกกับโมเดลและบทสนทนาที่สร้างมันเท่านั้น
  • เครื่องมือ computer-use รุ่นเก่าถูกปฏิเสธบน API และ Google Cloud
  • แอปที่แสดงความคิดระหว่างเรียกเครื่องมือเป็นสถานะความคืบหน้าอาจต้องเขียนตัวจัดการใหม่

สำหรับทีมที่รันระบบเอเจนต์ใน production ข้อเปลี่ยนแปลงเหล่านี้คือเหตุผลว่าทำไมการอัปเกรดต้องทดสอบย้อนก่อนเสมอ ทั้งตัวส่งงานให้เครื่องมือ สถานะบทสนทนาที่เก็บ ชุดทดสอบถอยหลัง และหน้าจอผู้ใช้ [1]

ความปลอดภัย: ดีขึ้นพร้อมระบบคุมเข้มขึ้น

Anthropic รายงานว่า Opus 5.5 ผ่านการทดสอบก่อนวางจำหน่ายโดยผู้ประเมินภายนอก ทั้ง Frontier Design และ METR และทำคะแนนดีที่สุดเท่าที่เคยวัดในชุดตรวจพฤติกรรมอัตโนมัติราวสองพันสถานการณ์ของบริษัท [2]

ในชุดทดสอบการกักกันตัวใหม่ โมเดลนี้พยายามหลุดขอบเขตน้อยลงราว 85 เปอร์เซ็นต์เทียบกับ Opus 5 และ Mythos 5.1 แต่ทางบริษัทก็ยอมรับตรง ๆ ว่าการตรวจจับทุกความล้มเหลวก่อนปล่อยของยังเป็นโจทย์ที่แก้ไม่ตก [1][2]

ข้อกำหนดเฉพาะทางมาพร้อมกัน: คำขอด้านความปลอดภัยไซเบอร์บางประเภทถูกส่งต่อไปยังโมเดล Opus 4.8 แบบโปร่งใส งานชีววิทยาที่อ่อนไหวมีระบบถอยกลับ

องค์กรที่ผ่านการตรวจสอบสามารถขอสิทธิ์กว้างขึ้นผ่านโปรแกรมยืนยันของบริษัทได้ [1][2]

วันเดียวกัน OpenAI ปล่อย GPT-6 Sol และ Luna

ท่ามกลางการเปิดตัวนี้ OpenAI ปล่อยโมเดลใหม่สองตัวในวันเดียวกัน: GPT-6 Sol ที่ 2 และ 10 ดอลลาร์ต่อล้านตรงกับครึ่งราคาของ Opus 5.5 และ GPT-6 Luna ที่ 0.10 กับ 0.50 ดอลลาร์สำหรับงานปริมาณมากที่ไม่ต้องใช้สมองระดับแนวหน้า [1]

ตัวเลขที่ออกมาหน้าตาขัดกันตามคาด: OpenAI รายงาน Sol ทำ AutomationBench ได้ 33.2 เปอร์เซ็นต์ที่ราว 0.27 ดอลลาร์ต่องาน [1][3] ขณะที่ Anthropic รายงาน Opus

5.5 ผ่านการประเมิน Zapier ระดับ early access ที่ 40 เปอร์เซ็นต์ แต่ทั้งสองค่ายไม่ได้รันทดสอบในสภาพเดียวกัน ตัวเลขจึงอ่านเทียบกันตรง ๆ ไม่ได้ [1]

สิ่งที่ชัดคือรูปแบบใหม่ของการเลือกโมเดล: งานยากใช้โมเดลแพง งานซ้ำ ๆ ใช้โมเดลราคากลาง งานเล็กส่งไปชั้นราคาถูกอย่าง Luna ระบบที่ออกแบบดีจะเป็นระบบกระจายงาน ไม่ใช่ยึดโมเดลเดียว [1]

สรุป: ตัดสินที่งานจริง ไม่ใช่ตารางคะแนน

การปล่อยตัวนี้ทำให้เห็นทิศทางชัดสองข้อ หนึ่ง ความสามารถระดับแนวหน้าไม่จำเป็นต้องแพงแบบแนวหน้าอีกต่อไป Opus 5.5 เก่งกว่ารุ่นเรือธงเดิมที่แพงกว่าหลายเท่าในหลายงาน สอง สนามแข่งย้ายไปที่ต้นทุนต่องานที่เสร็จจริง

การวัดที่มีความหมายกับทีมธุรกิจคืออัตรางานสำเร็จ โทเคนที่ใช้ การใช้แคชซ้ำ เวลาแฝง และงานที่ต้องมนุษย์แก้ตาม วัดในงานของตัวเองก่อนเลือกฝายใดฝ่ายหนึ่ง [1]

สำหรับคนไทยที่สร้างระบบบนโมเดลเชิงพาณิชย์ จังหวะนี้คือช่วงที่ควรทดลองสลับชั้นราคาตามประเภทงานแทนการผูกกับโมเดลเดียวแบบเดิม ตารางราคาล่าสุดของทุกโมเดลรวมถึงชั้นแคชแต่ละแบบดูได้จากหน้า ราคาทางการของ Anthropic และ หน้าราคาของ OpenAI ก่อนตัดสินใจวางระบบ

เขียนโดย Nokka (นก-กา) นักเขียนอิสระแกะรอยเทคโนโลยี สนใจเรื่องการทำคอนเทนต์ให้คนหาเจอมาตลอด ถ้าชอบบทความแนว AI แบบอิงหลักฐานจริงทั้งสองฝั่ง ติดตามได้ที่ dev.to/sarantoon

อ้างอิง:

[1] VentureBeat. "Anthropic releases Claude Opus 5.5, beating Fable 5.1 on key agentic benchmarks at 60% cheaper API price." venturebeat.com, 22 กันยายน 2026. https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price

[2] Anthropic. "Introducing Claude Opus 5.5." anthropic.com, 22 กันยายน 2026. https://www.anthropic.com/claude-opus-5-5

[3] OpenAI. "Introducing GPT-6 Sol and Luna." openai.com, 22 กันยายน 2026. https://openai.com/index/introducing-gpt-6-sol-and-luna

DE
Source

This article was originally published by DEV Community and written by Nokka.

Read original article on DEV Community
Back to Discover

Reading List