— 人來過

Claude Opus 5.5 重點整理

官方成績 · 四項價格全降 · 早期測試者做完的事 · 訂閱的人拿到什麼

← 返回首頁 關於我 · GPT-5.6 指南 · Threads
Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,是 Claude 5.5 家族的第一個成員。官方的說法是:它在多數工作上達到 Fable 5.1 的水準,而在典型工作負載下跑起來比 Opus 5 便宜四成。

我把整份公告讀完,把會影響到一般使用者跟開發者的部分挑出來排成這一頁,數字全部對回官方原文。公告裡有幾句話官方講得很保守,我也一起放進來了,在最後一段。

來源:Anthropic 官方發布頁(2026-09-22 發布,2026-09-23 查證)。

這次改了哪幾件事

  • 效能:官方定位它是現在最強的那一個,早期測試者在最複雜的工作上看到明顯跳升。
  • 成本:四項計價全部往下調,其中快取讀取降 60%。官方說快取讀取占了代理與寫程式工作的大部分成本,所以這一項影響最大。
  • 速度:輸出比 Opus 5 快超過 30%。
  • 寫作方式:官方承認 Opus 5 最常被抱怨的就是話太多、不好讀。這一代把重要的資訊放前面,少用行話,照你給的寫作規則走。有位早期測試者的原話是「it writes the way I do」。
  • 安全:在他們自己那套跑近 2,000 個情境的行為稽核上,這是目前分數最好的一個模型。
  • 接下來:Sonnet 5.5 與 Haiku 5.5 官方預告會在幾週內跟上,一樣帶這些改進。

官方測試成績

終端機裡的多步驟工作(Terminal-Bench 4.0,分數越高越好)
Opus 5.5Anthropic
66.4%
GPT-6 AstraOpenAI
57.9%
Fable 5.1Anthropic
55.8%
Opus 5上一代
52.3%
GPT-5.6 SolOpenAI
37.3%
測的是能不能在命令列裡把一件需要很多步驟的專業工作做完。官方自己在註腳裡寫了誤差範圍:Opus 5.5 是 ±2.6 分,其他 Claude 模型是 ±1.6 到 2 分,所以跟 Astra 那 8.5 分的差距要扣掉這個再看。兩個 GPT 的數字是 OpenAI 自己公布的。
真實職業工作(GDPval-AA v2.1,Elo 分數,越高越好)
Opus 5.5
1846
Fable 5.1
1735
Opus 5
1708
GPT-5.6 Sol
1588
GPT-6 Astra
1542
Artificial Analysis 做的評測,涵蓋 44 種職業的實際工作。長條是從 1400 分起算畫的,不是從 0,不然幾根看起來會一樣長;數字本身是官方原值。
其他幾項官方公布的成績
項目Opus 5.5Fable 5.1Opus 5
FrontierCode v1.1(主集)54.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
電腦操作 OSWorld 2.081.8%80.7%74.0%
看圖表 Chartography89.0%88.4%83.4%
跨領域推理 HLE67.7%65.6%63.6%
OSWorld 是部分計分,Chartography 與 HLE 是可使用工具的條件下。除特別註明外,Opus 5.5 的成績都是在 adaptive thinking 最高強度下測的。

價格:四項全降

每百萬 tokenOpus 5Opus 5.5降幅
快取讀取$0.50$0.20−60%
輸入$5$4−20%
輸出$25$20−20%
快取寫入$6.25$5−20%
四項裡真正會讓你有感的是第一行。官方原文說快取讀取「占了代理與寫程式工作成本的大部分」,所以它降 60% 的影響遠大於輸入輸出各降 20%。

官方另外給了一個總結的說法:把每 token 變便宜、加上同一件事用掉的 token 變少,兩邊相乘之後,典型工作負載的成本掉 40%。

另外有一個叫 Fast mode 的選項,在 Claude Code 與 Claude Platform 上可以開,速度最高 2.5 倍,價格是輸入 $8、輸出 $40。這是加速不是降級,同一個 Opus 5.5。

早期測試者實際做完的事

這段是官方公告裡最具體的部分。分數看不出差別的時候,看別人拿它做完什麼比較準。

68 萬行程式碼遷移,不到一天

一位早期測試者完成的。官方說同樣的工作,一個工程團隊要花好幾週。

20 萬行程式碼稽查加修正,3 小時內

同一件事 Opus 5 花了超過 20 小時,而且用掉 2.5 倍的 token。

把 HAProxy 從 C 改寫成 Rust,9.5 小時

Anthropic 內部測試。Fable 5.1 做同一件事花 12 小時,Opus 5.5 少花 51% 的成本,兩邊改寫出來的版本都通過了 HAProxy 自己幾乎全部的回歸測試。

40 次裡成功 39 次

請它把一個網頁應用每一頁的載入時間都縮短。Opus 5 做出來的改善比較小,而且連帶改掉了應用原本的行為。

18 份報告裡 16 份過關,另外兩個模型是 0

在一個「財報被藏起來的網路副本」上寫公司季度表現報告,用自動評分逐項核對每個數字與引述,只要有一個是編的就算不過。Fable 5.1 和 Opus 5 在任何一次嘗試裡都沒有過關。這項測的是會不會編數字。

併購分析 63 分鐘,成本少一半

用 Excel 建財務模型再做成給主管看的簡報。Opus 5 花 93 分鐘,而且模型裡有些小錯誤。兩邊對這筆交易的結論是一樣的。

以上全部出自 Anthropic 官方發布頁,是他們與早期測試者提供的數據,我沒有自己複測過。

訂閱的人拿到什麼

  • Pro、Max、Team 以及按席次計價的 Enterprise,五小時用量上限提高。
  • 訂閱用戶另外拿到一次用量重置,而且可以先存著,想用的時候再用。
  • Claude Code 與 Claude Platform 可以開 Fast mode,最高 2.5 倍速度。

官方沒有公布提高後的具體數字,只說提高,所以這裡我不幫它填數字。

安全與限制上的改動

  • 在新設計的「會不會越過隔離邊界」測試裡,Opus 5.5 嘗試繞過邊界的次數比 Opus 5 或 Mythos 5.1 少了大約 85%,而且每一次嘗試都是低嚴重度並且它自己主動回報。
  • 提示注入攻擊上,在 AI 安全公司 Gray Swan 跑的評測裡,它與 Fable 5.1 並列所有受測模型中成功率最低。
  • 生物與資安能力太強,所以套用了與 Fable 5.1 同級的防護。多數資安任務會被轉給 Opus 4.8 處理,生物研究要用完整能力得另外申請官方的驗證計畫。
  • thinking 模式不能再關掉了。這點對接 API 的人要注意,官方有另開文件說明。
  • 一樣支援零資料保留,也帶了為了符合歐盟 AI 法案的浮水印措施。

官方自己講出來的保留

Anthropic 在成績表上面寫了這一段:到了這個能力層級,基準分數的差距已經不太能可靠反映實際使用上的差別;以他們自己的使用經驗來說,Opus 5.5 跟 Fable 5.1 的差距比分數看起來更小。

另外在安全那段,他們寫了一句更值得注意的:他們看到跡象顯示 Opus 5.5 經常懷疑自己正在被評估,這讓他們難以判斷它在真實環境裡會怎麼表現。而「做出能在部署前抓到每一種失敗的評測」目前仍然是沒有解決的問題。

這兩段是官方自己寫的,不是外界的批評。願意把這種話放進發布公告裡,在我看來比多幾分基準分數更值得記一筆。

開發者的規格

  • 模型 ID:claude-opus-5-5
  • 上架平台:Claude Platform、Amazon Web Services、Google Cloud、Microsoft Azure
  • 2026 年 8 月 31 日之後建立的 API 帳號,套用 preserved thinking 這個防蒸餾措施,不能再改寫 Claude 先前的上下文
  • thinking 不能關

想更深入?我其他幾篇

想跟一群人一起學 AI?

加入我的免費 LINE 學習社群,裡面有實作分享、問答,還有我持續丟的工具與資源

加入 Leo AI 學習社群 →