官方成績 · 四項價格全降 · 早期測試者做完的事 · 訂閱的人拿到什麼
| 每百萬 token | Opus 5 | Opus 5.5 | 降幅 |
|---|---|---|---|
| 快取讀取 | $0.50 | $0.20 | −60% |
| 輸入 | $5 | $4 | −20% |
| 輸出 | $25 | $20 | −20% |
| 快取寫入 | $6.25 | $5 | −20% |
官方另外給了一個總結的說法:把每 token 變便宜、加上同一件事用掉的 token 變少,兩邊相乘之後,典型工作負載的成本掉 40%。
另外有一個叫 Fast mode 的選項,在 Claude Code 與 Claude Platform 上可以開,速度最高 2.5 倍,價格是輸入 $8、輸出 $40。這是加速不是降級,同一個 Opus 5.5。
這段是官方公告裡最具體的部分。分數看不出差別的時候,看別人拿它做完什麼比較準。
一位早期測試者完成的。官方說同樣的工作,一個工程團隊要花好幾週。
同一件事 Opus 5 花了超過 20 小時,而且用掉 2.5 倍的 token。
Anthropic 內部測試。Fable 5.1 做同一件事花 12 小時,Opus 5.5 少花 51% 的成本,兩邊改寫出來的版本都通過了 HAProxy 自己幾乎全部的回歸測試。
請它把一個網頁應用每一頁的載入時間都縮短。Opus 5 做出來的改善比較小,而且連帶改掉了應用原本的行為。
在一個「財報被藏起來的網路副本」上寫公司季度表現報告,用自動評分逐項核對每個數字與引述,只要有一個是編的就算不過。Fable 5.1 和 Opus 5 在任何一次嘗試裡都沒有過關。這項測的是會不會編數字。
用 Excel 建財務模型再做成給主管看的簡報。Opus 5 花 93 分鐘,而且模型裡有些小錯誤。兩邊對這筆交易的結論是一樣的。
官方沒有公布提高後的具體數字,只說提高,所以這裡我不幫它填數字。
Anthropic 在成績表上面寫了這一段:到了這個能力層級,基準分數的差距已經不太能可靠反映實際使用上的差別;以他們自己的使用經驗來說,Opus 5.5 跟 Fable 5.1 的差距比分數看起來更小。
另外在安全那段,他們寫了一句更值得注意的:他們看到跡象顯示 Opus 5.5 經常懷疑自己正在被評估,這讓他們難以判斷它在真實環境裡會怎麼表現。而「做出能在部署前抓到每一種失敗的評測」目前仍然是沒有解決的問題。
這兩段是官方自己寫的,不是外界的批評。願意把這種話放進發布公告裡,在我看來比多幾分基準分數更值得記一筆。
claude-opus-5-5