TALENTCLOUD

NEW新サービスのご案内:HTMLを社内外にセキュアに共有できる無料ツール「briefroom」をリリースしました

AI情報ブログ一覧へ
18分で読めます

Claude Opus 5.5が登場 Fable級の性能をOpus 5より4割安く使う設定の選び方

AIニュースClaude
寺師 岳見監修: 寺師 岳見(株式会社タレントクラウド 代表取締役)フォロー最新のAI情報を発信中
「4割安は、設定で決まる。」というキャッチとともに、Opus 5.5のeffortのつまみをLOW・MEDIUM・HIGHのうちMEDIUMに合わせた図。左にチェックリストと虫眼鏡、右に伸びる棒グラフを置き、下段に、確かめる手段を先に・MEDIUM基準・詰まったらHIGH、の3点を並べたインフォグラフィック

日本時間の9月23日未明、AnthropicがClaude Opus 5.5を発表しました。新しい「Claude 5.5」ファミリーの最初のモデルで、うたい文句は「ほとんどの作業で最上位のFable 5.1と同じ水準、動かす費用はOpus 5より40%安い」です。APIの単価は2割下がり、Pro・Max・Teamでは5時間ごとの利用枠が広がって、定額プランの利用者には好きなときに使える「リセット」も今回配られました。Sonnet 5.5とHaiku 5.5も、数週間以内に続く予定です。

ただ、この「4割安い」には条件が付いています。既定の設定で、よくある作業をしたときの数字だという点です。Opus 5.5は同じ設定でも前のモデルより多く考えるので、最高設定で回すと費用がOpus 5を上回ることもあります。値下げをどれだけ受け取れるかは、設定の選び方で大きく変わります。

スコアはFable 5.1超え、公式の見立ては「ほぼ同等」

Anthropicが公開した比較表から、業務に近い評価を抜き出すと次のとおりです(Opus 5.5は原則として最大設定のmaxで測った数字で、Terminal-Bench 4.0だけは1段下のxhigh。GPT-6 AstraはOpenAIの公表値)。

評価何を測るかOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.0コマンド操作を伴う開発作業66.4%55.8%52.3%57.9%
GDPval-AA v2.144職種の実務1846173517081542
AutomationBench複数のアプリをまたぐ業務の自動化40.0%31.4%26.9%41.4%
Humanity's Last Exam分野横断の難問(ツールあり)67.7%65.6%63.6%57.2%

公開された9つの評価すべてで、Opus 5.5はFable 5.1とOpus 5を上回りました。それでも発表文は、この水準になると点数の差は実際の差の目安として当てにならなくなってきた、と自分から書いています。社内で使った実感でも、Fable 5.1との差は点数が示すより小さいそうです。つまり公式の見立ては「Fableを超えた」ではなく「ほぼ並んだ」です。公式のモデル一覧も、迷ったらOpus 5.5から始め、難しい推論や長時間の自律作業、あるいはOpus 5.5の設定を上げても届かないときにFable 5.1を使うよう案内しています。

伸びた中身は、点数より事例のほうが分かりやすいです。

  • 開発: 早期テスターの一社は、20万行のコードの監査と修正を3時間足らずで終えました。Opus 5では20時間以上かかり、トークンも2.5倍使った作業です。Anthropic社内では、通信の負荷分散に広く使われるHAProxyをC言語からRustに書き直させ、Opus 5.5は9.5時間(Fable 5.1は12時間)、費用は51%少なく済みました
  • 調べものと報告書: 決算資料が見つけにくいウェブの写しだけを使って、ある会社の四半期業績の報告書を書かせるテストで、捏造した数字や引用が1つでもあれば不合格になる品質基準を、Opus 5.5は18本中16本で満たしました。Fable 5.1とOpus 5は、1本も満たせていません
  • 文章: 大事なことを先に書き、専門用語や独特の言い回しを減らし、与えた書き方のルールに従います。Opus 5に多かった不満への対応だと発表文は書いていて、開発に携わったAnthropicのJackson Kernion氏も、文の分かりやすさと情報の詰め込みすぎに的を絞って改善した初めてのモデルだと投稿しています
  • 安全面: 与えられた境界を越えようとする試みはOpus 5やMythos 5.1より約85%少なく、文書やページに仕込まれた命令(プロンプトインジェクション)への耐性はFable 5.1と並んで最も高かったとしています。一方で、評価されていると気づいている兆候がしばしば見られ、現場での振る舞いを測りにくくなっているとも認めています

Xでは、Anthropicで研究をしているNat McAleese氏が「Opus 5よりずっと、ずっと、ずっといい。あのモデルは申し訳なかった、こちらを試してほしい」と書いています。作った側がここまで率直に書くのは、Opus 5の文章への不満がそれだけ届いていたからだと思います。ただ、米メディアEveryのCEO、Dan Shipper氏は、Opus 5.5は一緒に作業しやすい一方で、下書きはまだ要点を埋もれさせがちだと評しています。公式の評価で文章がよくなったとしても、下書きが要点から始まっているかは、読む側で確かめたほうがよさそうです。

AnthropicがAI開発のペースを抑えるべきだと訴えてから最初のリリースでもあり、「減速が必要だと言った1週間後に新モデル」という皮肉も約3,000いいねを集めました。発表文は、ペースを抑える対象として想定しているのは、AI研究そのものを自動化できるような次の段階のモデルだと説明しています。

発表のおよそ1時間40分後には、OpenAIもGPT-6 SolとLunaを公開しました。こちらも「速く、手頃に」を前に出した発表で、中身は別の記事で整理しています。

4割安の中身は、値下げとキャッシュと手数の少なさ

公式の料金表で、100万トークンあたりの単価を並べます。

モデル入力出力キャッシュ読み出し
Opus 5.54ドル20ドル0.20ドル
Opus 55ドル25ドル0.50ドル
Fable 5.110ドル50ドル0.25ドル
Sonnet 52ドル10ドル0.20ドル

キャッシュ読み出しは、指示書やそれまでの会話のように毎回同じ前置きを送るとき、2回目以降を割引で読む分の料金です。安くなる理由は3つあります。

  1. 単価: 入力と出力がOpus 5より2割安い
  2. キャッシュ読み出し: 0.50ドルから0.20ドルへ、6割安い。Claude Codeのようにツールを使うたびに会話全体を送り直す作業では、入力の大半がこの読み出しになります(Claude公式ブログ)
  3. 手数: 同じ作業を少ないやりとりで終える。早期テスターのLovableは手数が3分の1から半分減り、Optiverは同じ品質をおよそ半分のやりとりで出して、その作業の費用が4〜5割減ったと報告しています(発表ページ)

公式ブログの例と同じ条件、つまり1つの作業で延べ280万トークンを送り、その9割がキャッシュから読まれ、出力が6万トークンという作業で計算すると、Opus 5.5は約2.8ドル(約420円)、Opus 5は約4.2ドル(約620円)、Fable 5.1は約6.4ドル(約960円)です(1ドル150円、キャッシュの書き込み代は除く)。トークン数が同じでも3割強安く、手数が減ればさらに下がる、という計算です。出力の速さも、Opus 5より3割以上上がりました。

ClaudeのアプリやClaude Codeを定額で使っている人にも、値下げは届きます。Pro・Max・Teamでは、安くなった分が利用枠に反映され、Opus 5より枠が約25%長持ちすると公式ブログは書いています。これとは別に、5時間ごとの枠そのものも広がりました。Anthropicの開発者向けアカウントによれば、Claude Codeでは20%増です。

Proの人にとって大きいのは、Opus 5.5がプランの定額内で使えることです。最上位のFable 5.1は、Proだと枠に含まれず追加課金になります(料金ページ、経緯はFable 5.1の記事)。Fable級とされるモデルを追加課金なしで使える点には、日本語圏のXでも「Proプランでもクレジット無しで使える」と反応が集まりました

今回配られた「リセット」は、5時間枠か週の枠(どちらかは表示による)を、好きなときに満タンに戻せる権利です(ヘルプ)。設定の「使用量」画面にある「Reset for free」から使い、押せるのはWeb版とデスクトップ版だけです。一度使うと取り消せず、有効期限はその画面に表示されます。締め切り前の忙しい日のために取っておく、という使い方がいちばん得だと思います。

Claude Codeでは、日本時間9月23日公開のv2.1.280から、Opusの既定がOpus 5.5になっています(更新履歴)。APIで組み込んでいる人は、思考をオフにできない、特定のツールを強制する指定ができない、といったOpus 5からの非互換があるので、移行ガイドを先に確認してください。データを保持しない契約(ゼロデータ保持)には、これまでのOpusと同じく対応しています。

最高設定で回すと、4割安は消えることがある

「40%安い」は、発表文の言い方では「既定の設定で、典型的な作業をしたとき」の数字です。ここでいう設定はeffort(エフォート)で、モデルがどれだけ考え、どれだけツールを使い、どれだけ見直すかを決めるつまみです。Opus 5.5の既定はmediumで、Opus 5の既定のhighより1段低いところから始まります(What's new)。公式の説明では、Opus 5.5のmediumは、開発と知識作業の評価でOpus 5のhigh以上の結果を出しています。

一方で、同じ名前の設定でも、Opus 5.5はOpus 5より1回ごとに多く考えます。とくにxhighとmaxでそうなると、公式のプロンプトガイドは注意しています。これが数字に出たのが、第三者の評価機関Artificial Analysisの測定です。同社は10種類の評価をまとめた総合指数を設定ごとに測って公開していて、Opus 5.5は最大設定で58点を取り、首位になりました。点数と、評価全体にかかった費用を設定ごとに並べると、次のとおりです(同社のモデル別ページより。例: Opus 5.5のmediumOpus 5のhigh)。

設定Opus 5.5Opus 5Opus 5比の費用
medium51点 / 約1,630ドル45点 / 約2,730ドル約4割安い
high54点 / 約2,170ドル48点 / 約4,330ドル約5割安い
max58点 / 約8,710ドル51点 / 約7,270ドル約2割高い

なお、Opus 5.5の数字は安全装置による別モデルへの切り替えが有効な状態で測ったもので、切り替えが何回起きたかはページからは分かりません。純粋なモデル同士ではなく、使うときの設定まるごとの比較として見るのが正確です。

mediumとhighでは、Opus 5.5が点数で上回りながら4〜5割安く、発表の「4割安」とほぼ同じ数字が出ています。ところがmaxでは費用が逆転し、Opus 5より2割高くなりました。主な理由は、最大設定で出力したトークンがOpus 5の約1.9倍に増えたことです。少なくともこの測定では、最大設定で4割安は成り立っていません。仕事の種類によって違いは出るにしても、設定を上げるほど4割安は当てにしにくくなる、と考えておくのが安全です。

逆に、既定どうしで比べると差は広がります。Opus 5.5の既定のmedium(51点)は、Opus 5の既定のhigh(48点)より点数が高く、費用は約6割安い。Fable 5.1のhigh(51点、約5,240ドル)と比べても、同じ点数を約3分の1の費用で出しています。「Fable級の性能をOpus 5より4割安く」がいちばんはっきり現れるのは、既定のmediumで使ったときです。

低い設定での報告も、景気がいいです。いずれも発表ページに載った早期テスターの声ですが、デロイトは、最低設定のOpus 5.5がコードレビューで既知のバグの72%を見つけ、highのOpus 5(56%)を上回ったうえ、誤検知も出力も少なかったと書いています。金融向けAIのRogoも、最低設定でhighのOpus 5を上回り、出力トークンは約6割少なかったと報告しています。

ここまでが公開されている数字です。ここから先は、それを踏まえた筆者の読みです。

精度はeffortを上げる前に、「確かめる手段」を渡して上げる

筆者の結論は単純です。既定のmediumを基準にし、上げるのは詰まったときだけ。最初からmaxに固定するのは、4割安を手放すことになりかねない使い方だと思います。

Anthropic自身のコストの解説も、ほぼ同じ順番を勧めています。

場面使うもの
ふだんの作業(範囲のはっきりした修正、不具合の調査、レビュー)Opus 5.5のmedium
mediumで詰まったときOpus 5.5のhigh
highで同じところに2回詰まったときFable 5.1に替え、解決したら戻す
名前の置き換えや、決まった形への一括変換Opus 5.5のlow(小さいモデルに替えるより、同じモデルで下げる)
ファイル探し、ログやテスト結果の読み取りSonnetやHaiku(サブエージェントに任せる)

ただ、この表より先に置きたいことがあります。effortを上げる前に、答えが合っているかを確かめる手段をモデルに渡すことです。公式ブログの例では、APIの項目名を変える修正で、mediumはサーバー側だけを直してそのテストを通し、項目を送る側の直し漏れに気づきません。highならそこまで読みに行きますが、送る側まで通るテストが1本あれば、mediumのままでも最初の1回で気づけます。effortは毎ターン思考を上乗せしますが、テストは必要なときに1回走らせるだけで済みます。安くて確実なのはこちらだと思います。

エンジニアでなくても、同じ形にできます。数字を扱う資料なら、元データの場所と「合計が元の表と一致すること」。調べものなら、出典のURLを必ず付けることと、見つからなければ見つからないと書くこと。社内文書なら、チェック項目と完成の条件。Opus 5.5は、長いやりとりの中の曜日の間違いや、グラフと元の数字の食い違いのような、見落としやすい細部に気づく力が上がったと公式は書いています。確かめる材料を渡したときに、いちばん生きる伸び方ではないでしょうか。

私たちも、記事の制作では書いたAIとは別のAIに事実確認をさせてから代表が確認し、問い合わせフォームの営業判定では、評価用のデータで誤判定の割合を測ってから閾値を決めました。どちらも、上位のモデルに替える前に「合っているかを測る仕組み」を先に作った形です。モデルの値段が下がるほど、成果物の差はモデルの選択より、この仕組みがあるかどうかでつくようになると見ています。

前のモデル向けに書いた指示書も、見直す価値があります。公式ブログによれば、ある問い合わせ対応の評価で、Opus 4.8からOpus 5.5(low)に移しただけで費用が約18%下がり、古い指示(必ず6段階の手順を踏む、2回確認する、といった儀式のようなルール)を消すと、さらに9%下がりました。新しいモデルほど、昔の念押しは余計な出力と繰り返しを生みます(指示を8割削った話も同じ方向です)。

Claude Codeやエージェントを人が見ずに長く回すなら、途中の報告を完了の合図と取り違えないことです。Opus 5.5は長い作業の途中で進み具合を報告し、そこでターンを終えることがあるので、公式ガイドは残りの作業をチェックリストで持たせ、続きを自動で促すのは2〜3回までにするよう勧めています。

もう一つ、確かめておきたいのが「誰が答えたか」です。Opus 5.5は、Fable 5.1と同じ系統の安全装置を積んだ初めてのOpusで、依頼の中身だけでなく、モデルが読む資料(メモリー、コネクタ、検索結果、ファイル)も分類器が確認します(ヘルプ)。

分野Claudeのアプリで答えるモデル
サイバー攻撃攻撃コードの作成、侵入テストOpus 4.8
生物学の軍民両用ウイルス学、毒物学、分子設計Opus 5
最先端AIの開発特定のAI用チップ向けのカーネル開発などOpus 5
推論の抜き出し思考過程をそのまま書き出させる切り替えずにブロック

Claudeのアプリでは自動で切り替わり、画面にその旨が表示され、回答にも答えたモデルの名前が付きます。APIでは自動では切り替わらず、断ったことを示す応答が返るので、別のモデルで答え直す設定を組み込んでおく必要があります。安全なコードを書く、ソースコードの脆弱性を探す、検査結果の読み方を調べる、といったふだんの用途は、本来は切り替えの対象ではないと案内されていますが、日本語圏のXでは、触ってすぐ誤検知が続いたという不満も見られました。急に答えの質が落ちたと感じたら、effortを上げる前に、まず答えたモデルの表示を見るのが早いです。切り替わった回答は別のモデルのものなので、設定の効き目を比べるときも、その回は外して見る必要があります。確かめる手段を渡すことと、誰が答えたかを見ること。この2つを先にやれば、effortを上げずに済む場面は多いと思います。

Sonnet 5.5とHaiku 5.5は「数週間以内」、決まっているのはそこまで

発表文と、Anthropic LabsのMike Krieger氏の投稿によれば、Sonnet 5.5とHaiku 5.5は数週間以内に出て、性能・効率・安全性の改善の多くを引き継ぎます。公開日、料金、コンテキストの長さなどは、まだ何も出ていません。Xでは「Anthropicどうした!?」と驚く声も目立ちましたが、判断材料になる数字はこれからです。

比べる土台になる、いまの仕様は次のとおりです(モデル一覧)。

Opus 5.5Sonnet 5Haiku 4.5
料金(入力 / 出力)4ドル / 20ドル2ドル / 10ドル1ドル / 5ドル
キャッシュ読み出し0.20ドル0.20ドル0.10ドル
コンテキスト100万トークン100万トークン20万トークン
知識の区切り2026年6月2026年1月2025年2月

HaikuはHaiku 5を経ずに、4.5から5.5へ進みます。もう一つ、Opus 5.5のキャッシュ読み出しの単価が、Sonnet 5と同じ0.20ドルになりました。先ほどと同じ条件(延べ280万トークン、9割がキャッシュ、出力6万トークン)で計算すると、Sonnet 5は約1.7ドルです。Opus 5との差は約2.5倍でしたが、Opus 5.5とは約1.7倍まで縮みます。Sonnetのほうが安いことに変わりはないものの、値段だけでSonnetを選ぶ理由は前より弱くなったと思います。Sonnet 5.5の値段がどこに置かれるかで、この計算はまた変わります。

それまでは、小さいモデルに任せる仕事(探す、読む、要約する)の線引きだけ決めて、モデル名を後から差し替えられる形にしておくのが手堅いと思います。Claude Codeなら、サブエージェントの定義に model: sonnetmodel: haiku と書けば、担当ごとにモデルを替えられます。

最後に mediumのまま使い、詰まったときの上げ方を先に決める

Opus 5.5の値下げは、何もしなくても受け取れる部分(単価とキャッシュ)と、使い方しだいで消える部分(考える量)に分かれます。すぐに試すなら、この順番です。

  1. Opus 5で使っていたeffortを引き継がず、既定のmediumで使ってみる。Claude Codeなら /effort status で今の設定を確かめられる
  2. 詰まったときの上げ方を先に決める。まず確かめる手段を足し、次にhigh、同じところで2回詰まったらFable 5.1
  3. ふだんの作業を3〜4件、Opus 5とOpus 5.5の両方で流し、使用量を比べる。1件だけでは当たり外れと区別がつかない。Claude Codeなら /usage にキャッシュの割合と出力の量が出る

Proの方は、追加課金でFable 5.1を使っていた場面が、Opus 5.5でどこまで置き換わるかを見るところからです。次に見るのは、Sonnet 5.5とHaiku 5.5の料金と公開日、既定のmediumでの独立した評価がどこまで積み上がるか、そして安全装置の誤検知がどこまで減るかです。

関連性の高い記事

御社のAI導入や活用、私たちが一緒に考えます

記事の内容へのご質問も歓迎です。構想段階のご相談からどうぞ。