「どのモデルを既定にするか」が、原価の最大の分岐点になった
エンタープライズでエージェントを動かす企業の多くは、いまだに「いちばん賢いモデルを既定にしておけば無難」という運用を続けている。開発者もナレッジワーカーも、迷ったらフロンティアモデルを叩く。品質を落としたくないから、という理由は分かる。だが2026年9月28日にAnthropicが公開した Claude Sonnet 5.5 は、その「無難」がいちばん高くつく選択になりつつあることを、はっきり示した(Anthropic公式)。
homulaは特定のベンダーやツールに縛られず、企業が自社に最適なAI構成を選び続けられるよう支援するAIエージェント・インテグレーターだ。その立場から見ると、今回の発表の勘所は「Sonnetが速く安くなった」ことそのものではない。中位(ワークホース)モデルが、価格を据え置いたまま最上位モデルにほぼ肉薄した——この一点によって、企業側の意思決定が「どのモデルが最強か」から「どの仕事に、どのモデルを、誰の裁量で当てるか」というポートフォリオ設計へと移る、ということだ。本稿はその設計を扱う。
何が発表されたのか——値段据え置きで“最上位に肉薄”
Claude Sonnet 5.5は、前世代のSonnet 5に対して出力生成が30%以上高速になり、Anthropicの計測でタスクあたり最大30%低コストになったとされる。重要なのは、リスト料金がSonnet 5から据え置きである点だ——入力100万トークンあたり2ドル、出力10ドル、キャッシュ読み取り0.20ドル(Anthropic公式、Unite.AI、Artificial Analysis)。
この価格は、フラッグシップのClaude Opus 5.5(入力4ドル/出力20ドル、既報)のちょうど半額にあたる。にもかかわらず品質の差は急速に縮んでいる。Anthropicが公開した評価では、ナレッジワーク評価 GDPval-AA v2.1 でOpus 5.5の1846に対しSonnet 5.5は1844とほぼ横並びで、自律エージェント系の Terminal-Bench 4.0 ではSonnet 5.5が70.6%(Sonnet 5は10.3%)を記録し、項目によっては最上位を上回る(Anthropic公式、llm-stats)。複数の技術メディアは、Sonnet 5.5が主要ベンチでOpus 5.5の**平均でおよそ98%**のスコアに達したと整理している(Artificial Analysis)。
| 項目 | Sonnet 5.5 | Opus 5.5 | 備考 |
|---|---|---|---|
| 入力(100万トークン) | $2 | $4 | Sonnetは半額・Sonnet 5から据え置き |
| 出力(100万トークン) | $10 | $20 | 同上 |
| キャッシュ読み取り | $0.20 | $0.20 | 反復参照の多いエージェントで効く |
| Terminal-Bench 4.0 | 70.6% | — | Sonnet 5は10.3%からの大幅改善 |
| GDPval-AA v2.1 | 1844 | 1846 | ナレッジワークでほぼ同等 |
利用は公開初日からClaude Platform・AWS・Google Cloud・Microsoft Azureで可能で、モデル識別子は claude-sonnet-5-5 だ(Anthropic公式)。
ベンチマークはいずれもベンダー計測値・第三者計測値であり、自社の実タスクでの優劣とは一致しないことがある。ここで押さえるべきは「Sonnetが最強か」ではなく、中位モデルと最上位モデルの品質差が、価格差(2倍)に見合わないほど縮んだ業務領域が広がったという構造変化だ。
「常にフロンティア」という既定が、いちばん高くつく
数字を業務に落とすと、含意はシンプルだ。同じ仕事の多くは、半額のモデルでほぼ同じ品質で片づく。にもかかわらず「迷ったら最上位」を既定にしていると、企業は日々の大量の定型処理——要約、分類、抽出、下書き、バグ修正、社内問い合わせ対応——にわざわざ2倍の単価を払い続けることになる。
エージェント運用ではこの差が増幅される。エージェントは一つの依頼に対してツール呼び出しと再推論を何十ステップも回すため、1タスクの消費トークンが対話利用の桁違いに大きい。単価の2倍差は、そのステップ数だけ積み上がる。「モデルが賢いほど安心」という直感は、量が増えるほど財務的に裏切られる。
一方で、すべてを中位モデルに寄せるのも誤りだ。難所——複雑な設計判断、長い依存関係をまたぐコード変更、曖昧な要件の解きほぐし——では最上位モデルの余力が効き、途中で失敗してやり直すコストのほうが単価差より高くつくことがある。つまり正解は「安い方に全振り」でも「高い方に全振り」でもなく、仕事の難易度に応じてモデルを当て分けることだ。中位モデルが最上位に肉薄した今こそ、この当て分け(ルーティング)の設計価値が跳ね上がる。
モデル・ポートフォリオの設計——3層と“ルーティングの関所”
実務では、モデルを単体で選ぶのではなく**ポートフォリオ(層)**として持ち、タスクを層に振り分ける発想が要る。目安は次の3層だ。
| 層 | 使う場面 | 割り当ての考え方 |
|---|---|---|
| フロンティア層(例: Opus 5.5) | 難しい設計判断・長時間の自律タスク・失敗コストが高い処理 | 全体の一部に絞る。ここは品質優先で単価を許容 |
| ワークホース層(例: Sonnet 5.5) | 日常業務の大半——要約・抽出・分類・下書き・定型的なコード修正 | 既定はここ。量をさばく主戦力 |
| 軽量層(より小さいモデル) | 大量・低難度のルーティン、前処理・振り分け | コスト最優先。判定や下ごしらえに |
設計の核心は「どの層に振るか」をその場の気分ではなく、ルールとして一箇所で決めることにある。具体的には次の3つを設計する。
- 既定モデルの明示: 「迷ったら最上位」ではなく「既定はワークホース層」と組織のポリシーで定める。フロンティア層は例外として明示的に呼ぶ。
- エスカレーションの条件: 中位モデルの出力が一定の確信度・検証に満たない、あるいは難易度が事前に高いと分かっているタスクだけを上位へ引き上げる。
- ルーティングの関所: どのタスクをどのモデルへ流すかを、アプリごとに散らばらせず接続・統制の層で一元的に判断する。ここが後述のガバナンスと同じ面に乗る。
まず「上位モデルでしか通らなかった業務」を棚卸しし、その一部をワークホース層へ移して自社の実タスクでA/B比較するとよい。ベンチのスコアではなく、自社データでの合否率とやり直し率で線を引く。線が引ければ、既定を安全に下げられる。
ルーティングは「統制」と同じ面に置く
モデルの当て分けを、開発者一人ひとりのコード内に散らばった分岐で行うと、二つの問題が起きる。第一に、モデルが半年で入れ替わるたびに各所を直して回る保守地獄になる。第二に、「誰が・どの業務に・どのモデルを・いくらまで使ってよいか」が可視化されず統制できない。これはコスト統制(トークン浪費の統制で既報)と地続きの論点だ。
だからルーティングは、アプリの内側ではなく接続と統制の層——エージェントが外部ツールやデータに触れる関所——に置くのが筋がよい。同じ面で、モデル選択と併せて「どのツールを・どの権限で・誰の承認で使うか」「上限予算」「監査ログ」をまとめて効かせられる。モデルの当て分けは単なる節約術ではなく、ガバナンスの一部として設計するのが正解だ。
homulaの観点——中立の接続層でモデルを可搬にする
homulaはエンタープライズ向けAIエージェント・インテグレーターとして、戦略策定からPoC(最短5日)、実装、運用、内製化までを一気通貫で支援している。今回のようにワークホース層が急伸する局面で、企業に効く打ち手は次の3つだ。
第1に、モデルを可搬に保つ。homulaの Agens はMCPを活用した統合基盤で、200以上のツールと構築ゼロで接続する。接続と統制の層を自社側に持っておけば、Opusが最適な業務も、Sonnetで十分な業務も、アプリを書き換えずに既定モデルを載せ替えられる。モデルの価格・性能が数か月で動く時代に、この可搬性そのものが原価の防波堤になる。
第2に、ルーティングを統制と同じ面で敷く。homulaの Agens Control は、承認フロー・DLP・5年分の監査ログ・RBACを提供する。どの業務にどのモデル・どのツールを・誰の承認で許すか、そしていくらまで使ってよいかを一枚で説明できる基盤があれば、既定を下げても「安かろう悪かろう」に陥らない。
第3に、線引きを自社データで検証する。どの業務を上位に残し、どこからワークホース層へ落とすか——この境界は自社の実タスクでしか引けない。業務棚卸しからプロトタイプ構築、ROI試算までを3〜5日で完結する AIエージェント・ブートキャンプ で、「どの仕事をどの層に当てるか」を短期間で描くことをおすすめしたい。
まとめ
Claude Sonnet 5.5の本質は、ベンチマークの数点ではなく、中位モデルが価格据え置きのまま最上位に肉薄したという構造変化にある。ナレッジワーク評価ではOpus 5.5とほぼ同等、自律エージェント系では上回る項目もありながら、価格は半額。これにより「日常業務の多くは、半額のモデルでほぼ同じ品質で終わる」領域が一気に広がった。
だからこそ、企業の勝負どころは「どのモデルが最強か」ではなく、どの仕事にどの層を当て、その振り分けを統制の面でどう一元管理するかへ移る。「迷ったら最上位」という既定は、量が増えるほど財務的に裏目に出る。モデルをポートフォリオとして持ち、既定をワークホース層に置き、難所だけを上位へ引き上げる——そのルーティングを、接続と統制と同じ面で設計する企業が、値下げの追い風を実利に変えられる。
どの業務にどのモデルを当て、その振り分けを統制と監査の面で一元管理したい企業は、homulaにご相談ください。モデル選定の前に、載せ替え可能な接続層とガバナンスから一気通貫で設計します。