ここ数週間、Anthropic のモデル系列は上から順に刷新されてきました。9月22日に Claude Opus 5.5、9月28日に Claude Sonnet 5.5、そして10月7日、最後のピースである Claude Haiku 5.5 が公開されました(Anthropic 発表、Anthropic 価格表)。フロンティアの値下げは本ブログでもOpus 5.5の“1タスクいくら”や既定モデルの意思決定として扱ってきましたが、今回の主役は上段ではなく一番安い“働き手”の段です。
homula はエンタープライズ向けの AIエージェント・インテグレーターとして、日本企業の導入を「PoCから本番・全社へ」支援しています。本稿で扱うのは、派手なフロンティアの性能競争の陰で静かに進む、もう一つの決定的な論点——エージェントの“原価”は、賢い上位モデルではなく、裏方で大量に回る小型モデルの単価で決まるという構造です。Haiku 5.5 はその単価を一段下げ、設計の選択肢を変えました。
Haiku 5.5が引いた、新しい“底値”
まず数字を押さえます。Haiku 5.5 は、プロンプト長で価格が変わるという珍しい設計を採りました(価格表)。
| 区分(100万トークンあたり) | 入力 | 出力 | キャッシュ読取 |
|---|---|---|---|
| Haiku 5.5(10万トークンまで) | $0.10 | $0.50 | $0.01 |
| Haiku 5.5(10万トークン超) | $0.50 | $2.50 | $0.05 |
| Haiku 4.5(従来) | $1.00 | $5.00 | $0.10 |
| Sonnet 5.5(参考) | $2.00 | $10.00 | $0.10 |
| Opus 5.5(参考) | $4.00 | $20.00 | $0.20 |
Anthropic は、Haiku 5.5 が Haiku 4.5 より平均で約75%安く動くとし、内訳として10万トークンまでの要求で約90%安、それを超える要求で約50%安と説明しています(発表)。ただし新しいトークナイザを採用したため、同じ作業でも消費トークンがやや増える点には注意が必要です(4.7世代以降は同じ文章で約30%多くトークンを生むと明記されています/価格表)。
もう一つの新機軸が、小型モデルとして初めて“努力度(effort)”設定を備えたことです。Low/Med/High/Xhigh/Max の5段で、コストと賢さのトレードオフを呼び出しごとに選べます(発表)。あわせて Sonnet 5.5 のキャッシュ読取単価が $0.20 から $0.10 へ半減し、キャッシュを多用するエージェント処理のコストが全般に下がりました。
Anthropic 自身は Haiku 5.5 の守備範囲を明確に線引きしています。複雑なエージェント型コーディング(Terminal-Bench のような長い自律タスク)は引き続き Sonnet 5.5・Opus 5.5 が適役で、Haiku 5.5 は要約・コンテキスト圧縮(compaction)・DB照会・分類といった「狭く大量」な作業や、上位モデルと組ませるサブエージェント、そして顧客対応やブラウザ操作のような速度優先の用途に向く、という位置づけです。安いから何でも任せる、ではありません。
なぜ『一番安いモデル』がエージェント経済の分岐点なのか
チャットの時代は、1リクエスト=1回のモデル呼び出しでした。エージェントの時代は違います。1つのタスクが、計画→ツール呼び出し→結果整形→再試行→ログ要約→分類…と多数の呼び出しに分解されます。業界の試算では、1つのエージェント型タスクが数回〜十数回のモデル呼び出しを発し、1チャット往復の10〜数十倍のトークンを消費するとされます(ベンダー試算のため幅があり、方向性として捉えるべき数字です)。
この構造では、総コストの大半は“賢い計画役”ではなく“大量に回る雑務役”で発生します。計画や最終判断は1タスクに数回。対して、ツール出力の整形、形式チェック、分類、ログ要約、長い文書からの抜き出しは数十回単位で走ります。ここをすべて上位モデルに通すと、賢さが不要な場面にフロンティア単価を払い続けることになる——これがエージェント運用でコストが膨らむ典型です。
規模感を一例で見ます。Anthropic の価格ドキュメントは、1件あたり約3,700トークンの顧客対応を Haiku 4.5 で処理すると1万件あたり約$37と示しています(価格表)。同じ短尺処理を Haiku 5.5 の“10万トークンまで”区分に載せれば、単価は約9割下がる計算になります。件数が増えるほど、底値の差がそのまま運用費の差になります。
逆に言えば、底値が下がったからこそ落とし穴も深くなります。Haiku 5.5 は10万トークンを境に単価が5倍に跳ねる設計です。長大なコンテキストを雑に詰め込む運用だと、「安いはずのモデル」が境界線の向こうで急に高くつきます。コンテキスト圧縮や分割、キャッシュ活用を前提に、プロンプトを10万トークン内に収める設計が実利に直結します。努力度を上げすぎる、賢さが要る判断まで小型に落とす、といった“安さに引きずられた設計の緩み”も、品質とやり直しコストに跳ね返ります。
『どのモデルに何をやらせるか』を先に決める
ここから先は、個別モデルの善し悪しではなく階層化(tiering)の設計の話です。エージェントを「計画役」と「働き手」に分け、賢さが要る判断だけを上位に、反復的で大量な雑務を下位に流す——この振り分けを後付けではなく最初に決めておくことが、品質とコストを両立させる勝ち筋になります。
| 作業の性質 | 担当の目安 | 理由 |
|---|---|---|
| 計画・最終判断・複雑な自律コーディング | Opus 5.5 / Sonnet 5.5 | 長い推論と文脈統合が必要。回数は少ない |
| サブエージェント(部品の抜き出し・整形) | Haiku 5.5 | 回数が多く、狭いタスク。単価が効く |
| 分類・ルーティング・形式チェック・再試行判定 | Haiku 5.5(低努力度) | 賢さより安定した指示追従と低単価 |
| 要約・コンテキスト圧縮・ログ整理 | Haiku 5.5 | 大量に走る裏方処理。Anthropic も推奨用途に明記 |
| 顧客対応・ブラウザ操作など速度優先 | Haiku 5.5 | 体感速度が価値。βでブラウザ/コンピュータ操作に対応 |
この設計が机上論でないことは、公開された企業事例が示しています(いずれも発表)。金融分析の Rogo は 10-K(年次報告書)から数値を引き出すサブエージェントとして Haiku 5.5 を使い、Cognition は上位モデルの“相棒”に据えた構成で FrontierCode のスコア 66.2 を報告。AlphaSense の「Ask in Document」機能は週に約800万回の呼び出しを捌き、Asana は従来モデル比で30%超の低遅延・1ターンあたり最大2.5倍の高速化、Box は Haiku 4.5 比で約半分の遅延を報告しています。共通するのは、Haiku を“主役”ではなく“高頻度の働き手”として据え、上位モデルと役割分担している点です。
階層化の第一歩は、賢いモデルを選ぶことではなく、業務を“判断”と“雑務”に棚卸しすることです。どの処理が何回走るかが分かって初めて、どこに底値のモデルを当てれば効くかが決まります。モデルの値下げは追い風ですが、効かせるのは設計です。
homula の観点——“働き手の階層”を運用に落とす
homula は n8n / Dify / LangGraph を活用し、エンタープライズのエージェントを PoC(最短5日)から本番・内製化まで一気通貫で支援しています。今回のような底値の更新を実利に変えるために、私たちが重視するのは次の順序です。
- 業務棚卸しから入る: 「判断」と「反復的な雑務」を分け、どの処理が何回走るかを可視化する。ここが決まらないと、モデル単価が下がっても効かせどころが定まりません。AIエージェント・ブートキャンプ(3〜5日で業務棚卸し・プロトタイプ構築・ROI試算)はまさにこの切り分けのための場です。
- モデルを“差し替え可能な部品”として組む: 計画役と働き手を疎結合にしておけば、Haiku 5.5 のような底値更新が出るたびに、雑務の段だけを安全に乗せ替えられます。特定モデルに固着した設計は、値下げの恩恵を取りこぼします。
- 大量に回る段ほど統制を効かせる: 底値が下がると、小型モデルを使ったエージェントは件数も接続先も増えます。Agens は MCP を活用し200以上のツールと構築ゼロで接続でき、Agens Control が承認フロー・DLP・5年分の監査ログ・RBAC を提供します。「安くなったから増やす」を、追跡可能な拡張にするための土台です。
既存のお客様では、こうした切り分けと自動化で処理時間を 93%削減した例もあります。重要なのは、モデルが安くなったこと自体ではなく、安い働き手を“どこに・何回・どの権限で”当てるかを設計しきることです。
まとめ
Haiku 5.5 の登場で、Anthropic のモデル階層は上から下まで出そろいました。注目は上段の性能競争に集まりがちですが、エージェントの運用費を実際に左右するのは、裏方で大量に回る底値のモデルです。10万トークンまで約9割安という今回の更新は、その底値を一段押し下げ、「どのモデルに何をやらせるか」という階層化の設計を、コスト面からも正面の論点に押し上げました。
- フロンティアの値下げに続く主役は、“働き手の階層”の底値更新。
- エージェント経済は、雑務役の単価×回数で決まる。賢さが不要な場面に上位単価を払わない設計が効く。
- Haiku 5.5 は10万トークンの境界と努力度設定を持つ。安さを活かすも殺すも、コンテキスト設計と役割分担次第。
- 効かせるのはモデルではなく設計。業務棚卸し→階層化→統制の順で落とし込む。
モデルの値下げは、設計が追いついて初めて利益になります。自社の業務のどこに“安い働き手”を当てれば効くか——その棚卸しと階層化の設計から、一緒に始めましょう。