homula
LLM・RAG

エージェントの『原価』は、もう一番安いモデルで決まる——Claude Haiku 5.5と“働き手の階層”という設計

10月7日に登場したClaude Haiku 5.5は、10万トークンまでの入力を1モデルあたり$0.10/M・出力$0.50/Mに下げ、小型モデルで初めて“努力度”設定を備えた。フロンティアの値下げに続く今回の主役は“働き手の階層”。エージェント経済の分岐点を、モデル階層化の設計として解く。

読了 12分|峻 福地

ここ数週間、Anthropic のモデル系列は上から順に刷新されてきました。9月22日に Claude Opus 5.5、9月28日に Claude Sonnet 5.5、そして10月7日、最後のピースである Claude Haiku 5.5 が公開されました(Anthropic 発表、Anthropic 価格表)。フロンティアの値下げは本ブログでもOpus 5.5の“1タスクいくら”や既定モデルの意思決定として扱ってきましたが、今回の主役は上段ではなく一番安い“働き手”の段です。

homula はエンタープライズ向けの AIエージェント・インテグレーターとして、日本企業の導入を「PoCから本番・全社へ」支援しています。本稿で扱うのは、派手なフロンティアの性能競争の陰で静かに進む、もう一つの決定的な論点——エージェントの“原価”は、賢い上位モデルではなく、裏方で大量に回る小型モデルの単価で決まるという構造です。Haiku 5.5 はその単価を一段下げ、設計の選択肢を変えました。

Haiku 5.5が引いた、新しい“底値”

まず数字を押さえます。Haiku 5.5 は、プロンプト長で価格が変わるという珍しい設計を採りました(価格表)。

区分(100万トークンあたり)入力出力キャッシュ読取
Haiku 5.5(10万トークンまで)$0.10$0.50$0.01
Haiku 5.5(10万トークン超)$0.50$2.50$0.05
Haiku 4.5(従来)$1.00$5.00$0.10
Sonnet 5.5(参考)$2.00$10.00$0.10
Opus 5.5(参考)$4.00$20.00$0.20

Anthropic は、Haiku 5.5 が Haiku 4.5 より平均で約75%安く動くとし、内訳として10万トークンまでの要求で約90%安、それを超える要求で約50%安と説明しています(発表)。ただし新しいトークナイザを採用したため、同じ作業でも消費トークンがやや増える点には注意が必要です(4.7世代以降は同じ文章で約30%多くトークンを生むと明記されています/価格表)。

もう一つの新機軸が、小型モデルとして初めて“努力度(effort)”設定を備えたことです。Low/Med/High/Xhigh/Max の5段で、コストと賢さのトレードオフを呼び出しごとに選べます(発表)。あわせて Sonnet 5.5 のキャッシュ読取単価が $0.20 から $0.10 へ半減し、キャッシュを多用するエージェント処理のコストが全般に下がりました。

💡

Anthropic 自身は Haiku 5.5 の守備範囲を明確に線引きしています。複雑なエージェント型コーディング(Terminal-Bench のような長い自律タスク)は引き続き Sonnet 5.5・Opus 5.5 が適役で、Haiku 5.5 は要約・コンテキスト圧縮(compaction)・DB照会・分類といった「狭く大量」な作業や、上位モデルと組ませるサブエージェント、そして顧客対応やブラウザ操作のような速度優先の用途に向く、という位置づけです。安いから何でも任せる、ではありません。

なぜ『一番安いモデル』がエージェント経済の分岐点なのか

チャットの時代は、1リクエスト=1回のモデル呼び出しでした。エージェントの時代は違います。1つのタスクが、計画→ツール呼び出し→結果整形→再試行→ログ要約→分類…と多数の呼び出しに分解されます。業界の試算では、1つのエージェント型タスクが数回〜十数回のモデル呼び出しを発し、1チャット往復の10〜数十倍のトークンを消費するとされます(ベンダー試算のため幅があり、方向性として捉えるべき数字です)。

この構造では、総コストの大半は“賢い計画役”ではなく“大量に回る雑務役”で発生します。計画や最終判断は1タスクに数回。対して、ツール出力の整形、形式チェック、分類、ログ要約、長い文書からの抜き出しは数十回単位で走ります。ここをすべて上位モデルに通すと、賢さが不要な場面にフロンティア単価を払い続けることになる——これがエージェント運用でコストが膨らむ典型です。

規模感を一例で見ます。Anthropic の価格ドキュメントは、1件あたり約3,700トークンの顧客対応を Haiku 4.5 で処理すると1万件あたり約$37と示しています(価格表)。同じ短尺処理を Haiku 5.5 の“10万トークンまで”区分に載せれば、単価は約9割下がる計算になります。件数が増えるほど、底値の差がそのまま運用費の差になります。

⚠️

逆に言えば、底値が下がったからこそ落とし穴も深くなります。Haiku 5.5 は10万トークンを境に単価が5倍に跳ねる設計です。長大なコンテキストを雑に詰め込む運用だと、「安いはずのモデル」が境界線の向こうで急に高くつきます。コンテキスト圧縮や分割、キャッシュ活用を前提に、プロンプトを10万トークン内に収める設計が実利に直結します。努力度を上げすぎる、賢さが要る判断まで小型に落とす、といった“安さに引きずられた設計の緩み”も、品質とやり直しコストに跳ね返ります。

『どのモデルに何をやらせるか』を先に決める

ここから先は、個別モデルの善し悪しではなく階層化(tiering)の設計の話です。エージェントを「計画役」と「働き手」に分け、賢さが要る判断だけを上位に、反復的で大量な雑務を下位に流す——この振り分けを後付けではなく最初に決めておくことが、品質とコストを両立させる勝ち筋になります。

作業の性質担当の目安理由
計画・最終判断・複雑な自律コーディングOpus 5.5 / Sonnet 5.5長い推論と文脈統合が必要。回数は少ない
サブエージェント(部品の抜き出し・整形)Haiku 5.5回数が多く、狭いタスク。単価が効く
分類・ルーティング・形式チェック・再試行判定Haiku 5.5(低努力度)賢さより安定した指示追従と低単価
要約・コンテキスト圧縮・ログ整理Haiku 5.5大量に走る裏方処理。Anthropic も推奨用途に明記
顧客対応・ブラウザ操作など速度優先Haiku 5.5体感速度が価値。βでブラウザ/コンピュータ操作に対応

この設計が机上論でないことは、公開された企業事例が示しています(いずれも発表)。金融分析の Rogo は 10-K(年次報告書)から数値を引き出すサブエージェントとして Haiku 5.5 を使い、Cognition は上位モデルの“相棒”に据えた構成で FrontierCode のスコア 66.2 を報告。AlphaSense の「Ask in Document」機能は週に約800万回の呼び出しを捌き、Asana は従来モデル比で30%超の低遅延・1ターンあたり最大2.5倍の高速化、Box は Haiku 4.5 比で約半分の遅延を報告しています。共通するのは、Haiku を“主役”ではなく“高頻度の働き手”として据え、上位モデルと役割分担している点です。

✅

階層化の第一歩は、賢いモデルを選ぶことではなく、業務を“判断”と“雑務”に棚卸しすることです。どの処理が何回走るかが分かって初めて、どこに底値のモデルを当てれば効くかが決まります。モデルの値下げは追い風ですが、効かせるのは設計です。

homula の観点——“働き手の階層”を運用に落とす

homula は n8n / Dify / LangGraph を活用し、エンタープライズのエージェントを PoC(最短5日)から本番・内製化まで一気通貫で支援しています。今回のような底値の更新を実利に変えるために、私たちが重視するのは次の順序です。

  • 業務棚卸しから入る: 「判断」と「反復的な雑務」を分け、どの処理が何回走るかを可視化する。ここが決まらないと、モデル単価が下がっても効かせどころが定まりません。AIエージェント・ブートキャンプ(3〜5日で業務棚卸し・プロトタイプ構築・ROI試算)はまさにこの切り分けのための場です。
  • モデルを“差し替え可能な部品”として組む: 計画役と働き手を疎結合にしておけば、Haiku 5.5 のような底値更新が出るたびに、雑務の段だけを安全に乗せ替えられます。特定モデルに固着した設計は、値下げの恩恵を取りこぼします。
  • 大量に回る段ほど統制を効かせる: 底値が下がると、小型モデルを使ったエージェントは件数も接続先も増えます。Agens は MCP を活用し200以上のツールと構築ゼロで接続でき、Agens Control が承認フロー・DLP・5年分の監査ログ・RBAC を提供します。「安くなったから増やす」を、追跡可能な拡張にするための土台です。

既存のお客様では、こうした切り分けと自動化で処理時間を 93%削減した例もあります。重要なのは、モデルが安くなったこと自体ではなく、安い働き手を“どこに・何回・どの権限で”当てるかを設計しきることです。

まとめ

Haiku 5.5 の登場で、Anthropic のモデル階層は上から下まで出そろいました。注目は上段の性能競争に集まりがちですが、エージェントの運用費を実際に左右するのは、裏方で大量に回る底値のモデルです。10万トークンまで約9割安という今回の更新は、その底値を一段押し下げ、「どのモデルに何をやらせるか」という階層化の設計を、コスト面からも正面の論点に押し上げました。

  • フロンティアの値下げに続く主役は、“働き手の階層”の底値更新。
  • エージェント経済は、雑務役の単価×回数で決まる。賢さが不要な場面に上位単価を払わない設計が効く。
  • Haiku 5.5 は10万トークンの境界と努力度設定を持つ。安さを活かすも殺すも、コンテキスト設計と役割分担次第。
  • 効かせるのはモデルではなく設計。業務棚卸し→階層化→統制の順で落とし込む。

モデルの値下げは、設計が追いついて初めて利益になります。自社の業務のどこに“安い働き手”を当てれば効くか——その棚卸しと階層化の設計から、一緒に始めましょう。

無料相談を予約する

AIエージェント・ブートキャンプで業務棚卸しとROI試算を見る

Agens Controlで承認・監査・ガバナンス設計を見る

LLMAIエージェントモデル選定コスト最適化サブエージェントエンタープライズ

AIエージェント導入、何から始めるべきか迷っていませんか?

homulaは、エンタープライズ企業向けにAIエージェントの導入を一気通貫で支援するAIインテグレーターです。まずは30分の無料相談で、貴社の課題に最適なアプローチをご提案します。

株式会社homula(ホムラ)は、2019年創業・累計調達3.2億円のAIインテグレーターです。n8n・Dify・LangGraphを活用したAIエージェント導入支援を専門とし、戦略策定からPoC(最短5日)、本番実装、運用・内製化までを一気通貫で提供しています。