Anthropicが今週リリースしたClaude Haiku 5.5は、Claude 4.5比で平均75%の実行コスト削減を実現した。軽量モデルの価格破壊は、これまで単価の壁で諦められてきた「全社員×AI自動化」を一気に射程に入れる。本稿では、エンジニア視点でこの価格改定の意味と、モデル使い分けアーキテクチャの再設計を論じる。

何が起きたか

AnthropicはClaudeシリーズの最軽量モデル「Haiku 5.5」を公開した。公式が強調するのは単純な性能向上ではなく、ランニングコストが前世代のClaude 4.5と比較して平均75%削減された点だ。Haikuはシリーズの中で、問い合わせメールの分類、議事録の要約、チャットのルーティング判定といった「毎日大量に繰り返す定型処理」を担う位置づけのモデルである。つまり今回のアップデートは、フラッグシップの頭脳を競う話ではなく、インフラとしてのAIの単価競争が一段深く進んだことを意味する。1件あたり数円の処理を月数十万件、数百万件さばく業務ほど、この75%ディスカウントは直接的な粗利改善に跳ね返る。GPT系列やGemini Flash系との価格レンジ比較が今後激化するのは必至だ。

なぜこのニュースが重要か

エンジニア視点で見ると、このニュースの本質は「AI導入の損益分岐点が下方修正された」ことに尽きる。これまで多くの社内PoCは、精度が合格ラインに達しても「1リクエストあたりのトークン単価×想定QPS×営業日」で見積もると回収計画が崩れ、本番昇格できずに塩漬けになってきた。筆者が見てきた現場でも、要約・分類・抽出といったユースケースの7〜8割は、精度ではなく単価で止まっていた印象がある。Haiku 5.5が公称どおり75%安を実現するなら、昨日まで赤字だったワークフローの大半が、同じ設計のまま黒字に反転する。

さらに重要なのは、これが「全社員ぶんのAIエージェント」というアーキテクチャを現実化する点だ。1人1日あたり数百回のLLM呼び出しを前提にしたコパイロット的設計は、Opus/Sonnet級では到底採算が合わなかった。Haikuクラスが安くなることで、ユーザーごとに常時走る監視・下書き・分類系エージェントが初めてコスト正当化される。AI活用はツール導入から常駐インフラへとフェーズが変わる。

技術的な深掘り

仕様書から本質を読む立場で言えば、注目すべきは「アーキテクチャが二層化する」ことだ。従来のRAGやエージェント設計は、1モデルで全工程を回す素朴な構成が主流だった。しかしHaiku 5.5の登場で、合理的な設計はほぼ確実にルーター型へ移行する。入力の難易度を軽量モデル自身が判定し、ルーチン処理はHaiku 5.5で即応、曖昧性や論理深度が必要な分岐のみSonnet 4.5やOpus級へエスカレーションする、という二段構えだ。

この設計で効くのは、キャッシュ戦略とプロンプト分割である。Haikuは単価が下がるほど、同じコンテキストを使い回すプロンプトキャッシュのヒット率が利益率を直撃する。1リクエストあたりのsystem promptやツール定義を薄く保ち、user入力だけを差し替える構造にリファクタするだけで、実効単価はさらに下がる。加えて、Haiku 5.5を「前段フィルタ」として使い、Sonnetへの投げ込み量を5〜10%に絞り込むパターンは、総コストを一桁落とす定石になると推定する。1モデル完結主義の設計書は、今週をもって技術的負債に分類していい。

経営者として次に取るべき動き

第一に、現在Sonnet/Opus級で動かしているパイプラインの棚卸しを即座に行い、「分類」「抽出」「要約」「ルーティング」の工程をHaiku 5.5に置換するPoCを48時間以内に立ち上げること。既存プロンプトを流用した差し替え検証だけでも、月次コストの試算は劇的に変わる。

第二に、これまで単価で諦めていた「全社員が毎日叩くAI」の企画を再提出させること。問い合わせ下書き、議事録整形、Slack要約など、1人あたり月数百円の予算感で設計できる領域が広がった。従量課金前提の社内SaaS化が現実解になる。

第三に、モデル選定を「1本化」から「ルーター前提」に組織標準として明文化すること。難しい判断は4.5、量はHaiku 5.5、という使い分けを設計レビューの必須チェック項目に加える。単一モデル依存は今後、コストと信頼性の双方でハンデになる。