Claude Haiku 5.5 正式リリース:平均75%値下げの裏に潜む10万トークンの価格崖

2026年10月7日、AnthropicはClaude Haiku 5.5を正式リリースした。料金は100万トークンあたり入力$0.10、出力$0.50(10万トークン以内)で、前世代のHaiku 4.5の入力$1.00、出力$5.00と比較すると、短文テキストシナリオでは約90%の値下げとなる。Anthropic公式ブログでは平均値下げ幅を約75%としている。このモデルはAmazon Web Services、Google Cloud、Microsoft Azureに同時展開されており、APIの識別子はclaude-haiku-5-5となっている。

ただし、1回のリクエストが10万トークンを超えると、料金は即座に5倍に跳ね上がり、100万トークンあたり入力$0.50、出力$2.50となる。Haiku 4.5の料金体系は均一レートで、いかなるしきい値も存在しなかった。これは、検索拡張生成(RAG)、エージェントの会話履歴の連結、または長文書処理を行うチームにとって、実際のコスト削減幅が見出しの数字を大きく下回る可能性を意味する。beri.netの報道によると、Haiku 5.5のトークナイザーは同じテキストをHaiku 4.5と比べて約30%多くトークンとしてカウントするため、実質的な値下げ幅はさらに圧縮される。移行を検討するチームは、旧来の呼び出しコスト計算表をそのまま流用するのではなく、新モデルでトークン消費量を改めて試算する必要がある。

段階的料金体系のビジネスロジック

Anthropicは、Haiku 5.5の位置付けを率直に説明している。「高頻度かつコスト重視のタスク向けに設計されている」というこの位置付けは、公式ブログとAWSの発表で一貫している。対象となるのは、文書の要約、コンテキスト圧縮、データベースクエリ、チケット分類、音声アシスタントのレスポンス、ブラウザ操作ボットといったタスクだ。これらに共通するのは、リクエスト量が多く、1回あたりのテキストが短く、レイテンシに敏感であり、超長コンテキストをほとんど必要としないという特徴である。

段階的料金体系は本質的に、料金構造によってこの製品の境界を強化するものだ。Haikuを本来の強みである短文・高頻度領域へと誘導し、SonnetとOpusのために長コンテキストや高度な推論を要する市場空間を確保する。Haiku 5.5は同月中にOpus 5.5、Sonnet 5.5とともに完全な3層体系を構成しており、Claude 5.5世代として初めて統一バージョン番号のもと全ラインナップが揃ったことになる。Anthropicはまた、Sonnet 5.5のキャッシュ読み取り価格を半額に引き下げた。公式によれば、これにより多くのエージェントタスクにおけるSonnet 5.5のコストが約20%削減されるという。あわせてClaude MaxおよびTeamサブスクリプションユーザーへの月次API枠の追加も実施し、Claudeプラットフォーム上でのエージェントアプリケーション構築を促進する。

Haiku 5.5は、Haiku級モデルとして初めて調整可能なエフォート係数(adjustable effort setting)を導入した初のモデルでもある。ワークロード全体に一律の設定を適用するのではなく、低コストと高知能の間で動的な調整が可能だ。これはOpus 5.5とHaiku 5.5の2モデル連携パターンと直接呼応している。OpusがプランニングとJudgmentを担い、Haikuが明確に定義された高頻度サブタスクを実行するというものだ。AWSの発表では、このパターンを明示的に説明している。「Opus 5.5がプランニングとJudgmentを担い、Haiku 5.5が定義されたタスクを高速かつ大規模に実行することで、強力な組み合わせが生まれる」。

ベンチマーク:前世代に対する世代を超えた性能向上

Anthropicが公表したベンチマークデータによると、Haiku 5.5のHaiku 4.5に対する性能向上幅は通常のバージョンアップの域を大きく超えており、世代交代に近い水準だ。コンピューター操作テストOSWorld 2.1(オフラインサブセット)では、Haiku 5.5が72.4%を記録したのに対し、Haiku 4.5はわずか15.7%、GPT-6 Lunaは48.9%、Sonnet 5.5は83.9%だった。専門的知識作業の評価指標GDPval-AA v2.1では、Haiku 5.5のEloレーティングが1620で、Haiku 4.5の735を大幅に上回り、GPT-6 Lunaの1437も超えたが、Sonnet 5.5の1840には及ばなかった。専門家レベルの多分野推論テストHumanity's Last Exam(ツール使用あり)では、Haiku 5.5が57.4%を獲得した一方、Haiku 4.5はわずか18.7%、Sonnet 5.5は64.5%だった。

コーディング能力については、Terminal-Bench 4.0のエージェントプログラミングタスクでHaiku 5.5が39.2%、GPT-6 Lunaが16.4%、Haiku 4.5が0.0%。FrontierCode 1.1コードアリーナのメインランキングでは、Haiku 5.5が46.4%、GPT-6 Lunaが42.4%、Sonnet 5.5が52.1%だった。

2026年のスモールモデル価格競争の背景

Haiku 5.5のリリースは、2026年にAI推論価格が持続的に下落しているという大きな流れの中に位置している。複数の独立した情報源によると、GoogleはすでにGemini 4 Argonの価格を100万入力トークンあたり$2、出力$10まで引き下げた。Mistralはパラメーター数6750億(うちアクティブパラメーター410億)のMistral Large 4を投入し、低コストの1トークンあたり価格で大規模推論市場に参入している。さらに小規模なモデル領域では、複数のAI料金分析プラットフォームのデータが示すように、Gemini FlashシリーズやMistral Smallといった製品の入力料金はすでに100万トークンあたり$0.10〜$0.25の帯に落ちており、Haiku 5.5の短文テキスト向け入力価格$0.10はこの競争帯に直接参入することになる。

Haiku 5.5とGPT-6 Lunaの比較は個別に検討する価値がある。Anthropic自身が公表したベンチマークデータによれば、Haiku 5.5はコンピューター操作とコードエージェントタスクの両方でGPT-6 Lunaを上回っており、OSWorld 2.1では72.4%対48.9%、Terminal-Bench 4.0では39.2%対16.4%だ。一方、FrontierCode 1.1では差が縮まり(46.4%対42.4%)、従来型コードアリーナでは全面的なリードではないことを示している。

開発者と企業向けの実践的な提言

移行を評価中のチームにとって、判断の核心ロジックは次の通りだ。まず実際のトークン長の分布を把握し、そのうえでコストを計算すること。リクエストの95%以上が10万トークン以内に収まるならば、短文テキストの90%値下げは実質的なコスト削減をもたらす可能性が高い。しかし、ワークロードにRAG検索の連結や長い会話履歴が多く含まれる場合は再計算が必要だ。10万トークンのしきい値を超えた際の5倍のプレミアムが、帳簿上の優位性を大きく損ないかねない。あわせて、トークナイザーのカウント効率の変化により、新モデルで典型的なリクエストのサンプルを実際に走らせる前のコスト試算はいずれも不正確なものとなる。

企業のアーキテクチャ選定においては、Opus 5.5とHaiku 5.5の連携パターンに明確なコストロジックの裏付けが生まれた。プランニング、Judgment、複雑な推論をOpusに任せ、明確に定義された実行タスク(ツール呼び出し、フォーマット処理、要約、分類)をHaikuに委ねることで、全体的なタスク品質を下げることなく大幅なコスト管理が可能になる。このパターンの前提はタスク分解が十分に明確であることだ。エージェントのサブタスク自体の境界が曖昧で、タスク間のメモリ参照が頻繁に発生する場合、オーケストレーションのオーバーヘッド自体が新たなコスト要因となりうる。

すでにHaiku 4.5を利用中のチームにとって、移行のコード変更は比較的軽微であり、API識別子を置き換えるだけで接続が完了する。ただしHaiku 5.5には新たな制約が導入されている。beri.netの報道によると、新バージョンは一部の旧来のassistant prefillテクニックをサポートしなくなっており、また適応的思考(adaptive thinking)がデフォルトで有効になっている。移行前に、既存のプロンプトエンジニアリングがこれらの動作に依存していないかを確認する必要がある。

将来展望

Haiku 5.5はClaude 5.5の3層体系のパズルを完成させたが、より重要なシグナルは次の点にある。Anthropicはこの世代において、もう一つのフラッグシップ推論ブレークスルーではなく、スモールモデルの値下げをリリースサイクルの締めくくりとして選択したということだ。これは2026年の業界全体における競争の重心の移動と方向が一致している。推論能力のトップ層での差は縮まりつつあり、コストとエンジニアリングの実用性が、ますます多くの本番環境での意思決定における最優先変数になりつつある。

Sonnet 5.5のキャッシュ読み取り半額化とMax/Teamサブスクリプションへの月次API枠追加は、プラットフォームロックインを図る施策だ。ユーザーのエージェントワークロードをClaudeエコシステム内に留め、競合他社が低価格を打ち出した際に自由に移行されないようにするためのものだ。Anthropicが次のステップとして長コンテキストタスクにおけるSonnetの限界コストを引き続き引き下げるならば、3層料金体系は一度限りの対話から大規模エージェントデプロイに至るまでのコスト曲線全体を真にカバーするものとなるだろう。