Sonnet 5.5 があるのに、なぜ Claude Haiku 5.5 を使うのか

AI入門

「Sonnet 5.5 で十分賢いし、速さも困っていない。わざわざ一段下の Haiku を選ぶ理由ってあるの?」

2026年10月7日に Anthropic が Claude Haiku 5.5 を公開したとき、多くの人がまずこう思ったはずです。実際、同じ日の発表には「Sonnet 5.5 のキャッシュ読み出しを半額にした」という知らせも入っていました。Sonnet 自体が安くなったのなら、なおさら Sonnet 一本でよさそうに見えます。

この記事では、その疑問に実験で答えます。Claude Code(2.1.293)を使い、同じ課題を Haiku 5.5・Sonnet 5.5・Haiku 4.5 に解かせて、正解率・費用・時間を比べました。課題は、公式が「Haiku 5.5 に向いている」と挙げる仕事(サブエージェント、分類)と、「Sonnet のほうが向いている」と挙げる仕事(コーディング)の両方から選んでいます。

先に結論を書きます。

  • 品質だけで比べれば「Sonnet で十分」は正しい。Haiku 5.5 にできることは Sonnet 5.5 にもでき、77 種類の問い合わせ分類では Sonnet 5.5 が 81%、Haiku 5.5 は 60% と大差がつきました。公式のベンチマークでも、長く複雑なコーディング作業では、Haiku 5.5 を最大の effort で動かすより、それより安く済む設定の Sonnet 5.5 のほうが正解率が高くなっています
  • それでも Haiku 5.5 を使う理由は、同じ結果が出る仕事を、Sonnet 5.5 の 1/4〜1/9 の費用でこなせるからです(1 トークンの単価は 1/20)。コードを調べて答える 9 問は両者とも全問正解で、費用は約 1/8。範囲を区切ったバグ修正・機能追加 12 課題も両者とも全部合格で、費用は約 1/4.5 でした。ただし、コーディングでは Haiku 5.5 のほうがやり取りの回数が多く、待ち時間はむしろ長くなりました
  • いちばん現実的な使い方は「Sonnet をやめて Haiku にする」ではなく、Sonnet を指揮役に残し、調べものをする係(サブエージェント)だけ Haiku 5.5 にすることです。この構成で、正解率を落とさずに費用が 58% 減りました

想定読者は、Claude Code や Claude API をふだん使っていて、モデルの使い分けに迷っている人です。前半で Haiku 5.5 の中身を整理し、後半で 5 つの実験の結果と、Claude Code での設定方法を説明します。

この記事の確認範囲

  • 検証日:2026年10月8日。モデルは claude-haiku-5-5・claude-sonnet-5-5・claude-haiku-4-5
  • 実行環境:Claude Code 2.1.293(npm で実験フォルダにだけ導入)を claude -p(対話なしの実行モード)で起動。認証は Claude Max のログイン。macOS(Apple M5 Max)
  • 費用:Claude Code が表示する推定額ではなく、記録したトークン数に公式料金表の単価を掛けて計算しました(理由は後述)
  • 公式情報:Anthropic の発表ページ「Introducing Claude Haiku 5.5」、Claude Platform の料金ページ、Claude Code ドキュメント(Sub-agents・Model configuration)。いずれも 2026-10-08 に確認
  • 実験に使った題材:Python のライブラリ sqlite-utils 3.38(Apache 2.0)と、問い合わせ分類のデータセット Banking77(CC BY 4.0)

結論を 1 枚で:Sonnet を残して、調査係だけ替える

まず、この記事でいちばん伝えたい構成を図で見てください。左が「全部 Sonnet 5.5」、右が「指揮役は Sonnet 5.5、調べものの係だけ Haiku 5.5」です。

全部をSonnet 5.5で動かす構成と、指揮役だけSonnet 5.5に残して調査係をHaiku 5.5にした構成を比べ、同じ9問の正解数のまま費用が0.297ドルから0.126ドルに下がった

同じ 9 問・同じ指示で 3 回ずつ実行した平均。正解はどちらも 9 問中 9 問。費用は 58% 減、時間も 62 秒から 45 秒に縮んだ

Haiku 5.5 は「Sonnet の代わり」ではなく、「Sonnet の部下」として使うと強みが出ます。答えが 1 か所に決まる調べもの、要約、定型の判断のように、範囲がはっきりした小さな仕事を数多くこなす役目です。逆に、全体の設計や、似た選択肢の細かい違いを見分ける判断は、Sonnet 以上に任せたほうが安全です。

この線引きを、ここから順番に確かめていきます。

Claude Haiku 5.5 とは:何が変わったのか

主な仕様

公式発表と料金ページの内容を表にまとめます。比較のため、前の世代の Haiku 4.5 と Sonnet 5.5 も並べました。

項目Haiku 5.5Haiku 4.5Sonnet 5.5
API のモデル IDclaude-haiku-5-5claude-haiku-4-5claude-sonnet-5-5
入力(100 万トークンあたり)$0.10(10 万超は $0.50)$1.00$2.00
出力(同)$0.50(10 万超は $2.50)$5.00$10.00
キャッシュ読み出し(同)$0.01(10 万超は $0.05)$0.10$0.10(10/7 に $0.20 から値下げ)
effort(考える深さ)の調整low〜max の 5 段階なしlow〜max の 5 段階
API での effort の既定値medium—high
コンテキスト長100 万トークン20 万トークン100 万トークン
最大出力12.8 万トークン6.4 万トークン12.8 万トークン

ここで押さえておきたい点が 3 つあります。

1 つ目は、1 トークンあたりの値段が Sonnet 5.5 のちょうど 20 分の 1 だということです。Haiku 4.5 と比べても 10 分の 1 になりました。

2 つ目は、プロンプトが 10 万トークンを超えると単価が 5 倍になることです。公式は「Haiku 4.5 へのリクエストの約 9 割は 10 万トークン以下だった」と説明しています。5 倍になっても Sonnet 5.5 の 4 分の 1 なので割高ではありませんが、後で説明するように、気づかないうちに 10 万を超える使い方をしていることがあります。

3 つ目は、Haiku で初めて effort を選べるようになったことです。effort は「どれだけ考えてから答えるか」の設定で、low にすると速く安く、max にすると時間とトークンを使って慎重に答えます。

入力・出力・キャッシュ読み出しの単価を3モデルで比べた棒グラフ。Haiku 5.5はSonnet 5.5の20分の1で、10万トークンを超えると5倍になる

棒はグループごとに比例。Sonnet 5.5 も同じ日にキャッシュ読み出しが半額になったので、キャッシュ読み出しだけは差が 10 倍に縮んでいる

公式ページの料金表は次のとおりです。

Anthropic公式発表ページの料金表。Haiku 5.5、Haiku 4.5、Sonnet 5.5の入力・出力・キャッシュの単価が並ぶ

出典:Anthropic「Introducing Claude Haiku 5.5」の Pricing(2026-10-08 に撮影)

公式ベンチマークで見る「得意・不得意」

公式発表には、Haiku 5.5・Haiku 4.5・Sonnet 5.5 などのベンチマーク結果が載っています。主なものを抜き出しました。

ベンチマーク(測るもの)Haiku 5.5Haiku 4.5Sonnet 5.5
OSWorld 2.1(パソコン操作)72.4%15.7%83.9%
GDPval-AA v2.1(知的作業)16207351840
Humanity’s Last Exam(難問、道具なし)45.9%10.2%56.9%
Terminal-Bench 4.0(端末での長いコーディング作業)39.2%0.0%70.6%

Haiku 4.5 からの伸びは大きく、パソコン操作では Sonnet 5.5 にかなり近づいています。一方、Terminal-Bench 4.0 だけは Sonnet 5.5 の半分ほどです。これは、端末の上で何十手もかけて課題を解く、長く複雑な作業を測るベンチマークです。

公式ページには、この Terminal-Bench 4.0 の「正解率と費用」のグラフも載っています。

Terminal-Bench 4.0の正解率と1回あたり費用のグラフ。Haiku 5.5はeffortをmaxにして約2.5ドルで約39%、Sonnet 5.5は約1.5ドルで約43%に届く

出典:Anthropic「Introducing Claude Haiku 5.5」(2026-10-08 に撮影)。赤い線が Haiku 5.5 の effort ごとの点、青い線が値下げ後の Sonnet 5.5

このグラフは「Sonnet で十分では?」という疑問に対する、公式からの率直な答えになっています。グラフから読み取った概数ですが、Haiku 5.5 は effort を max まで上げると 1 回 2.5 ドルほどかかって約 39% です。一方、Sonnet 5.5(値下げ後)は 1 回 1.5 ドル前後の点ですでに約 43% に届いています。同じ 0.6〜0.7 ドルほどの費用で比べても、Haiku 5.5 の medium が約 20%、Sonnet 5.5 は約 20〜29% です。長く複雑なコーディングでは、Haiku を頑張らせるより Sonnet を使うほうが、安くて正解率も高いのです。公式も「複雑なエージェント型コーディングには Sonnet 5.5 と Opus 5.5 のほうが向いている。Haiku 5.5 は、要約・コンパクション(会話の圧縮)・サブエージェントのような範囲の狭い仕事に向く」と書いています。

同じ日に発表された、ほかの変更

Haiku 5.5 の発表には、次の 2 つも含まれていました。どちらも使い分けの判断に関わります。

  • Sonnet 5.5 のキャッシュ読み出しが半額(100 万トークンあたり $0.20 → $0.10)。エージェントの処理はキャッシュ読み出しが多いため、公式は「多くのエージェント処理で Sonnet 5.5 の費用が約 20% 下がる」としています
  • Max・Team プランに毎月の API クレジット。Max 5x は月 $100、Max 20x は月 $200、Team は最大 $500(利用者全員で共有)。どのモデルにも使えます

Sonnet が安くなったぶん、「Sonnet で十分」という感覚はさらに強くなりました。それでも Haiku を使う意味があるのかを、ここから実験で確かめます。

検証の設計:5 つの実験

実験は、Haiku 5.5 に任せたくなる仕事と、任せるか迷う仕事から 5 つ選びました。

5つの実験の一覧。コード調査、指揮役と調査係、バグ修正と機能追加、問い合わせ分類、出力速度。それぞれ公式の位置づけを添えている

実験 1・2・4・5 は公式が Haiku 5.5 の用途として挙げる仕事、実験 3 は公式が「複雑なら Sonnet」とする仕事

比べたモデルと設定は次のとおりです。

呼び名モデルeffort
Haiku 5.5 lowclaude-haiku-5-5low
Haiku 5.5 mediumclaude-haiku-5-5medium(既定)
Haiku 5.5 highclaude-haiku-5-5high(実験 3・4 のみ)
Haiku 5.5 maxclaude-haiku-5-5max(実験 4 のみ)
Sonnet 5.5claude-sonnet-5-5medium(API の既定は high。Haiku と条件をそろえた)
Haiku 4.5claude-haiku-4-5(設定なし)

実験の準備

実験はすべて、Claude Code を claude -p で起動して行いました。Claude Code の本体はふだん使っているものとは別に、実験フォルダにだけ最新版を入れています。

# 実験用フォルダに Claude Code 2.1.293 を入れる(本体の更新はしない)
mkdir -p lab/cc && cd lab/cc
npm init -y
npm install @anthropic-ai/claude-code@2.1.293
./node_modules/.bin/claude --version   # 2.1.293 (Claude Code)

Haiku 5.5 を正しく扱えるのは 2.1.293(10月7日公開)からです。手元にあった 2.1.288 で --model claude-haiku-5-5 を指定すると、動きはするものの unrecognized_model という警告が出て、「OK とだけ返して」という 1 回の呼び出しの費用推定が $0.078 と表示されました。同じトークン数を Haiku 5.5 の単価で計算すると約 $0.002 なので、40 倍近い過大表示です。2.1.293 では正しい単価で計算されます。

1 回の実行は、次のような形です。ふだんの設定(個人用の CLAUDE.md やフック)が結果に混ざらないよう、実験フォルダの .claude/settings.local.json で切り離しています。

# 実験に使うフォルダ(lab/ と同じ階層)で実行する
# 個人用の CLAUDE.md とフックを無効にする(<HOME> は自分のホームディレクトリの絶対パスに置き換える)
mkdir -p .claude
cat > .claude/settings.local.json <<'EOF'
{"claudeMdExcludes": ["<HOME>/.claude/CLAUDE.md"], "disableAllHooks": true}
EOF

# Haiku 5.5(effort low)に、読み取り系のツールだけを渡して質問する
CLAUDE_CODE_DISABLE_ADVISOR_TOOL=1 ./lab/cc/node_modules/.bin/claude -p "質問文" \
  --model claude-haiku-5-5 --effort low \
  --tools "Read,Grep,Glob,Bash" \
  --setting-sources project,local \
  --strict-mcp-config \
  --output-format stream-json --verbose < /dev/null > log.jsonl

--output-format stream-json にすると、1 回ごとのリクエストのトークン数(入力・キャッシュの読み書き・出力)が記録されます。費用はこの数字に公式の単価を掛けて計算しました。Claude Code が最後に出す推定額(total_cost_usd)を使わなかったのは、2.1.293 でも Sonnet 5.5 のキャッシュ読み出しを値下げ前の $0.20 で計算していたためです。なお Claude Code はキャッシュを 1 時間保持する設定で書き込むため、キャッシュ書き込みは入力単価の 2 倍で計算しています。

計測でつまずいた点:コネクタがプロンプトを膨らませる

最初の試運転で、Haiku 5.5 に 1 問解かせただけで費用が $0.156 になりました。調べると、3 回目のリクエストのプロンプトが 15 万トークンに膨らんでいました。

コード調査1問のリクエストごとのトークン数。そのままだとHaiku 5.5は7.6kから150kに、Sonnet 5.5は最初から144kに膨らむが、strict-mcp-configを付けると約10kに収まる

原因は claude.ai に登録しているコネクタ(Gmail・Notion・Slack など 7 個)のツール定義。接続が終わった時点から、後のリクエストにまとめて入る

--tools で使えるツールを絞っても、claude.ai 側のコネクタ(MCP サーバー)は別扱いで読み込まれます。接続は非同期なので、最初の数リクエストは小さく、接続が終わった時点から一気に増えます。Haiku 5.5 の場合は 10 万トークンを超えて単価 5 倍の料金帯に入り、1 問の費用が約 90 倍になっていました。

--strict-mcp-config を付けるとコネクタが読み込まれなくなり、プロンプトは約 1 万トークンに収まりました。あわせて、サーバー側で Opus 5.5 に相談する「Advisor」機能も CLAUDE_CODE_DISABLE_ADVISOR_TOOL=1 で切り、モデル単体の比較にしています。

これは実験だけの話ではありません。ふだんの Claude Code でも、コネクタを多く登録していると、その定義が毎回のプロンプトに乗ります。Haiku 5.5 を安く使うつもりなら、10 万トークンの境目を意識して、不要なコネクタを外しておくのが効果的です。

実験 1:コードを読んで答える(サブエージェントの典型的な仕事)

やったこと

sqlite-utils 3.38 のソースコードに対して、答えが 1 か所に決まる質問を 9 問作りました。たとえば「insert_all() は既定で何行ずつ INSERT するか。列が多いときはどう減らすか」「sqlite-utils memory に同じ名前の CSV を 2 つ渡すと、2 つ目は何というテーブルになるか」といった質問です。正解は実際にコードを読み、いくつかはコマンドを実行して確かめました。

各モデルには Read・Grep・Glob・Bash の 4 つのツールだけを渡し、「推測せずコードで確かめ、最後の行に ANSWER: で答える」よう指示しました。9 問を 2 回ずつ、計 18 回です。これは、Claude Code の Explore サブエージェント(調べもの専門の係)がふだんしている仕事とほぼ同じです。

結果

コード調査の結果。4つの設定すべてが18問中18問正解。1問あたりの費用はHaiku 5.5 lowが0.0023ドル、mediumが0.0027ドル、Sonnet 5.5が0.0211ドル、Haiku 4.5が0.0514ドル

正解率は全設定で同じ。差が出たのは費用と時間だけだった

設定正解1 問の費用1 問の時間(中央値)平均の手数(ターン)
Haiku 5.5 low18/18$0.00237.2 秒5.2
Haiku 5.5 medium18/18$0.002710.3 秒6.4
Sonnet 5.518/18$0.02119.5 秒3.8
Haiku 4.518/18$0.051430.6 秒9.3

全設定が全問正解でした。こうした「答えが 1 か所に決まる調べもの」では、Sonnet 5.5 の賢さは結果に表れません。差が出たのは費用で、Haiku 5.5 は Sonnet 5.5 の約 1/8〜1/9 でした。

面白いのは、Haiku 5.5 のほうが手数が多いことです。Sonnet 5.5 が平均 3.8 回のやり取りで答えるところを、Haiku 5.5 は 5〜6 回かけ、出力トークンも 1.5〜1.8 倍使っていました。公式も「Haiku 5.5 は新しいトークナイザーのため、同じ仕事に少し多くのトークンを使う」と説明していますが、今回の差はそれよりも、ツールを呼ぶ回数の差によるものが大きいようです。それでも単価が 20 分の 1 なので、合計では大差で安くなります。

時間は、medium の Haiku 5.5 と Sonnet 5.5 がほぼ同じで、low にすると少し速くなりました。前の世代の Haiku 4.5 は手数が多く(9.3 回)、時間も費用も Sonnet 5.5 より悪い結果でした。「Haiku=安くて速い」は 5.5 で初めて、このような調べもので本当になったと言えます。

実験 2:指揮役は Sonnet 5.5、調査係だけ Haiku 5.5

やったこと

実際の Claude Code では、メインの会話(指揮役)がサブエージェントに仕事を配ります。ここで注意が必要なのは、組み込みの Explore サブエージェントは、既定ではメイン会話と同じモデルで動くことです。メインが Sonnet 5.5 なら、調べものも Sonnet 5.5 が担当します。

そこで、実験 1 の 9 問をまとめて Sonnet 5.5 に渡し、「1 問ずつ Explore に任せ、自分ではファイルを読まない」と指示しました。Explore の定義だけを差し替えた 2 つの構成と、参考として全部 Haiku 5.5 の構成を、3 回ずつ実行しています。

  • 全部 Sonnet 5.5:Explore は model: inherit(メインと同じ)
  • 調査係だけ Haiku:Explore は model: haiku(2.1.293 では Haiku 5.5)
  • 全部 Haiku 5.5:メインも Haiku 5.5

Explore の差し替えには、プロジェクトの .claude/agents/Explore.md を使いました。

---
name: Explore
description: Read-only codebase search agent. Use it to locate code and answer questions about this repository; give it one focused question at a time.
tools: Read, Grep, Glob, Bash
model: haiku
---

You are a read-only code search agent for this repository. Find the code that answers the question you are given, verify it by reading the relevant lines, and reply with a concise answer that cites file paths and line numbers. Do not modify any files.

結果

Sonnet 5.5の指揮役が9問を9体のHaiku 5.5 Exploreに配り、報告をまとめる流れ。費用は全部Sonnetが0.297ドル、調査係だけHaikuが0.126ドル、全部Haikuが0.031ドル

3 構成とも 9 問すべて正解(3 回とも)。調査係を替えただけで費用は 58% 減った

構成正解1 回の費用うち Sonnet 5.5うち Haiku 5.51 回の時間
全部 Sonnet 5.59/9 × 3 回$0.297$0.297—62 秒
調査係だけ Haiku 5.59/9 × 3 回$0.126$0.106$0.02045 秒
全部 Haiku 5.59/9 × 3 回$0.031—$0.03142 秒

どの構成も、3 回とも 9 問すべて正解しました。指揮役は毎回 9 体の Explore を起動し、自分ではファイルを読まずに(Bash を使ったのは報告を待つ sleep だけでした)、9 件の報告をまとめて答えています。

調査係を Haiku 5.5 に替えると、費用は $0.297 から $0.126 へ 58% 減り、時間も 62 秒から 45 秒に縮みました。残った費用の 8 割強は指揮役の Sonnet 5.5 の分です。内訳を見ると、9 件の指示と報告で伸びていく会話をキャッシュに書き込む費用と、指示文やまとめの出力が大半でした。

全部 Haiku 5.5 にすればさらに 1/4 になります。ただ、今回の 9 問は「配って、集める」だけの単純な指揮でした。実際の開発では、指揮役が設計を考え、調査結果をもとに方針を決めます。その判断の質を Haiku に任せてよいかは、次の実験 3・4 の結果と公式の Terminal-Bench を合わせて考える必要があります。

実験 3:バグ修正と機能追加

やったこと

公式が「複雑なら Sonnet」とするコーディングでは、どこまで Haiku 5.5 に任せられるのでしょうか。sqlite-utils 3.38 を使って、次の 12 課題を作りました。

課題種類内容合否の判定
T1仕込んだバグ「テストがいくつか落ちている。テストは変えずに直して」とだけ伝える既存テスト
T2仕込んだバグtransform() で外部キー列の名前を変えると外部キーが壊れる既存テスト
T3仕込んだバグint と bool が混ざった列が FLOAT になる隠しテスト
T4仕込んだバグキーの順番が違うと hash_id が変わる(以前の値との互換も必要)隠しテスト
T5機能追加duplicate() と CLI に、行を絞り込む where 引数を足す隠しテスト
T6機能追加--detect-types で true/false の列を INTEGER にする隠しテスト
T7機能追加2 つの DB のテーブル差分を出す新コマンド compare(仕様 8 項目)隠しテスト
R1〜R4実際の不具合sqlite-utils の 4.x で修正された不具合 4 件(Issue 554・PR 764・Issue 702・PR 811)を利用者からの報告の形で渡す隠しテスト(修正時のテストを移植)
R-all実際の不具合R1〜R4 の 4 件を 1 回でまとめて直させる隠しテスト 4 本

「隠しテスト」は、モデルには見せずに、作業が終わった後でリポジトリに足して実行するテストです。合格の条件は、隠しテストと既存の全テスト(約 1,000 本)がすべて通ることにしました。T7 は新しいコマンドを足すので、ドキュメントにも載せないと既存の「全コマンドが文書化されているか」のテストが落ちます。全テストを自分で回して気づけるかも試しています。

各モデルには Read・Edit・Write・Grep・Glob・Bash を渡し、課題ごとに新しいコピーで 2 回ずつ解かせました。

結果

12課題×2回のコーディング結果。Haiku 5.5とSonnet 5.5は24回すべて合格。1課題の平均費用はHaiku 5.5 mediumが約0.019ドル、Sonnet 5.5が約0.084ドル。所要時間の中央値はSonnet 5.5のほうが短い

合格率は Haiku 5.5 と Sonnet 5.5 で同じ。費用は Haiku 5.5 が約 1/4.5、時間は Sonnet 5.5 のほうが短かった

設定合格1 課題の平均費用1 課題の時間(中央値)平均のやり取り回数不合格だった課題
Haiku 5.5 medium24/24$0.01952 秒20.8—
Haiku 5.5 high24/24$0.02998 秒25.5—
Sonnet 5.5 medium24/24$0.08435 秒9.1—
Haiku 4.521/26$0.297109 秒36.4T7(4 回中 3 回)、R-all(2 回とも)

Haiku 4.5 の T7 は、実行の重なりで 4 回走ったため 4 回とも数えています。

範囲がはっきりしていて、テストで確かめられる修正なら、Haiku 5.5 でも全部合格しました。実際に 4.x で直された不具合 4 件をまとめて渡した R-all も、2 回とも通っています。費用は 1 課題あたり平均で Sonnet 5.5 の約 4.5 分の 1 です。前の世代の Haiku 4.5 は、仕様の細かい新コマンド(T7)でエラー文言や rowid テーブルの扱いを取りこぼし、4 件まとめた R-all では 2 回とも一部の不具合を直しきれませんでした。しかも 1 課題の費用は Sonnet 5.5 の約 3.5 倍です。Haiku 4.5 の時代の「Haiku は安いが力不足」という印象は、5.5 ではコーディングでも当てはまりません。

一方で、時間は Sonnet 5.5 のほうが短いという、実験 1 とは逆の結果になりました。Haiku 5.5 は 1 課題に平均 21 回ほどやり取りをし、Sonnet 5.5 の 9 回の 2 倍以上かかっています。テストを実行し、結果を見て直し、また実行する、という往復が多いのです。1 回あたりの出力は速くても、往復の回数で逆転します。4 件まとめた R-all では、Sonnet 5.5 が約 80 秒、Haiku 5.5 medium が約 210 秒でした。

effort を high にした Haiku 5.5 は、合格率は同じまま、時間と費用が増えただけでした。T7 では 1 回のリクエストのプロンプトが 10 万トークンを超え、単価 5 倍の料金帯に入ったリクエストもありました。往復が増えると会話が伸び、この境目に近づきます。

なお、今回の 12 課題は「何を直せばよいか」がはっきりしていて、テストで合否を確かめられるものばかりです。公式の Terminal-Bench 4.0 のように、何十手もかけて環境を調べながら進める課題では、Haiku 5.5 と Sonnet 5.5 の差は大きく開きます。「Haiku 5.5 でもコーディングはできる。ただし、範囲を区切って、テストという答え合わせがある仕事に限る」と考えるのが妥当です。

実験 4:問い合わせの分類(Haiku 5.5 の弱点が出た)

やったこと

公式が Haiku 5.5 の用途として挙げる「分類」を試しました。題材は、銀行への問い合わせ文を 77 種類の意図(「カードが届かない」「暗証番号がロックされた」など)に分ける Banking77 です。各意図から 2 件ずつ、乱数の種を固定して 154 件を選びました。

1 件ずつ、ツールなし・システムプロンプトに 77 個のラベルを並べて、ラベル名だけを答えさせています。API を 1 回呼ぶのに近い形です。

# 分類 1 件の呼び出し(システムプロンプトを差し替え、ツールは使わない)
claude -p "Classify the following customer message.

<message>
I think the atm ate my card.
</message>" \
  --model claude-haiku-5-5 --effort medium \
  --system-prompt "$(cat classifier_system_prompt.txt)" \
  --tools "" --strict-mcp-config --setting-sources project,local \
  --output-format json

結果

Banking77の154件を77種類に分類した正解率。Haiku 5.5はlow・medium・highで56〜60%、maxで72%、候補を絞らせると76%。Haiku 4.5は76%、Sonnet 5.5は81%

費用は 1,000 件あたり(Claude Code 経由で 1 件ずつ実行した実測から計算)。Haiku 5.5 は既定の設定では Haiku 4.5 より低かった

設定正解率一覧にないラベルを答えた件数1,000 件の費用1 件の時間(中央値)平均の思考トークン
Haiku 5.5 low55.8%6$0.130.65 秒4
Haiku 5.5 medium60.4%4$0.140.66 秒11
Haiku 5.5 high60.4%5$0.140.65 秒19
Haiku 5.5 max72.1%1$0.401.34 秒542
Haiku 5.5 medium+候補を絞らせる76.0%2$0.402.89 秒302
Haiku 4.576.0%0$2.932.95 秒357
Sonnet 5.5 medium81.2%0$2.551.23 秒12
Sonnet 5.5 medium+候補を絞らせる77.9%2$4.803.09 秒1

時間は API の応答時間(Claude Code の起動時間を除く)です。

これは、この記事でいちばん意外な結果でした。公式が得意分野に挙げる分類で、既定の Haiku 5.5 は 60% にとどまり、Sonnet 5.5(81%)どころか前の世代の Haiku 4.5(76%)にも負けました。

誤りの中身を見ると、「似たラベルの取り違え」がほとんどです。

問い合わせ(要約)正解Haiku 5.5 の答え
店で仮想カードが使えなかったvirtual_card_not_workingcard_not_working
チャージしたのにアプリが受け付けないtop_up_failedpending_top_up
ATM の手数料が間違っているcash_withdrawal_chargeextra_charge_on_statement
本人確認の方法を知りたいverify_my_identitywhy_verify_identity
英国外でもカードを作れるかcountry_supportsupported_cards_and_currencies

どれも「大まかには合っているが、より細かいラベルがある」ケースです。Sonnet 5.5 はこれらを正しく選べていました。

手がかりは思考トークンの量にありました。Haiku 5.5 は low〜high のどれでも、1 件あたり 4〜19 トークンしか考えずに即答しています。effort を high にしても、モデルが「考えるまでもない」と判断すると思考が増えないのです。max にすると平均 542 トークン考えるようになり、正解率は 72% まで上がりました。

さらに、システムプロンプトに「答える前に、もっともらしいラベルを 3 つ挙げ、問い合わせの文言と比べてから、最後の行に LABEL: <ラベル> と書く」という指示を足すと、medium のままで 76% になりました。Haiku 4.5 と同じ正解率を、7 分の 1 以下の費用で出せたことになります。ただし、同じ指示を Sonnet 5.5 に足すと 78% に下がりました。考える手順を指示で補うのは Haiku 5.5 には効くが、Sonnet 5.5 には不要(むしろ逆効果)でした。

実は最初の試行では、問い合わせ文をそのまま渡していました。すると Haiku 5.5 は 154 件中 11〜12 件で、ラベルではなく「I’m…」「Yes,…」で始まる顧客への返事を書いてしまい、さらに 5 件で一覧にないラベルを作っていました(Sonnet 5.5 は作ったラベルが 1 件、Haiku 4.5 は返事が 1 件)。上のコマンドのように <message> タグで囲み、「次の問い合わせを分類して」と明示すると、返事を書く誤りは 1 件に減りました。Haiku 5.5 には、入力の役割をはっきり書いたほうが安定します。

まとめると、選択肢が多く、細かい違いを見分ける分類は、そのままでは Haiku 5.5 に任せられません。費用を優先するなら「候補を絞ってから答えさせる」指示を入れて Haiku 4.5 並みに引き上げる、正解率を優先するなら Sonnet 5.5 を使う、という選択になります。

実験 5:出力の速さ

公式は Haiku 5.5 を「標準の速度では、これまでで最速のモデル」としています。約 2000 字の説明文を書かせ、文字が届き始めてから終わるまでの 1 秒あたりの出力トークン数を、5 回ずつ測りました。

出力速度の比較。Haiku 5.5は毎秒約189トークン、Sonnet 5.5は約120、Haiku 4.5は約115。書き終わるまでの時間はHaiku 5.5が7.7秒、Sonnet 5.5が17.6秒

中央値。Haiku 5.5 は指定より短く書く傾向があり、文章量の差も時間の差に含まれている

設定出力速度(トークン/秒)最初の文字まで書き終わるまで書いた文字数
Haiku 5.5 low1891.8 秒7.7 秒1,135 字
Sonnet 5.51202.4 秒17.6 秒2,031 字
Haiku 4.51153.0 秒12.6 秒1,238 字

Haiku 5.5 の出力速度は Sonnet 5.5 の約 1.6 倍でした。一方で、「2000 字程度で」と頼んだのに Haiku 5.5 は 1,100 字前後で書き終えていました。速さの数字を見るときは、文章を短くまとめる傾向も一緒に効いていることに注意してください。分量の指定を守らせたい用途では、指示を具体的にするか、出来上がりの長さを確認する必要があります。

使い分けの判断:どの仕事を Haiku 5.5 に任せるか

5 つの実験と公式のベンチマークをまとめると、判断の順番は次のようになります。

Haiku 5.5に任せるかどうかの判断フロー。答えが確かめられる小さな仕事か、選択肢が多く細かい判断か、長く複雑な作業かで分岐する

実験結果と公式ベンチマークからまとめた目安。迷ったら、まず調査係から Haiku 5.5 にしてみるのが安全

判断のポイントを、図の順に補足します。

① 長く複雑な作業は Sonnet 以上に任せる。 公式の Terminal-Bench 4.0 では、Haiku 5.5 を max にしても、それより安い Sonnet 5.5 に正解率で負けます。設計を考える、環境を調べながら何十手も進める、といった仕事を Haiku に回しても、安くはなりません。

② 答えを確かめられる小さな仕事は Haiku 5.5 に任せる。 実験 1〜3 では、コード調査も、範囲を区切ったバグ修正・機能追加も、Haiku 5.5 は Sonnet 5.5 と同じく全部正解・全部合格でした。費用は 1/4〜1/9 です。ただしコーディングでは往復が多く、待ち時間は Sonnet 5.5 より長くなることがあります。待ち時間を減らしたいなら Sonnet、費用を減らしたいなら Haiku、と目的で選んでください。

③ 似た選択肢を見分ける判断は、工夫するか Sonnet にする。 実験 4 のように、そのままの Haiku 5.5 は細かい違いを取り違えます。「候補を絞ってから答えさせる」指示や effort max で差は縮まりますが、Sonnet 5.5 には届きませんでした。

effort の選び方も、今回の結果から目安を書いておきます。

effort向いている使い方(今回の結果から)
low答えが 1 か所に決まる調べもの。medium と同じ正解率で、少し速く安い
medium(既定)迷ったらこれ。コーディング課題も全部合格した
high今回の実験では medium より良くなった場面がなく、時間と費用だけ増えた
max分類のように「考えずに即答して間違える」仕事。思考が増えて正解率が上がった

なお、Haiku 4.5 を使っている場合は、移行を検討する価値があります。今回の実験では、分類を除くすべてで Haiku 5.5 のほうが安く、同等以上の結果でした。公式のモデル一覧では、Haiku 4.5 の提供終了(retirement)は「2026年10月15日より前には行わない」と書かれています。つまり、それ以降は終了する可能性があります。ただし分類のように既定設定で Haiku 4.5 より下がる仕事もあるので、切り替える前に自分の課題で比べてください。

Claude Code で Haiku 5.5 を使う設定

サブエージェントのモデルが決まる順番

Claude Code でサブエージェントのモデルがどう決まるかは、公式ドキュメント(Sub-agents)に書かれています。

サブエージェントのモデルは、呼び出し時の指定、エージェント定義のmodel、環境変数CLAUDE_CODE_SUBAGENT_MODEL、メイン会話のモデルの順に決まる。Exploreだけ差し替える定義ファイルの例

環境変数 CLAUDE_CODE_SUBAGENT_MODEL だけでは、組み込みの Explore と Plan は変わらない点に注意

設定方法を、目的別にまとめます。

やりたいこと設定
調べもの(Explore)だけ Haiku 5.5 にする.claude/agents/Explore.md を作り、model: haiku を書く(上の例)
自作のサブエージェントを Haiku 5.5 にするそのエージェント定義の先頭に model: haiku(必要なら effort: low)
すべてのサブエージェントを Haiku 5.5 にそろえる環境変数 CLAUDE_CODE_SUBAGENT_MODEL=haiku と CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1
メインの会話ごと Haiku 5.5 にするclaude --model haiku、または会話中に /model
Haiku 5.5 の effort を変えるclaude --effort low など。サブエージェントは定義の effort:

「haiku」がどのモデルを指すかに注意

haiku という呼び名がどのモデルになるかは、Claude Code のバージョンと接続先で変わります。

  • Claude Code 2.1.293 以降で、Anthropic の API(Claude のログインを含む)につないでいる場合は Haiku 5.5
  • 2.1.292 以前、または Amazon Bedrock・Google Cloud・Microsoft Foundry・Claude Platform on AWS 経由では Haiku 4.5(2026-10-08 時点のドキュメント)

古いバージョンのまま model: haiku と書いても Haiku 4.5 で動きます。実験 1 のとおり、Haiku 4.5 は調べものでも Sonnet 5.5 より遅く高くつくので、まず claude update で更新してください。

# Claude Code を更新してバージョンを確かめる
claude update
claude --version   # 2.1.293 以降なら haiku = Haiku 5.5

# モデルを確かめる(JSON の modelUsage にモデル名が出る)
claude -p "OK とだけ返して" --model haiku --output-format json | python3 -c \
  "import json,sys; print(list(json.load(sys.stdin)['modelUsage']))"
# ['claude-haiku-5-5']

Max プランで使っている人にとっての意味

Claude Code を Max プランの定額で使っている場合、ここまでの「費用」はそのまま請求額にはなりません。それでも Haiku 5.5 を検討する価値は 2 つあります。

1 つは速さです。調べものの係を Haiku 5.5 にした構成では、待ち時間が 62 秒から 45 秒に縮みました。サブエージェントを多く使う人ほど体感の差は大きくなります。

もう 1 つは、今回始まった毎月の API クレジット(Max 20x なら月 $200)です。自作のツールやエージェントを API で動かすとき、Haiku 5.5 なら実験 1 の調べもの 1 問 $0.0023 として、$200 で約 8 万 7 千問をこなせる計算になります。同じ仕事を Sonnet 5.5 で動かすと約 9 千 5 百問です。

うまくいかないときの確認ポイント

Haiku 5.5 を試して「思ったより高い」「思ったほど賢くない」と感じたときは、次の順に確かめてください。

症状確認すること対処
unrecognized_model と出る、費用表示が異常に高いclaude --version が 2.1.293 未満claude update で更新する
1 回の費用が予想の何十倍にもなるログのプロンプトサイズが 10 万トークンを超えていないか不要なコネクタ(MCP)を外す。大きなファイルを丸ごと読ませない
model: haiku なのに遅い・高い実際のモデル名(modelUsage)が claude-haiku-4-5 になっていないかClaude Code を更新する。Bedrock などではモデル ID を直接書く
分類のラベルが一覧にない語になる出力が指定の候補から外れていないか入力をタグで囲む。候補を絞ってから答えさせる。最後に一覧と照合する
似た選択肢を取り違える誤りの多いラベルの組み合わせSonnet 5.5 に切り替えるか、怪しいものだけ Sonnet で再判定する
文章が指定より短い出力の文字数分量を数値で指定し、足りなければ続きを書かせる

まとめ

「Sonnet 5.5 で十分では?」という疑問への答えは、品質の面では Yes、費用の面では No です。速さは仕事によって逆転します。

  • 答えが 1 か所に決まる調べもの(実験 1)では、Haiku 5.5 は Sonnet 5.5 と同じ正解率を、約 1/8 の費用で出しました
  • Sonnet 5.5 を指揮役に残し、調査係だけ Haiku 5.5 にすると、正解を落とさずに費用が 58% 減り、時間も 3 割短くなりました(実験 2)
  • 範囲を区切ったバグ修正・機能追加(12 課題)も Haiku 5.5 は全部合格し、費用は Sonnet 5.5 の約 1/4.5 でした。ただし往復が多く、時間は Sonnet 5.5 のほうが短くなりました(実験 3)
  • 77 種類の分類のように、似た選択肢の細かい違いを見分ける判断では、Haiku 5.5 は 60% で Sonnet 5.5 の 81% に大きく届きませんでした(実験 4)
  • 出力速度は Sonnet 5.5 の約 1.6 倍でした(実験 5)

まずは、Claude Code を 2.1.293 以降に更新し、.claude/agents/Explore.md で調べものの係だけ Haiku 5.5 にしてみてください。指揮役の Sonnet や Opus はそのままなので、判断の質を保ったまま、待ち時間と費用だけを減らせます。そのうえで、自分の仕事のどこまでを Haiku に任せられるかを、今回のような小さな比較で確かめていくのがおすすめです。

参考リソース

  • Anthropic「Introducing Claude Haiku 5.5」 https://www.anthropic.com/claude-haiku-5-5
  • Claude Platform「Pricing」 https://platform.claude.com/docs/en/about-claude/pricing
  • Claude Platform「Models overview」 https://platform.claude.com/docs/en/models/overview
  • Claude Platform「Effort」 https://platform.claude.com/docs/en/build-with-claude/effort
  • Claude Code Docs「Create custom subagents」 https://code.claude.com/docs/en/sub-agents
  • Claude Code Docs「Model configuration」 https://code.claude.com/docs/en/model-config
  • sqlite-utils(Simon Willison、Apache 2.0) https://github.com/simonw/sqlite-utils
  • Banking77(PolyAI、CC BY 4.0) https://github.com/PolyAI-LDN/task-specific-datasets

PR

生成AIを体系的に学びたい方へ

「DMM 生成AI CAMP 学び放題」は、ChatGPTなどの生成AIを学べる月額制のオンライン学習サービスです。仕事への活用に向けて継続的に学びたい方は、公式サイトでコース内容や入会条件をご確認ください。

DMM 生成AI CAMP 学び放題

リンク先は公式サイトです。

AI入門AI最新情報ClaudeClaude CodeLLM
Takuyaをフォローする