第1 本記事の対象と結論
1 対象と基準日
Anthropic社は,令和8年9月28日,生成AIのモデルであるClaude Sonnet 5.5を公表した。
同社のリリースノートは,これをClaude 5.5ファミリーの2番目のモデルとし,同月22日に公表したClaude Opus 5.5を補う,より速く,より低コストのモデルと位置付けている。
本記事は,法律事務所がこのモデルを業務に使うかどうか,又は今使っているモデルから切り替えるかどうかを判断するときに,公表資料の何を読み,何を自分で確かめるべきかを整理するものである。
モデルを使い分け・切り替えるときの一般的な設計は,法律事務所で生成AIのモデルを使い分け・切り替えるときの設計で扱っているので,本記事はClaude Sonnet 5.5の公表内容に即した確認事項に絞る。
基準日は令和8年10月1日であり,事業者の公表資料は同日に確認した。
2 資料の性質と書き手
本記事が主に依拠するのは,Anthropic社の発表記事,リリースノート,開発者向け文書及びヘルプセンターの記事である。
これらは料金,提供条件及び自社の評価結果を示すベンダーの一次資料であるが,日本の法律実務での正確性を直接証明する資料ではない。
公表の翌日には,YouTubeのチャンネル「AI market」が,前のモデル及びClaude Opus 5.5と並べて試した結果を紹介する動画(令和8年9月29日公開)を出している。
本記事は,この動画を,速さの数字の読み方を説明するための一例としてだけ用い,その測定結果を一般化しない。
本記事は,Anthropic社の生成AI(Claude)を用いて作成している。
同社は本記事が取り上げる事業者であるため,本記事ではモデルの優劣を評価せず,公表資料の記載と,その読み方及び確認の手順を述べるにとどめる。
3 結論の要旨
①料金の単価は前のClaude Sonnet 5と同じであり,同社は作業当たりのトークンが減るので作業当たりの費用が最大30%下がるとしているが,これは同社の試験による数字であり,事務所の業務で測り直す必要がある。
②「30%以上速い」は出力を生成する速さの話であり,依頼してから回答が完成するまでの時間や,弁護士が確認を終えるまでの時間が同じ割合で短くなることを意味しない。
③評価試験の点数は考える深さ(effort)の設定によって変わり,同社自身も,判断を持続させる必要のある複雑で答えの定まらない作業では,Claude Opus 5.5の方が明らかに強いとしている。
④データの条件については,ゼロデータ保持で利用できるとされており,基準日の時点では,入力と出力を30日間保存する扱いの対象となる「Covered Models」に指定されていない。
⑤APIでClaude Sonnet 4.5を使っている事務所では,令和8年9月30日に廃止の予告が出ており,同年11月30日に提供が終了する予定で,推奨される移行先はClaude Sonnet 5.5とされている。
第2 公表された内容
1 位置付けと提供範囲
発表記事は,Claude Opus 5.5が慎重な判断を要する複雑な作業のために作られているのに対し,Claude Sonnet 5.5は,範囲のはっきりした日常的な作業,プログラムの不具合の修正,並びに体裁の整った文書,スライド及び表計算の作成に最も強いとしている。
より大量の処理と費用を重視する用途向けのClaude Haiku 5.5は,数週間のうちに加わる予定とされている。
提供範囲について,発表記事は,Amazon Web Services,Google Cloud及びMicrosoft Azureを含むすべてのプラットフォームで利用できるとし,APIのモデル名を「claude-sonnet-5-5」としている。
他方,Claudeのアプリをどの料金プランで使えるか(無料プランで使えるかを含む)は,基準日の時点で発表記事にもリリースノートにも書かれておらず,本記事では確認できていない。
考える深さ(effort)の初期設定は,Claude Code及びアプリでは「Medium」,開発者向けのClaude Platformでは「High」とされている。
同じモデルでも,アプリとAPIとでは初期設定が違うことになる。
2 料金と提供期間
公表されている100万トークン当たりの料金は,次のとおりである(基準日時点)。
| モデル | 入力 | 出力 | キャッシュ読取り |
|---|---|---|---|
| Claude Sonnet 5.5 | 2ドル | 10ドル | 0.20ドル |
| Claude Opus 5.5 | 4ドル | 20ドル | 0.20ドル |
発表記事は,Claude Sonnet 5.5の料金はClaude Sonnet 5と同じであるが,同じ仕事をするのに必要なトークンがはるかに少なく,同社の試験では作業当たりの費用が前のモデルより最大30%少ないとしている。
開発者向けの「Models overview」は,バッチ処理(Batch API)の依頼は50%引きとしている。
提供期間については,開発者向けの「Model deprecations」が,Claude Sonnet 5.5の廃止日を「Not sooner than September 28, 2027」としている。
同ページによれば,同社は,一般公開したモデルの廃止について少なくとも60日前に利用者へ通知するとされている。
3 速さとトークンの量
発表記事は,Claude Sonnet 5.5は出力をClaude Sonnet 5より30%以上速く生成し,同社のSonnetのモデルで最も速いとしている。
同じ記事には,鳥の群れ,風で形を変える砂丘及び小さな時計を組み合わせた時計を,それぞれ一つのHTMLファイルで作らせ,新旧のモデルが書き進める様子を並べた比較の映像が掲載されている。
発表記事には,利用企業のコメントも掲載されている。
例えば,Slackは,指示を変えずに社内の評価のほぼすべてで前のモデルを上回り,出力トークンが約14%少なかったとし,Zendeskは,問い合わせの処理が20%速くなったとしている。
Balyasny Asset Managementは,2,441問の金融業務の評価で,1回答当たりのトークンがClaude Sonnet 5の約49万7千から約12万1千に減ったとし,Boxは,前のモデルより正確で,2.4倍速く,総トークンが12%少なかったとしている。
4 評価試験の結果
発表記事が示す主な評価試験の結果は,次のとおりである。
| 評価試験 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| GDPval-AA v2.1 | 1844 | 1449 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 |
| OSWorld 2.1 | 80.1% | 57.0% | 81.8% |
| Chartography | 61.6% | 15.6% | 64.4% |
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% |
| Humanity’s Last Exam | 64.5% | 54.9% | 67.7% |
GDPval-AAは,44の職業と9つの主要産業にわたる実務的な作業でモデルを比べる評価試験であり,発表記事は,Claude Sonnet 5.5がClaude Opus 5.5に2点及ばない水準であったとしている。
OSWorldはパソコン操作,Chartographyはグラフの読取り,Terminal-Bench及びCursorBenchはプログラミングの作業を測るものであり,Humanity’s Last Examの数字はツールを使った場合のものである。
なお,Terminal-BenchのClaude Opus 5.5の数字は,考える深さを「Xhigh」にした場合の最高点であると注記されている。
その上で,発表記事は,評価試験の点数はモデルの能力の一面をとらえるにすぎず,同社自身の試験でも外部の試験者の試験でも,判断を持続させる必要のある複雑で答えの定まらない作業では,Claude Opus 5.5が明らかに強いままであるとしている。
5 安全対策による切替え
発表記事によれば,Claude Sonnet 5.5はサイバーセキュリティの能力が大きく向上したため,Claude Opus 5.5と同様の安全対策の下で提供され,日常的なプログラムの不具合の発見と修正はできるが,リスクの高いサイバーセキュリティの作業は,目に見える形でClaude Sonnet 5に切り替わる(fall back)とされている。
生物学の分野の安全対策はClaude Sonnet 5と同じとされている。
また,同社は,推論の過程を抜き出す攻撃を防ぐ分類器をSonnetのモデルで初めて導入し,思考の内容を作成したアカウントから切り離せないようにしたとしている。
発表記事は,ほとんどの開発者は変化に気付かないとしつつ,会話をアカウント間で移す場合(Claude Codeの作業中にアカウントを切り替える場合を含む)については説明文書で変更点を案内しているので,複数のアカウントを使い分けている事務所は,その説明文書を確認しておく必要がある。
第3 公表資料の読み方
1 「速い」は何の速さか
(1) 出力の速さと完了までの時間
発表記事の「30%以上速い」は,出力を生成する速さについての記載である。
回答が完成するまでの時間は,出力の速さだけでなく,書き始める前に考える時間と,書く分量によって決まる。
前記の動画では,考える深さを「中」にそろえ,社内ルールの下書きから食い違いを探す同じ依頼を新旧のモデルに3回ずつ交互に送り,文字が出るたびに時刻を記録している。
その結果,書く速さは1秒当たり約111文字から約153文字へと約38%上がった一方,送ってから答え終わるまでの時間は約4.8秒と約5.3秒でほぼ同じであったと紹介されている。
新しいモデルが書き始める前に長く考え,答えも約2割長く書いたためと説明されている。
これは一つのチャンネルが限られた条件で行った試行であるが,出力の速さと完了までの時間が別の数字であることをよく示している。
(2) 法律事務所での測り方
法律事務所で意味があるのは,依頼してから,弁護士が出力を確認し,必要な修正を終えるまでの時間である。
回答が丁寧で長くなれば,読む時間と確かめる箇所も増える。
切替えを判断するときは,同じ入力を新旧のモデルに送り,①回答が完成するまでの時間,②回答の分量,③一次資料との照合と修正に要した時間を記録して比べることが考えられる。
2 「安い」は何の安さか
(1) 単価と作業当たりの費用
Claude Sonnet 5.5の単価はClaude Sonnet 5と同じであるから,費用が下がるとすれば,それは作業当たりのトークンが減ることによる。
発表記事の「最大30%少ない」は同社の試験の結果であり,事務所の業務で同じ割合になる保証はない。
発表記事は,各評価試験について,考える深さごとの点数と作業当たりの費用を並べた図を示し,いくつかの評価試験ではLow又はMediumの設定でClaude Sonnet 5の最高点を約10分の1の費用で上回ったとしている。
もっとも,この記載は,Terminal-Bench,CursorBench等の個別の評価試験についてのものであり,あらゆる作業の費用が10分の1になるという意味ではない。
(2) 定額プランと従量課金
アプリを定額プランで使う場合,作業当たりのトークンが減れば,同じ利用上限の中でこなせる作業が増えることになると考えられるが,利用上限の数え方は同社が定めるものであり,本記事では確認していない。
APIの従量課金では,出力の分量が増えれば費用も増えるので,前記のように回答が長くなる傾向があれば,トークンが減る効果と相殺される可能性もある。
また,安価なモデルで弁護士の修正時間が増えれば,業務全体の費用は下がらない。
従量課金の管理は,生成AIの利用料が予算を超えないためにで扱っている。
3 評価試験の点数をどう読むか
第一に,点数は考える深さの設定に左右される。
発表記事は,いくつかの評価試験ではClaude Sonnet 5.5を最も深い「Max」に設定するとClaude Opus 5.5に匹敵するとしつつ,深い設定では費用も同程度になり得るとしている。
アプリの初期設定である「Medium」で使う場合の性能は,表の数字そのままではない可能性がある。
第二に,評価試験の対象は日本の法律実務ではない。
GDPval-AAは多くの職業の実務的な作業を対象とするが,日本の法令・裁判例の調査や,事実関係に即した法的判断を直接測るものではない。
発表記事には法律分野に特化した評価試験の結果は示されていない。
第三に,同社自身が,判断を持続させる必要のある複雑で答えの定まらない作業ではClaude Opus 5.5が明らかに強いとしている。
事件の見通し,主張の組立て,和解の判断のように,答えが一つに定まらず,判断を積み重ねる作業ほど,点数の差が小さいことを理由に下位のモデルへ移すことには慎重であるべきである。
4 利用企業の声と動画の実演
発表記事に掲載された利用企業のコメントは,事業者が選んで掲載したものであり,試験の条件や比較の対象となったモデルの設定は,記事からは分からないことが多い。
例えば,あるアプリ開発事業者のコメントは,比較の対象をClaude Opus 5.5ではなくClaude Opus 5としている。
前記の動画も,月次報告のスライドを作らせると,前のモデルが平均の数字を一つ誤り,広告費を計算に入れなかったのに対し,Claude Sonnet 5.5は結論を見出しに置き,広告費を差し引いた効果や直近の月の落ち込みまで指摘したと紹介している。
もっとも,これは一つの題材で一度試した結果である。
利用企業の声や動画の実演は,「この種の作業で差が出るかもしれない」という仮説として扱い,事務所の典型的な業務で確かめるのが適切である。
特に,数字の誤りを新しいモデルが減らしたという例があっても,出力の数字を人が確かめる手順を省いてよいことにはならない。
第4 法律事務所で確かめること
1 データの条件
(1) ゼロデータ保持
発表記事は,Claude Opus 5.5及びClaude Sonnet 5と同様に,Claude Sonnet 5.5はゼロデータ保持で利用できるとしている。
もっとも,ゼロデータ保持は契約と設定によって適用されるものであり,事務所の契約形態(アプリの個人プラン,組織向けプラン,API,クラウド事業者経由)でどの条件が適用されるかは,別に確かめる必要がある。
同社のプライバシーセンターは,個人向けのプラン(Free,Pro及びMax)のアプリ(Claude Codeを含む)では,もともと入力と出力を保存しているとしている。
(2) Covered Models
Anthropic社のヘルプセンターの「Covered Models」は,安全対策上の理由から,指定したモデルについて入力と出力を少なくとも30日間保存し,指定したモデルを利用できるワークスペース等ではゼロデータ保持を利用できないとしている。
基準日の時点で指定されているのは,Claude Mythos 5.1及びClaude Fable 5.1(いずれも令和8年8月31日指定)並びにClaude Mythos 5及びClaude Fable 5(いずれも同年6月9日指定)であり,Claude Sonnet 5.5とClaude Opus 5.5は掲載されていない。
同ページは,掲載されたモデル以外は既存の契約の下で運用されるとしている。
ただし,指定は今後追加され得るので,切り替えるときとその後の定期点検のときに改めて確認する。
データの条件の確認項目は,法律事務所が生成AIのDPAを確認するときのチェックリストで扱っている。
2 モデルと設定を名称で固定する
開発者向けの「Models overview」によれば,Claudeのモデル名はいずれも特定の版に固定されたものであり,Claude Sonnet 5.5のAPIのモデル名は「claude-sonnet-5-5」である。
事務所の許可台帳には,モデル名とともに,考える深さの設定も記録しておくことが考えられる。
前記のとおり,アプリとAPIとでは初期設定が違い,設定が変われば回答の分量や性能も変わるからである。
発表記事は,Sonnetのモデルを思考なしの設定で使っている利用者は,Claude Sonnet 5.5に移る前に新しい設定(between_tools)へ切り替える必要があるとし,移行の手引きを案内している。
事務所でAPIを使った仕組みを組んでいる場合は,モデル名を書き換えるだけで移行が済むとは限らないので,移行の手引きを確認する。
3 Claude Sonnet 4.5からの移行
「Model deprecations」によれば,Anthropic社は,令和8年9月30日,Claude Sonnet 4.5(claude-sonnet-4-5-20250929)を使っている開発者に,Claude APIでの提供終了を通知した。
提供終了日は同年11月30日とされ,推奨される移行先はClaude Sonnet 5.5とされている。
提供終了日を過ぎると,そのモデルへの依頼は失敗するとされている。
同ページの日程は,Claude API,Claude Platform on AWS及びMicrosoft Foundryに適用され,Amazon BedrockとGoogle Cloudでは各社が独自に日程を定めるとされている。
クラウド事業者経由で使っている場合は,その事業者の案内を確認する。
同ページは,Claude Consoleの利用状況の画面から,APIキーとモデルごとの利用状況をCSVで書き出せると説明しているので,どの仕組みが古いモデルを使っているかの洗い出しに使うことができる。
移行の期限まで約2か月であるから,次の4の試験を早めに行う必要がある。
4 切り替える前の試験
(1) 試験に使う入力
試験には,事務所で日常的に行う作業の典型例を使う。
例えば,①公開されている法令・裁判例の要約,②定型的な書式の整形,③受領資料の一覧化,④公開情報に基づく調査メモの下書きなどである。
依頼者の情報を含む入力を試験に使う場合は,その時点でデータの条件の確認を終えていることが前提となる。
(2) 比べる項目
新旧のモデルに同じ入力を送り,①法令の条文や裁判例の記載が一次資料(e-Gov法令検索,裁判所ウェブサイトの裁判例検索等)と一致するか,②回答の分量と形式がどう変わったか,③完了までの時間と弁護士の確認・修正の時間,④作業当たりの費用を記録する。
同じモデルでも回答は毎回同じではないので,一度の試行で結論を出さず,複数回試す。
評価の手順は,法律事務所の生成AIをどう評価・改善するかで扱っている。
(3) 採否の記録
結果は,採用する業務,採用しない業務,及び採用を止める条件とともに記録する。
例えば,「一次資料との不一致が一定の割合を超えたら前のモデル又は上位のモデルに戻す」といった停止条件を先に決めておくと,切替え後の判断がしやすい。
5 使い分けと確認の責任
同社の位置付けによれば,範囲のはっきりした作業はClaude Sonnet 5.5,慎重な判断を要する複雑な作業はClaude Opus 5.5という使い分けが想定されている。
発表記事には,Claude Opus 5.5が全体の設計と枠組みを決めれば,実装をClaude Sonnet 5.5に任せられるという利用者の声も掲載されている。
法律事務所に置き換えれば,①調査の範囲と方針は弁護士が決め,②資料の整理,書式の整形,下書きの作成のように範囲の決まった作業を速いモデルに任せ,③結論と根拠の確認は弁護士が行う,という分担が考えられる。
どのモデルを使っても,法令の条文は現行の条文で,裁判例は原文で確かめる必要があり,モデルの点数が上がったことはこの確認を省く理由にならない。
また,前記の安全対策により,リスクの高いサイバーセキュリティの作業では,応答するモデルがClaude Sonnet 5に切り替わることがある。
例えば,事務所の情報セキュリティ事故の調査でAIを使う場合には,どのモデルが応答したかを記録しておく。
第5 一次資料及び判例の確認状況
事業者の公表資料(発表記事,リリースノート,Models overview,Model deprecations並びにCovered Modelsに関するヘルプセンター及びプライバシーセンターの記事)は,令和8年10月1日に各ページの原文を確認した。
英文の資料の訳と要約は本記事によるものである。
本記事では,法令の条文と裁判例を引用していない。
本記事の論点は事業者の公表資料の読み方であり,判例データベース(判例秘書等)は利用していない。
基準日の時点で確認できていない事項は,①Claudeのアプリでどの料金プランがClaude Sonnet 5.5を使えるか(無料プランを含む),②定額プランの利用上限の数え方への影響,③Amazon Bedrock及びGoogle CloudでのClaude Sonnet 4.5の提供終了日,④動画で紹介された測定結果の再現である。
第6 関連記事
①法律事務所で生成AIのモデルを使い分け・切り替えるときの設計―モデル単位の許可台帳,データ条件の確認及び切替え時の再検証
②生成AIサービスの値上げ・提供終了・モデル廃止に備える契約と運用-規約の変更条項,終了時のデータ,移行計画及び中継サービス
③生成AIの利用料が予算を超えないために―従量課金の約款で確認する5項目と社内規程の定め方
④法律事務所が生成AIのDPAを確認するときのチェックリスト-学習不使用,保持期間,ZDR,再委託,国外処理及びコネクタ
⑤法律事務所の生成AIをどう評価・改善するか―トレース,評価データセット,回帰試験,一次資料確認及び守秘義務
⑥法律事務所の生成AI利用ガイドラインの作り方-許可サービス,入力情報,出力確認,委託先及び事故対応
第7 出典・参考資料
①Anthropic「Introducing Claude Sonnet 5.5」(令和8年9月28日。事業者の公表資料)
②Claude Help Center「Release notes」(令和8年9月28日及び同月22日の項)
③Claude Platform Docs「Models overview」(令和8年10月1日確認)
④Claude Platform Docs「Model deprecations」(令和8年10月1日確認)
⑤Claude Help Center「Covered Models」(令和8年10月1日確認)
⑥Anthropic Privacy Center「Data retention practices for Covered Models」(令和8年10月1日確認)
⑦AI market「【新AIモデル】Claude Sonnet 5.5の特徴と使いどころ|処理速度30%UPで頭脳はOpusに迫る」(YouTube,令和8年9月29日公開。二次資料であり,測定結果は一般化していない。)
第8 今後掘り下げる事項
本記事は公表直後の資料に基づくものであり,次の事項は別に掘り下げる予定である。
①テーマ:Claude Sonnet 5.5とClaude Opus 5.5を日本の法律実務の典型作業で比べた結果。
未検討点:考える深さの設定ごとの一次資料との一致率,確認・修正に要する時間及び作業当たりの費用。
②テーマ:Claude Sonnet 5.5のシステムカード(System Card)。
未検討点:評価試験の実施条件,誠実さ(honesty)の評価及び安全対策の詳細。
③テーマ:Claudeのアプリでの提供範囲と利用上限。
未検討点:料金プラン(無料プランを含む)ごとの提供の有無と,利用上限の消費への影響。
④テーマ:Claude Haiku 5.5の公表後の三つのモデルの使い分け。
未検討点:大量の定型処理を任せる場合の確認手順と費用。