メインコンテンツへスキップ
       

司法試験で「合格水準」と評価されたAIを弁護士実務でどう評価するか―外部採点,得点調整及び導入前検証(AI作成)

第1 「合格水準」の発表から何が分かるか

1 対象は令和7年予備試験の論文式である

弁護士ドットコムの令和8年6月22日のプレスリリースは,Legal Brainの答案が,株式会社法学館(伊藤塾)の独自採点で500点満点中375点となり,最上位合格水準と評価されたと説明している。
対象は令和7年司法試験予備試験の論文式10科目であり,選択科目は倒産法,各科目の答案の分量は答案用紙4枚以内とされている。司法試験本試験の正式な受験・合格を意味するものではない。

本記事は令和8年10月4日に確認できた発表と法務省の採点資料から,その評価の意味を説明し,法律事務所での導入前検証を提案するものである。
実際の考査委員の内部採点を再現したものではなく,公表された採点制度から説明できる範囲を扱う。

2 発表者自身が公式得点との直接比較を否定している

同リリースの注記は,「最上位合格水準」が同社とは別の採点者による独自基準の専門的判断であり,公式試験の得点・順位との直接比較や公式な合格を意味しないと説明している。
したがって,その発表を読む際には,①専門家が答案内容を評価した結果,②公式の受験者集団の中で計算された得点・順位,③実際の法律業務における性能という三つの命題を分ける必要がある。

独自採点375点は,法務省の考査委員が付けた公式の素点でもない。
「同じ500点満点だから同じ尺度」という理解は,採点基準,採点者及び得点調整の違いを落としている。

第2 得点調整は何を調整するのか

1 内容を採点した後に採点者ごとの格差を調整する

法務省の平成29年11月16日の予備試験論文式採点基準1頁~2頁は,答案を内容に応じて採点し,その後に採点格差を調整する仕組みを定めている。
50点配点では,優秀が38点~50点,良好が29点~37点,一応の水準が21点~28点,不良が0点~20点である。各区分の割合の目安は5%,25%,40%,30%であるが,この割合は採点を拘束するものではない。

同じ問題の全答案を一人で採点することは困難であるため,複数の考査委員が分担する。
すると,全体に高い点を付ける委員と低い点を付ける委員,点差を広く付ける委員と狭く付ける委員による格差が生じ得る。得点調整は,この平均とばらつきの違いを補正するための処理である。

2 算式と複数の採点者による得点のまとめ方

同資料2頁の算式は,次のように表せる。
調整後得点=〔当該答案の素点-当該委員が採点した答案全体の平均点〕÷当該委員の標準偏差×配点に応じた一定の掛け率+配点に応じて按分した全科目の平均点。

標準偏差の計算では,当該委員が採点した受験者数から1を引いた数を分母とする。
各問の得点は,複数の考査委員の調整後得点の平均であり,科目内に複数の問があるときはその合計が科目得点となる。素点を先に平均してから一度だけ調整するという説明とは異なる。

例えば,素点35点でも,その委員の平均点が25点,標準偏差が5点なら,平均から標準偏差の2倍上にある。
別の委員の平均点が30点,標準偏差が5点なら,同じ35点は標準偏差の1倍上にある。この例は仕組みを説明する仮定であり,実際の委員の平均点や標準偏差を示すものではない。

3 外部答案の公式得点・順位はこの算式だけでは分からない

外部採点者が少数のAI答案に付けた点数だけでは,公式の考査委員の担当答案全体の平均点,標準偏差,全科目の平均点及びその答案が同じ基準でどう採点されるかが分からない。
したがって,独自採点375点を公式の調整後得点に換算することも,その答案の公式順位を確定することもできない。平均からの距離が分かっても,実際の得点分布がなければ正確な上位割合は決まらない。

法務省の令和7年予備試験論文式結果1頁は,合格点240点以上,合格者457人とし,採点対象者2,603人全体について最高343.17点,最低15.84点,平均193.80点と記載している。
375点が343.17点を数値として上回ることをもって「公式首席を上回った」と評価したり,240点を上回ることをもって公式な合格としたりすることはできない。比較している尺度が違うからである。

第3 それでも同じ条件による答案比較には意味がある

1 得点調整があるから内容評価が無意味になるわけではない

考査委員の仕事は,まず問われた事項への応答,法的理解,事実の評価,理由付け及び文章の明確さを答案から評価することである。
得点調整は,その内容評価を不要にする仕組みではない。同じ問題,同じ資料・分量の条件,同じ採点基準で複数の答案を採点した結果は,その条件下での長所と欠点を比較する資料になる。

同一科目について,二つの答案に共通の平均・標準偏差・正の掛け率を用いるなら,調整は共通の正の一次変換となり,点数の大小は逆転しない。
もっとも,採点を担当した委員ごとの調整係数が違う場合まで,素点の大小が必ず保たれるという意味ではない。

2 科目合計と順位の一般化には条件がある

全科目で一方の答案が他方以上であり,各科目に双方共通の正の変換を適用するなら,調整後の合計でも大小関係は保たれる。
反対に,一方が民法で優位,他方が刑法で優位という場合は,科目ごとの変換の傾きによって差の寄与が変わり,合計の大小が逆転することもある。独自採点の合計だけから公式合計の順位まで一般化しない理由である。

リリースは,比較した二つの汎用モデルにも同じ生成・採点条件を用いたと説明している。
これは比較の設計についての発表者の説明として読めるが,モデル名・版,具体的な指示,反復実行,採点者へのモデル名の開示の有無及び採点記録等を確認しなければ,第三者が同じ結果を再現したとはいえない。

第4 模試や自己採点の尺度も公式得点とは分ける

1 得点の思い込みが自己評価をゆがめることがある

「図書館の海」の令和3年5月16日のnote記事は,TKC模試などの経験から100点当たり35点~65点程度と考え,実際の司法試験の評価を悲観的に捉えていた経験を述べている。
これは一人の受験者による経験談であり,現在の全科目の得点分布や,特定の高得点が出る頻度を証明する資料ではない。模試も調整得点であったとしても,採点者,受験者集団及び変換の尺度が違えば,公式得点との同一性は保証されない。

法務省の令和2年司法試験の採点結果に記載された論文式最高点は,800点を基礎とする598.77点である。
仮に100点相当の全ての得点が65点以下なら合計は520点以下となるため,そのような一律の上限を公式得点へ当てはめる理解は成り立たない。ただし,この合計最高点から,個々の問で80点又は90点が出る頻度までは分からない。

2 司法試験本試験の最低ラインとも混同しない

司法試験本試験には論文式の科目別最低ラインがあるが,予備試験論文式の合否判定とは別の制度である。
本試験では,調整後の成績通知の点数だけで最低ラインの通過を判定せず,考査委員が付けた素点の平均を科目内で合計する基準を確認する必要がある。詳細は司法試験の合格点・採点・成績通知及び予備試験の合格点・採点基準で説明している。

第5 法律事務所の導入判断では何を測るべきか

1 試験答案で測った能力を実務工程へ分けて確認する

与えられた問題文から法的論点を抽出し,事実を法的に評価して文章にする能力は,実務でも重要である。
しかし,実際の事件処理では,資料の不足を発見して取得すること,矛盾する供述・記録を比較すること,依頼者の優先順位を把握すること,交渉案を選ぶこと,期限を守り,提出・送達・履行の結果まで確認することも必要になる。答案の高評価から,これらの工程の性能が一括して実証されたとはいえない。

導入の可否は,例えば「公開判決の論点整理」「資料からの時系列作成」「確認済み原典に基づく準備書面の初稿」という具体的な用途ごとに決めることを提案する。
試験での成績は,その用途を試す理由になり得るが,人の確認を外す理由には直結しない。

2 採点者の尺度をそろえて改善を測る

責任を持つ弁護士が,必要な成果物,正解の根拠,重大な欠落及び採用を止める条件を先に決める。
複数の採点役には,優れた例,境界の例及び重大な誤りを含む共通の参照例を与え,項目ごとの点数と理由を比較する。これは本記事の運用提案であり,試験委員会が法律事務所へ義務付けた手続ではない。

採点するAI又は採点票を変更したときは,旧版・新版の成果物を共通の採点役で再採点する。
新しい採点役が甘くなっただけの点数上昇と,成果物そのものの改善を分けるためである。数個の候補だけを平均・標準偏差でそろえても,採点基準の妥当性や法的正確性が保証されるわけではない。

3 平均点のほかに必須項目と総作業時間を残す

担当弁護士は,実機テストの前に問題・基準日・使用資料・モデル版・指示・採点票を固定し,改善に使った例と成績測定用の未使用例を分ける。
①原典・引用箇所の一致,②重要な反対材料と経過措置,③資料不足時の留保と人への引継ぎ,④期限・金額・当事者の取り違え,⑤弁護士の修正と再確認を含む総時間を記録する。重大な誤りは,文章の読みやすさ等の高得点で相殺しない。

本番利用前に用途ごとの結果を確認し,重大な誤りが出た用途は停止又は限定する。
モデル,検索資料又は採点役の変更時には同じ課題を再実行し,運用開始後の失敗も追加する。性能の評価と,秘密情報を入力できる契約・設定・権限の確認は,それぞれ行う必要がある。

第6 法務AIの実務性能を独立して測る具体的な設計

1 公表された独立研究では何を実測したか

(1) 検索付き法務AIの正確性と引用の裏付け

Mageshらの2025年の査読論文は,米国法に関する202の質問を事前登録し,法務検索サービス等の回答を評価した。実行時期は2024年3月~5月であり,対象となった検索付き法務AIの回答の17%~33%に,誤情報又は引用先が命題を支えるとする誤った主張があったと報告している。
同研究は,不回答・不十分な回答も区別している。出典の実在と,その出典が結論を支えることは別の評価である。ただし,この結果を現在の製品版,日本法又はLegal Brainの誤答率として転用することはできない。

(2) 人がAIを使った場合の品質と生産性

Schwarczらの2026年の査読論文は,2024年10月に米国の法学生を対象とし,6種類の実務に近い課題について,AIなし,Vincent AIの2024年版,o1-previewの割当てを無作為化して比較した。少なくとも1課題を完了した参加者は137人で,全課題完了者は125人である。採点者には利用条件等を知らせなかった。
品質と所要時間を合わせた同論文の生産性指標について,Vincent AIでは5課題で約50%~110%,o1-previewでは4課題で約75%~130%の向上を報告している。この指標は品質得点を制限時間に占める作業時間の割合で割ったものであり,「作業時間が50%~130%減った」という意味ではない。秘密保持契約の作成課題では,いずれのツールにも明確な品質・速度の改善が確認されなかった。
対象は日本の弁護士ではなく,時間は参加者の自己申告である。実際の依頼者対応,提出後の手戻り又は長期の事件処理まで測った研究でもない。

両研究を読むときは,AIの原回答を測った試験と,人がAIを使って作った成果物を測った試験を区別する必要がある。
本記事で引用した実測結果は各研究者によるものに限られる。本記事自体がLegal Brain等の現行製品を独立に追試したという意味ではない。

2 独立性は課題選定から結果公表まで確認する

以下は,法律事務所による検証のための運用提案である。法令又は試験委員会が定めた合格基準ではない。
外部の弁護士が最後に採点しただけでは,課題選定,指示の調整,回答の選別又は失敗例の公表についての独立性までは分からない。事務所側が課題,基準,実行条件,除外条件及び結果の記録を管理し,提供者が成功例だけを選び直せない設計にする。

(1) 利益関係と実験への介入を記録する

評価者の報酬,提供者との契約,無償アカウント,事前の製品指導,提供者による課題閲覧及び発表内容への関与を記録する。
前掲2026年論文は,対象AIの提供会社から研究資金の援助はなく,参加者へのプラットフォーム無償提供はあったと開示している。独立性の説明では,このような関係も省略しない。

(2) 改善用課題と測定用課題を分ける

指示の調整や利用者の練習には改善用課題を使い,測定用の未使用課題とその正解資料を混ぜない。測定用課題で失敗を見てから指示を直した場合は,変更前の失敗も記録し,別の未使用課題で改善後の成績を測る。
「参照データベースに正解を入れなかった」と,基盤モデルの事前学習に類似資料がなかったことは別である。公開判決を使う試験は原典確認能力の評価に役立つが,事前学習への接触を排除した試験とは呼ばない。

3 日本の実務に合わせた評価課題と正解資料を作る

まず導入を判断する弁護士が,用途,法令の基準日,成果物の提出先,許される資料及び作業完了の条件を決める。公開資料又は検証のための架空資料で課題を作り,依頼者の非公開資料をそのまま試験へ投入しない。
以下は課題の設計例であり,既に実行して成績を得た課題一覧ではない。

用途検証用課題の仕込み確認する点
原典調査基準日の異なる法令・解説と,重要な反対資料を用意する適用時点,経過措置,引用の裏付け,反対材料
証拠整理架空のメール・請求書等に日付の食い違い,訂正版,欠落資料を含める主張と裏付けの区別,矛盾,不足資料,原文位置
書面の初稿確認済み資料を渡し,必須の主張,想定反論,留保すべき事実を指定する事実の創作,重要な反論の見落とし,依頼者の目的への対応
確認・引継ぎ当事者,金額又は期限の条件を一部欠く課題と,完備した課題を対にする必要な質問,適切な留保,過度の回答拒否,無断の対外実行の防止

(1) 正解資料は結論だけで終えない

課題ごとに,必須論点,許容される複数の結論,根拠となる原文の位置,重要な反対材料,認定できない事実及び重大な誤りを弁護士が記録する。
判断が分かれる問題では一つの結論への一致率を正確性と呼ばず,前提,理由,反対説及び留保を評価する。原文を渡す読解試験と,原文を探す検索試験も分ける。

(2) 通常業務を模した課題と失敗しやすい課題を分ける

通常の依頼を模した課題で日常の処理性能を測り,資料矛盾・改正前後・必要事項欠落等の課題で弱点を探す。意図的に難しい課題を集めた結果を,日常業務全体の誤答率として表示しない。
文書内に操作指示が書かれた場合の扱いも検証できるが,資料の内容を利用者からの実行命令と取り違えないことを評価する。公開・送信・削除等を実行する試験は,実際の事件や本番環境から隔離する。

4 AI単体の比較と弁護士による利用効果を分ける

(1) AIの原出力を比べる試験

同一の課題・資料・基準日・出力要件・上限時間で各候補を実行し,最初の出力と追質問後の出力を別に保存する。製品名,モデル又は表示版,契約プラン,実行日時,検索範囲,使用機能,指示,資料及びエラーを残す。
モデル名を固定できないサービスでは,その限界を記載し,実行時の表示版等を記録する。検索機能の有無が異なる比較は,検索を含む製品全体の比較として扱い,基盤モデルだけの優劣とは説明しない。

一例として同じ課題を新しい会話で3回実行し,最良の1回だけを採用せず全出力を評価する。再試行の回数・停止条件は先に決め,時間切れ,接続失敗,取得不能も記録する。
これらの回数は小規模な探索試験の例であり,統計的な十分性を保証する基準ではない。

(2) 弁護士が使った場合の比較試験

通常の検索・資料確認を行うAIなしの方法と,同じ完了条件まで弁護士がAIを使って確認・修正する方法を比べる。利用者の習熟期間と練習用課題をそろえ,担当者の経験及び課題の難しさの偏りを抑える。
同じ人が同じ事件資料でAIなしを先に行うと,後のAIありの作業に答えを覚えた効果が混ざる。複数担当者への条件の無作為割当てや,難度を合わせた別課題での順序の入替えを用いる。一人で検証する場合は,この影響を十分除けない限界を記載する。

(3) 採点者に利用条件を知らせない

採点用の成果物から提供者名・実行条件・作成者名を外し,順序を入れ替える。複数の採点者が共通の参照例で尺度を合わせた後,重要な不一致を根拠資料に戻って確認する。
同じAIの自己採点や,別のAIの一致だけを正解とせず,重大な誤りと引用の判定は弁護士が原典で確かめる。文章の特徴から利用条件が推測できる場合まで,完全な盲検が成立したとは説明しない。

5 平均点と別に重大な誤り・不回答を数える

(1) 採点票と分母を先に決める

採点票の例は,法的正確性,事実・証拠の扱い,反対材料・例外,根拠の裏付け及び成果物の使いやすさを各0点~2点で評価し,0点は欠落又は誤り,1点は修正を要する,2点は課題の完了条件を満たすとする方法である。
各項目の具体的な判定例と,引用命題の単位を課題ごとに決める。架空の根拠,重要な適用条件の取り違え,金額・当事者・期限の重大な誤り等は別欄に記録し,合計点が高くても合格扱いにしない。

少なくとも,①重大な誤りを含む出力数/全出力数,②全必須項目を満たした課題数/全課題数,③裏付けのある引用命題数/引用命題数を併記する。
出典が必要なのに引用を付けなかった回答は③の分母から消えて高成績に見えるため,「必要な出典が欠けた出力数」も別に数える。引用命題単位の割合を,回答全体の正答率と呼ばない。

(2) 適切な留保と単なる不回答を区別する

回答拒否,資料不足による適切な質問,根拠なしの断定及び接続失敗を分けて記録する。回答したものだけを分母にして,不回答や失敗を成績から消さない。
情報が足りない課題での適切な留保は成功になり得るが,情報が足りている課題にも一律に回答しないなら実用性が下がる。情報不足の課題と完備した課題を組にした検証が役立つ。

原出力と,弁護士が確認・修正して採用できる状態になった成果物を別々に採点する。人が直した後の成績を,AI単体の正確性として表示しない。

6 生成時間より検収完了までの時間と費用を測る

計測は,資料を開いて作業を開始した時点から,原典照合,修正,反対材料の確認及び成果物の検収が終わる時点まで行う。指示作成,資料準備,追加質問,再実行及び確認を含め,生成中の待ち時間だけを測らない。
開始から検収までの経過時間と,人の実作業時間は別に記録する。生成を待つ間に他の仕事をした場合に,両者を単純に足して二重計上しない。導入研修等の共通費用も別に残す。

例えば,人の実作業がAIなし60分,AIあり45分であり,同じ検収条件を満たしたなら,この仮定例の実作業時間は25%短縮である。AIの初稿が2分で出たことだけを根拠に,96%超の業務削減と説明することはできない。
利用料,確認担当者の時間,手戻り及び運用管理を含む費用を,同じ品質条件で比べる。採用できなかった成果物について,検収完了までの時間が得られたように扱わず,打切りまでに使った時間と失敗を記録する。

7 少数課題で誤りがゼロでも安全は証明されない

同じ発生確率を持つ独立した無作為標本という仮定の下では,n件中の誤りがゼロだった場合の誤り確率の片側95%信頼上限は,1-〔0.05の(1/n)乗〕で計算できる。NISTの二項分布に基づく正確な信頼限界の説明に対応する,ゼロ件の場合の計算である。
仮に30件でゼロでも上限は約9.5%,100件でゼロでも約3.0%である。上限を1%以下とするには,この仮定の下でも少なくとも299件のゼロ誤り観測を要する。これらは数式から得た仮定例であり,法務AIの実測値ではない。

同じ資料を言い換えた課題や同じ課題の反復は相関を持ち得るため,30課題を3回実行したことを,独立した90件の標本と扱わない。通常業務の課題と弱点探索の課題を混ぜた標本にも,この上限をそのまま適用しない。
実務の危険度,許容できる誤り,標本の代表性及び課題間の依存関係を検討し,少数の成功例だけで「誤り率ゼロ」又は「弁護士の確認不要」と結論しない。

8 導入・停止・再試験の条件を先に決める

責任者の弁護士は測定開始前に,重大な誤りが出た場合の停止対象,利用可能な用途,人が必ず確認する項目及び検収条件を記録する。測定中に都合よく合格点を下げず,変更する場合は理由と新しい試験の版を残す。
採用する用途は,品質条件を満たし,人の確認を含む時間・費用に改善があるかで判断する。原典への到達が改善した用途だけ検索補助として採用するなど,結果に合わせて用途を限定することもできる。品質条件を満たしたことと,秘密情報を入力できる契約・権限・設定の確認は別々に扱う。

モデル,検索範囲,指示又は出力形式が変わったときは,同じ回帰試験で従来の品質を確認する。改善に使った課題での合格は,未使用課題での性能証明とは分ける。
結果報告には,課題数,対象版,実行条件,指標の分母,不回答・時間切れ,重大な誤り,原出力と最終成果物の品質,人の実作業時間及び検収までの経過時間を含める。これにより,担当者は「どの用途で,どの確認を残して使えるか」を判断できる。

第7 公開資料からは確定できない事項

参照データベースに模範解答・再現答案を含めないという発表は,基盤モデルの事前学習にもそれらが含まれていないことの証明ではない。
具体的な生成条件,採点者別の採点票,第三者の反復結果及び実務用途ごとの測定が分からない部分は,発表の点数から補って断定しない。製品を検討する事務所は,提供者への照会と自らの用途別テストで確認する必要がある。

第8 関連記事と出典

1 関連記事

①法務AIのベンチマーク順位を日本の法律事務所でどう読むか
②AIに主張案を複数書かせて選ぶとき
③法律事務所の生成AIをどう評価・改善するか
④AIに代替される弁護士業務と人が担う役割

2 出典と資料の性質

①弁護士ドットコムのプレスリリース(令和8年6月22日。令和8年10月4日確認。事業者による実験条件・独自採点結果及び公式得点との比較に関する注記)
②法務省・平成29年11月16日の予備試験論文式採点基準1頁~2頁(採点方針,採点格差の調整及び合否判定)
③法務省・予備試験の実施に関する委員会決定等からリンクされる平成28年11月24日の採点基準1頁~2頁(本記事で説明した採点方針と調整方式の確認)
④法務省・令和7年予備試験論文式試験の結果1頁(合格点,合格者数及び採点対象者全体の得点)
⑤法務省・令和2年司法試験の採点結果2頁(論文式最高点)
⑥法務省・司法試験の方式・内容等について(令和7年11月26日。司法試験本試験の採点・最低ライン)
⑦図書館の海のnote記事(令和3年5月16日。個人の受験経験・自己評価に関する記述であり,公式統計ではない)

⑧Mageshほか・Hallucination-Free?(2025年査読論文)216頁,218頁,224頁~225頁,231頁,241頁(米国法の検索回答評価,実行時点,質問数及び限界)
⑨Schwarczほか・AI-Powered Lawyering(2026年査読論文)220頁,223頁~225頁,235頁,243頁,248頁(参加者,無作為割当て,採点,生産性指標及び限界)
⑩ミシガン大学の同論文公開ページ(研究資金・無償提供等の開示)
⑪NIST・EXACT BINOMIAL(二項分布の片側・両側の正確な信頼限界。第6の7はゼロ件観測時の算式からの仮定計算である)