第1 本記事の対象と結論
本記事は,生成AI又はAIエージェントに法律事務所の仕事を任せるときに,その仕事が良いか悪いかを判定する基準(以下「評価基準」という。)を,どのような順序で作り,育て,保守するかを整理するものである。
令和8年10月1日時点で確認した研究論文,技術資料,会規及び法令を参照している。
評価用データセット,トレース及び回帰試験の組み方は「法律事務所の生成AIをどう評価・改善するか」で,代理指標と停止条件は「AIの改善ループが失敗する条件」で扱った。
本記事は,その手前の段階,すなわち評価基準をまだ言葉にできていない段階から始める方法を扱う。
結論は,次のとおりである。
①評価基準は,作業の前に完成させるものではなく,AIの成果物を見て不満を言葉にする作業を繰り返すことで育つ。
②評価を作り込むのは,繰り返し頻度が高く,自律化したときの効果が大きく,誤りの影響が重い業務に限る。それ以外は,指示に目的と確認の観点を書き,失敗したら再発防止を指示する程度で足りることが多い。
③確認手段は,機械的な検査,AIによる点検,別の会話での査読,実物の確認及び弁護士の最終確認に割り当てる。機械で白黒がつく観点は機械に任せる。
④過去の失敗をまとめた「落とし穴メモ」は手軽で効果があるが,古くなった記載が誤った指示として働くため,日付,適用範囲及び見直し日を付けて保守する。
⑤評価の材料となる指示,作業記録,成果物及び人の判定は,それ自体が職務上取り扱う情報であり,秘密保持の対象となり得る。
第2 ベンチマークの成績と自分の業務での出来は別である
AIモデルの提供者は,新しいモデルを公表するときに,多数の問題を解かせた成績表(ベンチマーク)を示すことが多い。
ベンチマークは,モデルの汎用的な能力を比べるには役立つが,個々の事務所の業務に固有の難しさや良さまでは測れない。
法律事務所の業務には,基準日の確認,反対資料の拾い方,依頼者への説明の分量,書面の書式,事務所の文体及び守秘のための記載の省略といった固有の合格条件がある。
したがって,「ベンチマークの成績が良いから自分の業務でも良い」とは言えず,自分の業務の文脈でAIの仕事を判定する仕組みが要る。
当ブログでも,個別の確認項目の合格率が高くても,全ての必須条件を満たす割合は低いという評価結果を紹介した(「山中弁護士がAI作成又はAIリライトの記事を投稿するときに行っているハルシネーション防止方法」)。
平均的な成績と,一件の重大な欠落が成果物全体を不適切にする法律業務の合格条件とは,別のものとして扱う必要がある。
第3 評価基準は使いながら育てる
1 基準は出力を見て初めて分かる
AIの出力を評価する作業を観察した研究は,利用者が出力を採点するには基準が必要である一方,出力を採点することによって基準が定まっていくという関係を報告している。
同研究は,基準の一部が実際に観察した出力に依存しており,事前には定義できないことを示し,この現象を「criteria drift」と呼んでいる(Shankarほか,2024年)。
法律業務でも,AIが作った準備書面の初稿,依頼者向けの説明文又は調査メモを読んで初めて,「結論の前に前提事実の確認が欲しい」「反対の裁判例に触れていない」「依頼者には長すぎる」といった不満に気付くことが多い。
最初に思い付いた基準だけで評価すると,こうした基準が抜け落ちる。
2 最初から精密な採点表を作らない
評価の手法を体系的に解説するHamel Husain氏及びShreya Shankar氏の資料も,事例を見る前に詳細な採点表を書くことを勧めず,実際のデータを見る中で採点表を作るべきであるとしている。
最初から固い基準を置くと,想定していなかった問題が見えにくくなるためである。
そこで,最初は基準を完成させることにこだわらず,実際の業務で使いながら,不満を記録し,基準を足し,言い回しを直していく。
基準を変えたときは,変えた日と理由を残す。後で過去の判定と比べるときに,基準が変わったために点が変わったのか,AIの出来が変わったのかを区別するためである。
第4 評価を作り込む業務を選ぶ
次に述べる手順は手間がかかるため,全ての業務に行う必要はない。
最近のAIエージェントは,指示の中に目的と確認の観点を書いて仕事を依頼するだけで,作業,確認及び修正をある程度自分で繰り返す。
うまくいかなかったときも,「次回から同じことが起きないように直しておくように」と指示するだけで足りる場合が多い。
評価を作り込む価値が高いのは,次の三つが重なる業務である。
①同じ種類の作業を繰り返す頻度が高い
②AIが人の確認を待たずに長く作業できるようになると,時間の節約が大きい
③誤りが生じたときの影響が重い(期限,外部への送信又は公開,裁判所への提出,依頼者への説明等)
例えば,ブログ記事の公開前検証,定型的な書面の書式点検,期限の転記,証拠の目録作成及び判例の書誌の照合は,①から③が重なりやすい。
これに対し,一回限りの調査や,弁護士が全文を読んで判断することが前提の作業では,作り込みの効果は小さい。
第5 評価の材料を残す
1 四つの記録
評価を改善しようとしたときに材料が残っていないと,その時点から集め始めることになり,改善の立ち上がりが遅れる。
そこで,日頃から次の四つを一組として残す。
①AIへの指示
②AIが途中で何を考え,何をしたかの記録
③最終的な成果物
④その成果物について自分がどう判断したか(採用したか,どこが不満だったか)
最も簡単な方法は,普段使っているメモアプリに,AIがどのような仕事をし,自分がどう感じ,どのような改善を試したかを短く書くことである。
このメモをAIに書かせてもよい。
成果物が文書や図表であれば,日付と業務の種類ごとにフォルダへ整理しておくだけでも,後で比べる材料になる。
作業記録を詳しく保存する専用の観測ツールもある。
その導入時の注意は「法律事務所の生成AIをどう評価・改善するか」で述べた。
2 記録自体が取扱情報になる
弁護士情報セキュリティ規程2条2項は,弁護士等がその職務上取り扱う情報を,紙,電磁的記録等の保管媒体を問わず「取扱情報」と定義している。
AIへの指示,作業記録及び成果物に依頼者の事情や事件の情報が含まれていれば,評価のためのメモもこの取扱情報に当たり得る。
同規程5条は,取扱情報の作成,取得,保管,利用,提供,運搬,送信及び廃棄の各段階で情報セキュリティが確保されるよう取り扱うことを求めている。
評価用の記録を作るときは,保存場所,閲覧できる者,外部サービスへの送信の有無及び廃棄の時期を決めておく。
第6 失敗を言葉にする
1 何が不満かを書く
AIの成果物に不満を感じたときが,評価基準を作る機会である。
まずは,何が不満だったのかを,そのまま短い言葉で書く。
「長い」「結論が遅い」「根拠の条文が古い」「依頼者の質問に答えていない」のような粗い書き方でよい。
前記の資料は,このように一件ずつ自由に気付きを書き出し(オープン・コーディング),その後に似た失敗をまとめて失敗の分類を作る(アクシャル・コーディング)という手順を示している。
同資料は,まず少なくとも30件の記録を自分で読んで気付きを書き,その後は約100件の多様な記録を作業用の母集団として,新しい失敗の型が見つからなくなるまで見直すことを目安としている。
法律事務所でこの件数をすぐにそろえる必要はないが,数件の印象だけで基準を決めないという考え方は参考になる。
2 理想の成果物と比べる
その場面での理想の成果物を,弁護士自身が作ってみることも有効である。
AIの成果物と並べると,違いが具体的に見えるため,不満を言葉にしやすくなる。
作った理想の成果物は,後でAIに自分の作業手順を調整させるときの手本としても使える。
3 合否の二択で判定する
前記の資料は,1から5のような段階評価よりも,合格か不合格かの二択で判定することを勧めている。
段階評価では3と4の違いがあいまいになり,判定がぶれやすく,中間の点に寄りやすいためである。
法律業務では,「引用した裁判例の裁判年月日と事件番号が原文と一致するか」「基準日が書かれているか」「依頼者に求める行動が一文で示されているか」のように,合否で判定できる形に基準を言い換えると,人によるぶれも小さくなる。
4 工程と価値の二つの軸で整理する
基準がある程度たまったら,二つの軸で整理する。
一つは工程の軸である。
仕事を「問いの確認」「資料の取得」「根拠の照合」「起案」「点検」「保存又は送信」のような工程に分け,どの工程の失敗かを分ける。
工程ごとに直し方が違うためである。
もう一つは価値の軸である。
最終的に生み出したい成果(例えば,依頼者が選択肢を理解して判断できたこと),成果物そのものの品質(例えば,書式,分量,根拠の正確さ),成果物を作る過程(例えば,所要時間,必要な確認を飛ばしていないこと)を分ける。
最も重要なのは最終的な成果であるが,結果が出るまで時間がかかり,測りにくい。
そこで,「この成果物の品質が良ければ最終的な成果に役立つはずである」という仮説を立て,成果物の品質を先に改善していく。
ただし,この仮説が外れると,測りやすい数字だけが良くなって本来の成果から離れることがある。
この点は「AIの改善ループが失敗する条件」で詳しく扱った。
第7 確認手段を割り当てる
1 機械的な検査
規則で白黒がつく観点は,プログラムによる検査に任せる。
例えば,書式,文字数,日付や事件番号の形式,必須項目の有無,禁止語,リンク切れ及び保存後の値の一致である。
Anthropicの技術資料は,プログラムによる判定を,速く,安く,客観的で,再現でき,原因を追いやすいものと整理する一方,正しい言い換えに弱く,主観的な作業には向かないとしている。
検査用のプログラムはAIに作らせることができ,作業手順を書いたファイルにその検査を実行するよう書いておけば,次回以降の作業でAIが自分で検査を実行するようになる。
2 AIによる自己点検と別の会話での査読
規則に落としにくい観点は,AIに点検させる。
最も手軽なのは,指示の末尾に「作業が終わったら,次の観点で見直してから完了を報告するように」と書くことである。
もう一段階慎重に確認したいときは,作成に使った会話とは別の会話(新しいセッション)又は別のAIに査読させる。
作成時の文脈を引き継がない状態で読ませるためである。
Claude Codeの公式資料も,サブエージェントはそれぞれ独自のコンテキストウィンドウで動作すると説明している。
もっとも,同じ系統のAIは同じ誤りをすることがあるため,AIによる査読は採否を決める補助として扱う。
AIを評価者として用いる研究は,提示の順序や文章の長さに判定が左右される偏りを報告し,自分の出力をひいきする偏りについても検討しているが,後者はデータが限られるため有無を断定できないとしている(Zhengほか,2023年)。
3 実物の確認
ウェブページ,保存した記録,送信したメールのように外部に結果が残る作業では,AIの「完了しました」という報告ではなく,実物を確認する。
ウェブページであれば,ブラウザで実際の表示を見させると,原稿だけを見ていては気付かない崩れを拾える。
Anthropicの資料も,エージェントが会話の中では成功を報告しても,実際の環境では処理が終わっていない場合があることを挙げ,会話の記録と最終的な環境の状態を分けて評価するよう述べている。
4 好みが分かれる観点は比較で決める
デザインの良さ,文章の読みやすさのように,言葉や機械で採点しにくい観点は,二つの案を並べてどちらが良いかを選ぶ方法(ペアワイズ評価)が使える。
利用者による比較を大量に集めて順位を公開する取組みもあり,会話AIについてはChatbot Arena,AIが作るデザインについてはDesign Arenaがある。
Anthropicの資料も,AIによる判定の方法の一つとして二つの案の比較を挙げている。
法律事務所では,依頼者向けの説明文の読みやすさや,ブログ記事の構成のように,正解が一つに決まらない観点に向いている。
これに対し,条文や裁判例の正確さは好みの問題ではないため,比較ではなく一次資料との照合で決める。
5 弁護士の最終確認
法令の現行条文,裁判例の本文,証拠原本,期限及び事件の方針は,弁護士が一次資料に当たって確認する。
評価の仕組みは,弁護士の確認を置き換えるものではなく,確認すべき箇所を絞り,見落としやすい誤りを先に拾うためのものである。
第8 落とし穴メモの作り方と保守
1 書く項目
過去の失敗をまとめたファイル(落とし穴メモ)を作り,AIが作業のたびにそれを読むようにする方法は,手軽に始められ,同じ失敗の繰り返しを減らす効果がある。
「失敗したらこのファイルに書き足すように」と指示しておけば,AI自身が書き足すこともできる。
一件ごとに,次の項目を書いておくと,後で見直しやすい。
①記録した日
②起きた現象(何が,どの工程で,どう違ったか)
③原因として確認できたこと(推測にとどまる部分は推測と書く)
④今後の手順(何をするか,何をしないか)
⑤適用範囲(どの業務,どの道具,どの環境に当てはまるか)
⑥根拠(確認した資料又は実測の記録)
⑦見直す日又は廃止した日
2 古くなった記載が誤った指示になる
落とし穴メモには,古い情報が残り続けるという弱点がある。
道具の仕様が変わった後も古い回避策が残っていると,AIはそれを現在の指示として読み,不要な手間をかけたり,かえって誤った操作をしたりする。
そこで,次の点を決めておく。
①同じ事実を二度書かない(既にある記載を探してから書く)
②新しい実測が古い記載を覆したときは,古い記載に「何日の実測で改めた」と書く
③適用範囲を限定して書く(特定の機器や環境だけで起きた事象を,全体の規則として書かない)
④定期的に読み返し,不要になった記載を廃止する
弁護士情報セキュリティ規程6条は,社会環境や職務遂行体制の変化に応じて,安全管理措置等が適切に機能しているかを点検し,必要に応じて改善を加えるよう努めることを定めている。
同条は落とし穴メモそのものを対象とする規定ではないが,手順書を変化に合わせて点検し直すという考え方は,落とし穴メモの保守にも当てはまる。
第9 理想の成果物を使った調整と過剰適合
さらに進んだ方法として,理想の成果物と評価基準をAIに渡し,AI自身に作業手順を調整させる方法がある。
試験用の事例ごとに,AIが読むことのできる資料と理想の成果物を用意し,全ての事例で理想に近づくよう調整させ,その都度評価基準で採点させる。
このとき注意すべきなのは,事例が少ないと,その事例だけに当てはまる具体的すぎる規則が書き込まれ,他の場面でうまくいかなくなることである(過剰適合)。
「特定の事例向けの規則は書かないように」と指示することも多少は効くが,それ以上に,事例の数を増やすことが重要である。
提供資料の話者は,感覚として少なくとも10件程度は欲しいとしている。
Anthropicの資料は,実際の失敗から集めた20件から50件程度の簡単な課題で評価を始めればよいとしている。
前記のHamel Husain氏らの資料は,AIによる判定器を調整する場面について,調整に使う事例と最終確認に使う事例を分けるよう勧め,調整用の事例の結果を見ながら変更を重ねると,その事例では良くても新しい事例では悪くなる過剰適合が生じ得るとしている。
件数の目安は目的によって異なるが,調整用と評価用の事例を分けることは,法律事務所でも同じである(「法律事務所の生成AIをどう評価・改善するか」第4の2)。
第10 法律事務所での注意点
弁護士法23条は,「弁護士又は弁護士であつた者は、その職務上知り得た秘密を保持する権利を有し、義務を負う。」と定めている(同条ただし書は,法律に別段の定めがある場合を除いている。)。
評価のために残す四つの記録,落とし穴メモ及び理想の成果物には,事件の事情が入り込みやすい。
そこで,次の点に注意する。
①理想の成果物や試験用の事例は,公開情報から作るか,依頼者名,事件番号,相手方名及び固有の金額等を除いた模擬事例にする
②落とし穴メモには,作業手順の失敗だけを書き,事件の事実を書かない
③評価の記録を外部の観測サービスや別のAIへ送る場合は,送信先,保存期間及び閲覧者を確認する
④AIによる評価の点数が高くても,法的判断の最終責任は弁護士が負うことを前提に,人へ返す条件を決めておく
第11 提供資料の評価
本記事の契機は,YouTube動画「AIがどれだけ進化しても、人間に残り続ける最後の仕事」(令和8年7月9日公開)である。
同動画は,評価の意味,始め方の手順(記録を残す,失敗を言語化する,確認手段を作る,AIに自分で改善させる)及び評価が今後も重要であり続ける理由を説明している。
動画が示す手順は,評価基準が出力を見て定まっていくという研究結果,及びプログラム,AI及び人による判定を使い分けるというAnthropicの技術資料と整合している。
他方,「少なくとも10件」という件数は話者の感覚として述べられたものであり,他の資料が示す目安(20件から50件,又は約100件の記録の確認)とは目的も規模も異なる。
件数は,業務の重さと事例の多様さに応じて事務所ごとに決める必要がある。
また,評価がAIの進化後も人の仕事として残るという点は,人が何を求めているかをAIとすり合わせる作業はなくならないという話者の見解である。
法律事務所では,何を良い仕事とするかを決めることは,依頼者の利益と職業上の義務を踏まえた弁護士自身の判断であり,この見解は実務上の実感とも合う。
第12 一次資料及び判例の確認状況
評価基準が出力を見て定まっていくという点は,Shankarほかの論文(arXiv)で確認した。
評価者の種類,事例数の目安及び会話の記録と環境の状態の区別は,Anthropic及びHamel Husain氏らの公開資料で確認した。
これらは技術資料又は研究論文であり,日本法の法源ではない。
弁護士法23条は,e-Gov法令検索のAPIで取得した法令データ(令和8年9月11日取得)により条文を確認した。
令和8年10月1日には,e-Gov法令検索がシステムメンテナンス中で再取得できなかった。
弁護士情報セキュリティ規程2条,5条及び6条は,日本弁護士連合会が公開する会規の本文で確認した。
本記事は,AIの業務評価の進め方を扱うものであり,特定の法的効果を裁判例から導く記事ではない。
そのため,裁判例は根拠として用いておらず,判例秘書による検索も実施していない。
これは関連する裁判例が存在しないという意味ではない。
第13 関連記事
①法律事務所の生成AIをどう評価・改善するか―トレース,評価データセット,回帰試験,一次資料確認及び守秘義務(AI作成)
②AIの改善ループが失敗する条件-代理指標,仕様ゲーミング,遅れて分かる成果及び人が決める停止条件(AI作成)
③山中弁護士がAI作成又はAIリライトの記事を投稿するときに行っているハルシネーション防止方法(AI作成)
④法律事務所のAIエージェント業務設計-目的・コンテキスト・権限・完了条件をどう分けるか(AI作成)
⑤弁護士情報セキュリティ規程とは―全7条の内容,基本的な取扱方法及び漏えい等事故の対応(AI作成)
第14 出典・参考資料
①e-Gov法令検索・弁護士法23条
②日本弁護士連合会「弁護士情報セキュリティ規程」(令和4年6月10日会規第117号)2条,5条及び6条
③Shreya Shankar et al., Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences(arXiv,2024年4月18日)
④Hamel Husain and Shreya Shankar, AI Evals: Everything You Need to Know(2026年9月18日)
⑤Anthropic, Demystifying evals for AI agents(2026年1月9日。モデル提供者の技術資料)
⑥Claude Code Docs, Create custom subagents(製品提供者の公式資料)
⑦Lianmin Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(arXiv,2023年6月9日)
⑧Design Arena(AIが作ったデザイン等について,利用者から集めた評価に基づく順位表を公開するサイト)
⑨AIでサボろうチャンネル「AIがどれだけ進化しても、人間に残り続ける最後の仕事」(YouTube,令和8年7月9日公開。本記事の契機となった提供資料)
⑩seya「LLMプロダクト開発における独自評価基準とデータセットの作り方の考察」(Zenn,2024年4月22日。二次資料)
⑪seya「LLMによるLLMの評価とその評価の評価について」(Zenn,2024年5月6日。二次資料)
第15 今後検討する事項
本記事では,次の点を検討していない。
①評価基準と落とし穴メモを事務所の業務手順書(いわゆる基本的な取扱方法)にどう組み込むか
②AIによる査読の判定が弁護士の判定とどの程度一致するかを,事務所の実例で測る方法
③依頼者向け説明文の読みやすさを比較で評価する場合の,比較の件数と判定者の選び方
④評価の記録を保存する期間と,事件記録の保存期間との関係