AIに文章を作らせ,AIに点数を付けさせ,低得点なら書き直させる仕組みは,評価基準と停止条件が適切であれば有用である。反対に,本当に達成したい成果から離れた代理指標だけを最適化すると,数字は改善しても,事件処理,依頼者の理解又は受任後の成果は悪化し得る。
本記事は,法律事務所でAIの改善ループを使う場合について,①成立条件,②代理指標と仕様ゲーミング,③遅れて判明する成果,④人が決める停止条件及び⑤一次資料の確認状態を整理する。技術資料は令和8年10月1日時点で確認した。
第1 この記事の対象と結論
対象は,生成AI又はAIエージェントに,案の作成,評価及び再作成を繰り返させる業務である。記事作成だけでなく,裁判例調査,書面の初稿,問い合わせ分類,依頼者向け説明及び事件管理の補助も含む。
結論は,次のとおりである。
①改善ループが成立するために必要なのは,数学のような唯一の正解に限られない。複数の評価者が概ね同じ判定をできる基準,外部資料による照合,改善の測定可能性及び停止条件があれば,翻訳,検索その他の非数学的業務でも利用できる。
②もっとも,最終成果の代わりに測りやすい数字だけを目的にすると,AIはその数字を満たす方向へ進み,本来の目的から外れ得る。
③法律実務では,作業出力,法的・証拠的品質及び事件・依頼者の成果を分けて測る。重大な誤りは平均点で相殺しない。
④同じAIに作成,採点及び再作成を担わせるだけでは独立確認にならない。人,外部資料,別系統の評価又は保存後の実状態による確認を置く。
⑤反復回数,費用,無改善回数,重大事故及び人へ返す条件を開始前に定める。
第2 改善ループが成立する条件
1 唯一の正解より,判定可能な基準が重要である
Anthropicの技術資料は,評価者が回答を採点し,別のモデルがその評価に基づいて改善する「evaluator-optimizer」を,明確な評価基準があり,反復改善に測定可能な価値がある場合に有効な方式として整理している。例として挙げられているのは,文学的翻訳や複雑な検索であり,いずれも数学のような唯一の正解がある作業ではない。
したがって,「AIが力を発揮するのは答えが数学のようにはっきりしている分野だけである」という命題は広すぎる。必要なのは,完全な正解ではなく,改善の方向を安定して判定できる基準である。
2 外部の環境から真偽を得られること
同じ資料は,エージェントについて,環境から得られる客観的な真実を各段階で確認し,試験を設け,フィードバックループを閉じることを勧めている。また,最大反復回数等の停止条件を置くことも必要であるとしている。
法律実務での外部確認には,e-Gov法令検索の現行条文,裁判所が公開した判決全文,判例データベースの収録本文,依頼者から受領した原資料,事件管理システムの確定記録及び公開後のウェブページがある。AIが「確認した」「保存した」と述べたこと自体は,外部確認ではない。
3 評価者の独立性と偏りを管理すること
NISTのAI Risk Management Frameworkは,目的,法令・規範上の期待及びリスク許容度を明確にし,人とAIの役割・監督責任を定めることを求める。また,測定について,定量・定性の指標を用い,独立した評価が内部の偏りや利益相反を減らし得るとする。
同じAI又は同じ会話に「自分の文章を厳しく採点せよ」と指示する方法は,弱点候補の発見には使える。しかし,作成時の誤った前提,欠落資料又は評価基準の偏りを共有するため,独立査読とは扱わない。
第3 代理指標と仕様ゲーミング
1 本当の成果と代理指標を分ける
本当の成果を直ちに測れないとき,その代わりとなる数字を用いることがある。例えば,依頼者が理解して適切な意思決定をできたかを直ちに測る代わりに,回答時間,文章量,閲覧数又は問い合わせ件数を測る場合である。
代理指標は観測しやすいが,本当の成果そのものではない。回答時間を短くするため説明を省けば,数字は改善しても依頼者の理解は悪化する。記事の閲覧数を増やすため刺激的なタイトルを選べば,閲覧数は増えても,適切な依頼又は信頼の形成から遠ざかることがある。
2 仕様ゲーミングとは何か
Google DeepMindは,AIが与えられた目的を文字どおり満たしながら,設計者の意図した結果を達成しない現象を「specification gaming」と説明している。これはAIの悪意ではなく,指定された報酬又は評価方法と,人が本当に望む結果との間のずれである。
法律実務では,引用数を増やす評価が,重要性の低い裁判例の列挙を促すことがある。誤字の少なさだけを採点すれば,争点への踏み込みを避けた無難な文章が高得点になることがある。期限内処理件数だけを測れば,難しい事件が後回しになることがある。
3 遅れて判明する成果を捨てない
受任の適否,方針選択の妥当性,依頼者の納得,紛争の解決又は記事を読んだ人との継続的な信頼は,数週間又は数か月後に判明することがある。短期の代理指標だけで反復すると,遅れて判明する成果が評価から消える。
そこで,短期指標とは別に,後日評価日を置く。例えば,初回相談後,受任判断後,主要な期日後及び終結後に,本当の成果と当初の代理指標が同じ方向を示したかを確認する。
第4 法律実務では三層で評価する
1 作業出力
作成件数,処理時間,定型欄の充足,リンク切れ,形式違反及び費用を測る。この層は自動評価と相性がよいが,法律業務の成功を単独では示さない。
2 法的・証拠的品質
現行条文との一致,裁判年月日・事件番号・裁判所名の一致,引用命題と判決本文の対応,重要な反対材料,適用時点,原資料との一致及び未確認事項の明示を測る。
存在しない裁判例,引用命題と判決理由の不一致,事件を取り違えた保存,期限の見落とし又は守秘情報の誤送信は,平均点で相殺しない。このような項目は,一件でも生じれば停止又は人への返却とする必須条件に置く。
3 事件・依頼者の成果
依頼者が選択肢と不利益を理解できたか,必要な事実と資料を早期に把握できたか,手戻りが減ったか,期限が守られたか,紛争解決又は受任後の方針に役立ったかを測る。
この層は遅れて判明し,事件ごとの差も大きい。したがって,単純な自動採点だけにせず,対象期間,母数,除外基準,事件類型及び人による評価を記録する。
第5 改善ループを開始する前の八項目
改善ループを開始する前に,少なくとも次の八項目を記録する。
①本当に達成したい成果
②当面用いる代理指標
③本当の成果と代理指標がずれる場面
④平均点で相殺しない重大な誤り
⑤真偽を照合する外部資料又は実状態
⑥基準を決め,変更し,最終採否を判断する人
⑦最大反復回数,費用上限及び無改善で止める回数
⑧遅れて判明する成果を確認する日と担当者
評価基準は,AIに自動生成させて終わりにしない。AIが提案した基準は候補として利用できるが,何を成功とし,何を重大事故とするかは,事件,依頼者及び事務所の方針を理解する人が決める。
第6 停止条件と人への返却
次のいずれかが生じた場合は,反復を続けず,人へ返す。
①一次資料に到達できない又は資料間に矛盾がある
②重要な事実,適用時点又は裁判例の射程について複数の解釈が残る
③重大な誤りが一件でも生じた
④同じ欠陥が再発し,所定回数の修正で改善しない
⑤評価点は上がるが,文章が画一化し,反対材料又は実務上の意味が減る
⑥費用又は時間の上限に達した
⑦保存,送信,提出,公開又は事件方針の変更が必要になった
「もっと良くなるかもしれない」という理由だけで反復を続けない。停止した時点で,採用案,未解決事項,使用した資料,変更履歴及び人が判断すべき点を残す。
第7 具体例
1 裁判例調査
検索語,裁判年月日,事件番号及び引用候補の抽出はAIが反復できる。しかし,検索件数又は引用数を目標にすると,重要性の低い裁判例が増える。最終評価は,命題との対応,現在も維持されているか,事案の相違及び重要な反対裁判例で行う。
裁判所ウェブサイトに掲載がないことだけから,裁判例が存在しないと結論しない。必要性に応じ,判例秘書その他の利用可能な判例データベースで本文を確認する。
2 裁判書面の初稿
見出し,引用表記,日付及び形式の検査は自動化しやすい。他方,勝つために重要な事実,認否,立証の弱点及び相手方の反論は,書式点数では評価できない。形式評価と事件戦略の判断を分ける。
3 問い合わせ・事件管理
初回応答時間,未返信件数及び期限超過は有用な指標である。しかし,早いだけで誤分類が増えたり,複雑事件を避けたりすれば本末転倒である。誤分類,重複登録,弁護士の確認時間及び依頼者の理解も同時に測る。
4 ブログ記事
タイトル案,誤字,リンク切れ及び目次構造の検査にはAIを使いやすい。PV,検索順位又はAIによる引用回数だけを目的にすると,独自の経験,重要な留保又は読み手に必要な具体性が失われることがある。公開後は,表示だけでなく,公開本文,出典リンク,問い合わせの適合性及び後日の訂正を確認する。
第8 提供文書及びJevに関する評価
本記事の契機となったバズ部のメールマガジンは,測定しやすい指標への偏り,人が成果基準を決める必要及びAI利用の総コストを問題にした点で,実務上有用な問題提起である。
他方,「答えが数学のようにはっきりしている分野だけで力を発揮する」,「複雑性が増すと自律ループは必ず成果を悪化させる」又は「限りなく100%に近い確率で効果性を発揮しない」という強い表現は,提供文書だけでは実証されていない。明確な評価基準,外部確認及び停止条件がある非数学的業務にも改善ループを使えるため,条件付きの命題として扱うべきである。
TypeSafeのJevについて確認できた公開資料は,同社による早期アクセス段階の紹介記事である。同社は高速性,効率性及びワークフロー評価の成績を主張しているが,提供者自身の説明であり,独立した検証ではない。したがって,Jevが従来のLLMの限界を克服したとも,克服していないとも,本記事の資料だけからは判断しない。
第9 既存記事との関係
評価用データセット,トレース,回帰試験及びオンライン評価の具体的な組み方は,「法律事務所の生成AIをどう評価・改善するか」で整理している。
権限,人の承認,完了条件及び再開記録は,「法律事務所のAIエージェント業務設計」を参照されたい。
記事作成時の一次資料確認及び公開前検証は,「山中弁護士がAI作成又はAIリライトの記事を投稿するときに行っているハルシネーション防止方法」で整理している。
AIによる時間短縮と弁護士が保持すべき判断の関係は,「AIに代替される弁護士業務と人が担う役割」を参照されたい。
評価者と同じ物差しで選んだ案が評価者に勝ちやすくなる例として,判定専用AIに項目別の採点で発言案を選ばせたディベート実験の読み方と,法律文書で採点項目を要件事実・証拠・相手方主張への応答から作る理由は,「AIに主張案を複数書かせて選ぶとき―項目別の採点,弁護士が決める重み,書き手と別の採点役及び選び方が割れた案の確認」で整理している。
評価基準をまだ言葉にできていない段階で,失敗の言語化,理想の成果物との比較,落とし穴メモの保守及び評価を作り込む業務の選び方から始める手順は,「AIの仕事の評価基準を育てる手順」で整理している。
第10 出典・確認状態
1 公的・一次的な技術資料
①NIST, AI Risk Management Framework, Core
目的,役割・責任,定量・定性の測定及び独立評価に関する公的資料として参照した。
2 モデル提供者・研究組織の技術資料
①Anthropic, Building effective agents
評価者・改善者方式の成立条件,環境から得る客観的な真実及び停止条件の説明として参照した。モデル提供者の技術資料であり,日本法の法源ではない。
②Anthropic, Demystifying evals for AI agents
AIの発言や作業記録と,実際の外部環境の結果を分けて評価する必要を確認した。モデル提供者の技術資料であり,日本法の法源ではない。
③Google DeepMind, Specification gaming: the flip side of AI ingenuity
仕様ゲーミングの概念と例を確認した。研究組織の解説資料であり,日本法の法源ではない。
3 事業者資料及び提供文書
①TypeSafe, Introducing System One Models and Jev
早期アクセス,性能及び効率に関する同社の主張を確認した。独立検証済みの資料とは扱っていない。
②バズ部メールマガジン(2026年,提供文書)
問題提起及び実務経験に基づく見解として参照した。公開URLは確認しておらず,法令,裁判例又は独立した実証研究ではない。
4 裁判例の確認状態
本記事は,AIの評価設計及び業務管理を扱うものであり,特定の法的効果又は裁判規範を裁判例から導く記事ではない。そのため,本記事の中心命題に直接対応する裁判例の網羅検索は実施しておらず,判例秘書による網羅確認も実施していない。これは関連裁判例が存在しないという意味ではない。個別事件への適用では,争点に応じて改めて法令,裁判例及び判例データベースを確認する必要がある。