第1 本記事の対象と結論
本記事は,法律事務所が生成AI又はAIエージェントを導入した後に,出力の見栄え又は担当者の感想だけで性能を判断せず,どの工程で何が失敗したかを記録し,評価データセットと回帰試験によって改善する方法を整理するものである。
令和8年9月30日時点の法令,会規,行政資料及び製品提供者の公式資料を参照している。
結論として,①実行過程をトレースで確認する,②代表例と失敗例を評価データセットへ戻す,③固定ルール,別のAI及び弁護士の三層で評価する,④変更前後を同じ問題で比較する,⑤本番の失敗を次の回帰試験へ戻す,という循環を作る必要がある。
ただし,トレースはAIが何をしたかを示す記録であって,法的結論が正しいこと又は弁護士が相当な確認をしたことを当然に証明するものではない。
第2 四つの記録を分ける
1 事件記録
事件記録は,依頼者から受領した原資料,確定した期限,提出又は送信した書面,連絡内容及び弁護士の最終判断を保存する記録原本である。
AIとの会話履歴又は観測サービスの画面を事件記録の代わりにしない。
2 監査ログ
監査ログは,誰が,いつ,どの対象について,閲覧,変更,送信,削除又は承認を行ったかを追跡するための記録である。
外部作用を伴う操作では,成功通知だけでなく,保存先又は送信先から読み戻した結果も記録する。
3 トレース
トレースは,一つの処理について,モデル呼出し,取得した文脈,検索結果,ツール操作,再試行,入力,出力及び付随情報を工程順に結び付ける記録である。
最終回答だけを見る場合と異なり,検索で正解資料を落としたのか,取得に失敗したのか,引用を誤ったのか,正しい資料を最終回答が無視したのかを切り分けやすくなる。
4 評価データセット
評価データセットは,代表的な問い,期待する処理又は回答,参照すべき一次資料及び評価基準を,繰り返し試験できる形で保存した集合である。
本番トレースをそのまま永久保存することとは異なり,必要な部分だけを抽出し,秘密情報を削減又は置換し,次の版にも通用する試験例へ作り直す。
第3 法律調査を工程に分けて評価する
1 問いの定義
最初に,対象法域,基準日,手続段階,当事者の立場,求める成果物及び未確定事実を固定する。
同じ語を検索しても,現行法,旧法,施行前の改正法又は経過措置のどれを問うかによって正解が変わるため,基準日を省略しない。
2 検索・取得
検索工程では,正解資料が候補集合へ入った割合と,誤った候補をどれだけ混ぜたかを分けて測る。
取得工程では,候補の名称又は要約だけでなく,実際の条文,判決本文,行政資料又は契約原文を開けたかを確認する。
3 命題化・引用
命題化の工程では,資料が直接述べる内容,そこからの推論及び一般化を分ける。
引用の工程では,引用文,頁又は該当箇所,事件番号及び裁判年月日が原文と一致するかを検査し,反対方向の資料又は例外を落としていないかを確認する。
4 時点管理・最終出力
時点管理では,法令の施行日,改正前後,経過措置及び資料の公表日を確認する。
最終出力では,結論,根拠,限界,未確認事項及び次に人が行う確認を分け,読者が一次資料へ戻れるURL又は書誌情報を残す。
第4 評価データセットに入れる項目
1 正解だけでなく法的な前提を残す
法律実務の評価データセットには,少なくとも次の項目を持たせることが考えられる。
①問い又は作業指示
②対象法域,基準日及び手続段階
③参照すべき法令名,条番号,裁判所名,裁判年月日,事件番号,行政資料名又は証拠番号
④確認した原文のURL,頁又は該当箇所
⑤期待する結論又は工程
⑥重要な反対材料,例外及び不利な先例
⑦必ず付ける留保又は未確認表示
⑧禁止する操作及び人の承認を要する操作
⑨秘密情報の区分,匿名化の方法及び再利用の可否
⑩確認者,確認日及び使用した資料の版
最終文面が一字一句同じであることよりも,必須資料を拾い,射程を外さず,反対材料と未確認事項を示したかを重視する。
2 調整用と評価用を分ける
プロンプト,検索式又は閾値を調整するために繰り返し見た問題と,最終性能を測る問題を分ける。
同じ少数の問題だけを見ながら調整すると,その問題には強いが新しい案件には弱い仕組みになり得る。
変更前の基準版,変更後の版,モデル,プロンプト,検索対象,ツール,評価器及び実行日を記録し,同じ条件で比較できるようにする。
3 失敗事例を安全に再利用する
本番で誤った期限,架空の裁判例,引用のずれ,権限外検索又は誤送信が見つかった場合は,事故対応と再発試験を分ける。
まず利用停止,影響範囲の確認,証拠保全及び必要な連絡を行い,その後,原因となった工程だけを再現できるテスト事例を作る。
依頼者名,事件番号,相手方名,固有の金額その他の識別情報を評価データセットのメタデータへそのまま入れない。
置換によって法的意味が変わる場合は,実在事件を外部の評価基盤へ移すのではなく,事務所内で管理する模擬事例又はアクセスを限定した検証環境を用いる。
第5 三層の評価を使い分ける
1 固定ルールによる検査
固定ルールは,URLの有無,指定項目の欠落,日付又は金額の形式,事件番号の形式,重複,引用文と原文の一致,目次リンク,保存後の値及び禁止語等を高速に検査できる。
一方,条文又は判決の射程,類推の妥当性及び証拠評価を,形式検査だけで決めることはできない。
2 別のAIによる補助評価
別のAIに,根拠の欠落,反対材料,説明の明確さ,質問への適合性又は不自然な断定を指摘させる方法は,多数の候補を人の確認順へ並べるために使える。
もっとも,評価するAIも同じ誤りをする可能性があり,参照資料を与えなければ文章の自然さを正しさと取り違えることがある。
したがって,AIによる評価点は採否の補助信号とし,低得点を自動却下する場合も,高得点を自動採用する場合も,事務所の実測値と危険度に応じた閾値及び人へ戻す条件を定める。
3 一次資料と弁護士による確認
法令の現行条文,裁判例の本文,証拠原本,契約条項及び期限は,権威ある原典又は利用を許されたデータベースで確認する。
弁護士は,法的命題と原典の対応,基準日,不利な資料,個別事情,依頼者の目的及び最終的な法的判断を確認する。
裁判所ウェブサイトに掲載がないことは裁判例の不存在を意味しない。
必要性に応じて判例秘書その他の利用可能な判例データベースを確認し,確認できた本文と検索範囲を分けて記録する。
第6 オフライン評価・オンライン監視・回帰試験
リリース前のオフライン評価では,既知の代表例,境界例,失敗例及び反対材料を含むデータセットに新しい版を通し,基準版と比較する。
必須項目の欠落又は禁止操作は固定ルールで,説明の質又は反対材料の拾い方は補助評価と人の査読で確認する。
本番中のオンライン監視では,極端に長い処理,再試行の増加,想定外のツール,承認の迂回,未確認の断定又は人からの訂正を検知する。
本番で見つかった失敗は,秘密情報を減らした上で評価データセットの候補へ戻し,修正後は同じ事例を回帰試験に追加する。
モデル,プロンプト,検索対象,コネクタ,権限,出力形式又は一次資料の版を変えたときは,関係する回帰試験を再実行する。
全体の平均点だけでなく,重大な偽陰性,期限,外部送信及び権限逸脱のような一件でも影響が大きい失敗を別に管理する。
第7 守秘義務と個人情報に配慮したトレース設計
1 観測基盤も独立した情報送信先である
生成AIのモデル提供者だけでなく,検索先,外部コネクタ,トレース,評価データセット,評価に使う別のAI及びサポート窓口も,入力又は派生情報が渡る経路になり得る。
モデル側を学習オフにしても,観測基盤へ入力,出力,取得資料,ツール引数又はメタデータが保存される場合は,その経路を別に確認する。
個人情報保護委員会は,個人情報取扱事業者が個人情報を含むプロンプトを入力する場合,利用目的の範囲内であることを確認し,本人同意なく個人データを入力して応答出力以外の目的で取り扱われる場合には,提供者が機械学習へ利用しないこと等を十分に確認するよう注意喚起している。
この注意喚起は,学習利用を確認すれば守秘義務その他の問題が全て解決するという意味ではない。
2 記録しない設計も選択肢にする
トレースには,目的に必要な項目だけを記録し,依頼者名,事件番号,メールアドレス,資格情報及び原資料全文をメタデータへ重複保存しない。
入力及び出力を保存せず,処理時間,成否,工程名及び匿名のテストIDだけを残す方法も検討する。
秘密情報を含む処理で,保存先,閲覧者,再委託先,削除,事故通知又は契約条件を確認できない場合は,トレースを無効にするか,事務所が管理する環境だけで観測する。
3 保存期間等を固定値で決め打ちしない
製品の保存期間,プラン,機能名,再委託先及び削除方法は変更され得るため,ブログ記事又は内部規程に古い固定値を残し続けない。
導入時及び変更時に,契約,公式資料,管理画面及び実際の設定を確認し,確認日と確認者を許可サービス台帳へ記録する。
トレースを評価データセットへ追加すると保存期間又は削除単位が変わることがある。
トレース,データセット,添付ファイル,評価結果及び請求・分析用メタデータについて,保存期間,削除の方法,削除後に残る情報及びエクスポートの可否を別々に確認する。
第8 小規模法律事務所の最小実装
最初から専用の評価製品を導入しなくても,次の順序で始められる。
①公開情報だけを使った代表的な10問から20問を用意する。
②各問に基準日,参照すべき一次資料,必須事項,反対材料及び人へ戻す条件を付ける。
③実行ごとに,検索,取得,引用,最終回答及び確認の成否を一行で記録する。
④モデル又はプロンプトを変える前後で同じ問題を実行し,重大な失敗が増えていないかを確認する。
⑤本番の訂正事例は秘密情報を除いた模擬事例へ変換し,次回以降の回帰試験へ追加する。
自動評価を増やすのは,この少数例で何を誤るかが分かってからでよい。
評価作業自体が過大になった場合は,重大度,発生頻度及び検出可能性により対象を絞り,人の査読を高リスクの工程へ集中する。
第9 LangSmithから学べることと限界
LangSmithの公式資料は,トレースにモデル呼出し,取得した文脈,ツール動作及びフィードバックを結び付け,既知の事例を使うオフライン評価,本番中のオンライン評価並びに失敗を評価データセットへ戻す循環を説明している。
また,固定ルールによる評価,別のAIによる評価,版間比較及び人による注釈を使い分ける構成を示している。
これらは,法律事務所の生成AIを改善する工程設計の参考になる。
もっとも,LangSmithは法令,裁判例又は証拠の正確性を認定する法的権威ではなく,製品のトレースが弁護士の職業上の義務を満たすことを保証するものでもない。
本記事はLangSmithの導入を推奨する製品比較ではない。
同じ考え方は,事務所内の表計算,簡易ログ又は別の観測・評価基盤でも実装でき,利用する製品は情報区分,契約,保存先,権限及び削除条件に応じて選ぶ。
第10 一次資料及び判例の確認状況
法的な記述は,弁護士法,個人情報保護法,日本弁護士連合会の弁護士情報セキュリティ規程及び個人情報保護委員会の注意喚起を一次資料として確認した。
トレース及び評価機能に関する記述は,製品提供者であるLangChainの公式資料で確認した。
Zennの「LangSmithの概要と使い方」は理解の出発点となった二次資料であり,現在の機能又は法的評価の根拠にはしていない。
本記事の中心は評価・改善工程の設計であり,特定の紛争における法的責任を論じるものではないため,今回,新たな判例秘書の全文検索は実施しておらず,裁判例を直接の根拠として用いていない。
裁判例が必要となる個別問題では,裁判所ウェブサイトへの掲載の有無と,判例秘書その他のデータベースで本文を確認したかを分けて示す必要がある。
第11 関連記事
①弁護士情報セキュリティ規程とは―全7条の内容,基本的な取扱方法及び漏えい等事故の対応(AI作成)
②法律事務所の生成AI利用ガイドラインの作り方-許可サービス,入力情報,出力確認,委託先及び事故対応(AI作成)
③法律事務所のAIエージェント業務設計-目的・コンテキスト・権限・完了条件をどう分けるか(AI作成)
④法律調査AIの検索・再順位付けをどう評価するか-正解資料の取りこぼしと人の確認負荷(AI作成)
⑤法律事務所のAI・事件管理システム連携-問い合わせ,LINE,メール,FAX,期限及び書類をどうつなぐか(AI作成)
第12 出典・参考資料
①e-Gov法令検索・弁護士法23条
②e-Gov法令検索・個人情報の保護に関する法律
③日本弁護士連合会「弁護士情報セキュリティ規程」
④個人情報保護委員会「生成AIサービスの利用に関する注意喚起等について」(令和5年6月2日)
⑤LangChain「What is LangSmith?」(製品提供者の公式資料。2026年9月7日)
⑥LangChain Docs「Evaluation types」(製品提供者の公式資料)
⑦LangChain「Trajectories now in LangSmith」(製品提供者の公式資料。2026年9月24日)
⑧LangChain Trust Center(製品提供者のセキュリティ・再委託先情報)
⑨LangChain Terms of Service(2026年6月2日改定)
⑩umi_mori「LangSmithの概要と使い方【LLMOps】」(二次資料。現在の製品仕様又は法的評価の根拠には用いていない。)