メインコンテンツへスキップ
       

法律調査AIの検索・再順位付けをどう評価するか-正解資料の取りこぼしと人の確認負荷(AI作成)

第1 この記事の対象と結論

本記事は,法律調査にAIを組み込む場合に,検索結果の順位又は最終回答の見栄えだけで性能を判断せず,検索,再順位付け,回答作成及び原典確認を別々に評価する方法を整理するものである。
結論として,法律調査AIの導入判断では,①正解資料を候補集合へ入れられたか,②候補を人が確認できる範囲へ絞っても正解資料を残せたか,③回答が原典の射程を正しく説明したか,④人による最終確認まで含む総作業時間が短くなったかを分けて測る必要がある。

特に,再順位付けは,最初の検索が拾わなかった資料を後から復活させる処理ではない。
検索段階の取りこぼしと,再順位付け段階の取りこぼしを同じ「AIの誤り」として集計すると,改善すべき工程を誤る。

本記事は,AI又は特定サービスが法律調査を自動的に完結できると述べるものではない。
法令,裁判例,通達その他の法的根拠は,利用可能な公式資料又は原典で人が確認することを前提とする。
裁判例を根拠とする法的命題は扱っていないため,裁判所ウェブサイト又は判例秘書による裁判例の確認は行っていない。

第2 法律調査AIを四つの工程に分ける

1 検索で候補集合を作る

第1工程は,データベース又は文書群から候補を広く拾う検索である。
キーワード検索,BM25,ベクトル検索又はこれらの併用により,全文書を数十件から数百件の候補へ絞る。

この工程で重要なのは,1位に正解を置くことだけではなく,後続工程が見る候補集合のどこかに正解資料を残すことである。
最初の候補集合に正解資料が入っていなければ,再順位付けも回答作成もその資料を利用できない。

2 再順位付けで確認順序を整える

第2工程は,検索が出した候補を問いとの適合度により採点し,並べ替え,又は一定数へ絞る再順位付けである。
検索が語句又は意味の近さで候補を広く集め,再順位付けが個々の候補と問いを直接比較するという役割分担が考えられる。

TypeSafeの公式クックブックは,米国裁判所意見のデータセットを用いた40件の照会で,BM25が3,565件から30件の候補を作り,Jevが照会と各候補を個別に評価する例を示している。
同クックブックの結果では,正解資料が上位1件に入る割合は5%から18%へ,上位10件に入る割合は38%から62%へ上昇した。
もっとも,これは提供者が選定したデータ,照会,設定及びモデルによる公式実演であり,日本法の実務又は別の文書群で同じ結果になることを示す独立検証ではない。

3 回答作成で法的な意味を説明する

第3工程は,残った資料を読み,問いへの回答,根拠,例外及び留保を文章にする工程である。
候補の関連性を採点する能力と,条文の適用関係,裁判例の射程又は複数資料の矛盾を解く能力は同じではない。

定められた形式の判定を安定して返すことは,法的推論が正しいことを意味しない。
検索又は再順位付けに向くモデルと,長い理由付け又は起案に向くモデルを分け,後者にも確認済みの候補資料だけを渡す方法が考えられる。

4 原典確認で回答を閉じる

第4工程は,人が引用元を開き,書誌,本文,基準時,改廃,射程及び回答との対応を確認する工程である。
AIの回答が自然であること,候補の点数が高いこと又は出力形式が崩れていないことは,この確認を代替しない。

法律調査の完了条件には,少なくとも,①使用したデータベース又は資料群,②検索日,③検索語又は検索条件,④確認した原典,⑤確認できなかった事項,⑥反対資料又は例外,⑦最終確認者を含めることが望ましい。

第3 X投稿で報告された税務法令実験をどう読むか

1 投稿者が報告した結果

souzou_office氏のX投稿は,税務分野の120問について検索候補を100件作り,正解とされた法令248件を上位25件へ残す再順位付けを比較した実験を報告している。
同投稿によれば,Jevは試行ごとに230件から235件を残し,Claudeは218件から225件を残したとされる。

248件を分母とすれば,投稿上の候補保持率は,Jevが約92.7%から94.8%,Claudeが約87.9%から90.7%である。
また,同投稿は,検索候補を100件から300件へ増やしても結果が改善しなかったこと,問いに明記されていない法的知識を要する場面で失敗が生じたことを述べている。

2 確認できたことと未確認のこと

上記の数値は投稿者による実験報告であり,本記事の作成過程でデータセット,正解表,指示文,実行記録又は判定結果を再実行していない。
したがって,「日本の税務法令検索でJevが一般にClaudeより優れる」と結論する根拠にはしない。

この報告からブログ記事の論点として採用できるのは,検索と再順位付けを分けること,同じ候補数で正解資料を何件残したかを測ること,複数回実行して変動を記録すること,及び明記されていない法的知識をモデルが補えると仮定しないことである。
モデル間の優劣ではなく,評価設計の具体例として位置付ける。

29meat_ai氏のX投稿及びK_AI_Work氏のX投稿は,Jevの判定又は選別用途を紹介した論点発見資料である。
製品の機能又は利用例を知る手掛かりにはなるが,法律調査での正確性を単独で実証する資料ではない。

第4 最低限記録する四つの評価指標

1 候補保持率と偽陰性

候補保持率は,正解と定めた資料のうち,上位k件に何件残ったかを示す。
情報検索ではRecall@kと呼ばれることがあり,「残った正解資料数÷正解資料総数」で計算する。

法律調査では,関係する法令又は不利益な裁判例を落とす偽陰性の方が,無関係な資料を余分に残す偽陽性より重大な場合がある。
ただし,何を正解資料とするかが不十分であれば,高い候補保持率にも意味がないため,正解表は弁護士が原典に照らして作る必要がある。

2 適合率と人の確認負荷

候補を多数残せば取りこぼしは減りやすい一方,人が読む件数は増える。
そこで,上位k件のうち正解資料又は実質的に有用な資料が占める割合,1問当たりの確認件数,確認時間及び確認者間の不一致も記録する。

25件へ絞ったという事実だけでは効率化を意味しない。
検索前後の総作業時間,原典を開いた件数,誤った候補に費やした時間及び最終回答の修正回数まで測って初めて,確認負荷が減ったかを判断できる。

3 再現性と安定性

同じ入力を複数回処理し,正解資料の順位,候補保持率及び採否がどの程度変わるかを記録する。
平均値だけでなく,最悪回,ばらつき及び同じ資料が採用と除外を往復した件数を見る。

安定して同じ誤答を返すモデルは,再現性が高くても正確ではない。
反対に,正解率が同程度でも採否が大きく変動するモデルは,レビュー手順及び監査記録を複雑にする。

4 時間,費用及び障害時の挙動

検索,再順位付け,回答作成及び人の確認に要した時間を別々に記録する。
API費用だけでなく,正解表の整備,失敗分析,モデル更新時の再試験及び人の確認時間も含める。

タイムアウト,空の回答又は形式違反が生じた場合に,処理を黙って継続するか,人へ戻すか,従来検索へ切り替えるかも評価対象である。
障害時に安全に停止できることは,通常時の平均速度とは別の性能である。

第5 比較実験の条件を固定する

1 調整用と評価用の問題を分ける

指示文,閾値又は候補数を調整した問題でそのまま最終成績を測ると,その問題に合わせ込んだ結果になりやすい。
調整用の問題と,最後まで見せない評価用の問題を分ける。

評価用の問題には,単純な条文照会だけでなく,例外,経過措置,準用,別表,改廃前後,同義語,不利益資料及び「該当なし」を含める。
事務所で実際に生じる問いの分布と異なるベンチマークだけで導入を決めない。

2 再現に必要な条件を凍結する

比較時には,①資料群とその版,②基準日,③検索方法,④最初の候補数,⑤再順位付け後の件数,⑥モデルの固定版,⑦指示文と判定基準,⑧試行回数,⑨正解表,⑩費用と所要時間を保存する。

TypeSafeの公式資料は,`jev-latest`等の別名が新しい版へ移ると回答が変わり得るため,閾値を調整した場合は固定版を指定し,応答に含まれるモデル版を記録するよう案内している。
同社の2026年9月22日時点のモデル資料ではJev 1.13が現行版であり,英語が主な学習言語で精度が最も高く,日本語を含むCJKは利用できるものの同等ではないため,自分のデータで試験する必要があるとされている。

3 モデルが知らない法的前提を試す

問いに書かれていない法的前提を,モデルの内部知識が正しく補うと仮定しない。
準用関係,定義規定,別表,改正履歴又は例外規定が判断に必要なら,必要部分を候補資料又は判定基準に明示する。

TypeSafeのJev 1.13に関する公式資料も,文字どおりの読取り,間接関係,無関係な情報を多く含む入力,数値及び日付の比較等を既知の弱点として挙げている。
該当する処理はコード又は人の確認へ分け,モデルには限定された意味判断だけを担当させる。

第6 確信度を正解保証として使わない

1 確信度と個別の正しさを分ける

候補に高い点数又は確信度が付いても,その1件が正しいことは保証されない。
TypeSafeの公式資料では,Choice及びScoreの確信度は選択肢の確率分布から計算され,行動の閾値は自分の用途,危険度及びデータで決めるよう説明されている。

構造化された値だけを返すことは,指定外の文字列を出さないための利点である。
しかし,誤った候補を正しい形式で返すことはあり得るため,形式適合性と実質的正確性を別々に試験する。

2 不明と人の確認への経路を置く

自動採用と自動除外だけでなく,「要確認」「資料不足」「判断不能」を設ける。
正解資料を落としたときの影響が大きい調査では,確信度が低い候補だけでなく,重要な法的結論を左右する候補を確信度にかかわらず人が確認する。

確信度の較正,自動振分けの閾値及び期限に関わる分類を人が見る理由は,AIが示す「確信度」はどこまで信じてよいか―較正の意味,自動振分けの閾値及び期限が絡む分類を人が見る理由(AI作成)で整理している。

第7 法律事務所での導入手順

法律事務所で小規模に試す場合は,次の順序が考えられる。
①対象業務を「税務法令の候補抽出」「相手方引用判例の同定」等の一つに限定する。
②秘密情報を含まない既存の完了案件又は公開資料から問題と正解表を作る。
③従来の検索で最初の候補集合を作り,検索段階の候補保持率を測る。
④再順位付け後の候補保持率,人の確認件数及び最悪回を測る。
⑤回答作成モデルに確認済み資料だけを渡し,原典との不一致を記録する。
⑥モデル版,指示文,閾値又は資料群を変えたときに再試験する。
⑦本番では,原典確認者,確認結果,未確認事項及び採否理由を調査台帳に残す。

依頼者情報又は事件資料を外部サービスへ送ることの可否は,モデルの分類能力とは別問題である。
入力先,保存,学習利用,委託先,国外移転,削除及び契約条件を確認し,送信権限が確認できない資料は評価用であっても入力しない。

NISTのAI Risk Management Framework及びPlaybookは,AIシステムの目的,利用状況,限界及び評価条件を定め,試験,評価,検証及び妥当性確認を継続するための任意の枠組みを提供している。
経済産業省のAI事業者ガイドライン第1.2版も,AIの開発,提供及び利用に関するリスク管理を検討する際の一般的な参照資料である。
いずれも,特定の法律調査サービスについて正確性又は適法性を認定したものではない。

第8 既存記事との関係

候補を作る前に採用条件,除外条件,必須事項及び候補数を決める方法並びに中断後の再開記録は,AIを使うほど仕事が増える理由-法律実務で使う生成前フィルタと中断後の再開カード(AI作成)で説明している。

共通規律,案件文脈,個別作業指示,権限及び完了条件の分け方は,法律事務所のAIエージェント業務設計-目的・コンテキスト・権限・完了条件をどう分けるか(AI作成)で整理している。

裁判所提出書面の起案と独立査読を分け,引用を原文で照合する方法は,山中弁護士がClaudeコードを使って裁判所提出書面を作成するときに行っているハルシネーション防止方法(AIリライト)を参照されたい。

第9 出典・参考資料

souzou_office氏のX投稿(税務法令の再順位付けに関する投稿者実験。データ及び結果は本記事で独立再現していない。)
29meat_ai氏のX投稿(Jevの利用例に関する論点発見資料)
K_AI_Work氏のX投稿(Jevの利用例に関する論点発見資料)
TypeSafe「Re-ranking」(CLERCデータセットを用いた提供者の公式クックブック)
TypeSafe「Confidence」
TypeSafe「Models」
TypeSafe「Jev 1.13 jaggedness」
NIST「Artificial Intelligence Risk Management Framework (AI RMF 1.0)」
NIST「AI RMF Playbook」
経済産業省「AI事業者ガイドライン(第1.2版)」