第1 結論とこの記事の対象
日本語の判決を使ったAI研究は進んでいるが,研究上の正答率を相談者の勝訴確率へ置き換えることはできない。
判決から整理された事実・主張の分類,判決本文からの情報抽出,証拠が揃っていない相談段階での見通し判断は,別の作業だからである。
弁護士実務では,予測値を受任,提訴又は和解の決定へ直接結び付けるよりも,争点,不足資料,反対仮説及び確認すべき原典を整理する補助として使い,人が確認した範囲を明らかにする方が現実的である。
本記事は,令和8年10月4日までに原文を確認した日本語不法行為事件データセットの構築研究,これを用いた令和8年公表の判決予測・情報抽出研究及び配布元の利用条件を基に,弁護士の相談・起案・和解検討への示唆を整理する。
研究で報告された結果と,本記事が提案する運用方法を区別する。
特定の商用AI製品について日本法上の精度を測定した記事ではなく,研究モデルを独自に実行したものでもない。
第2 日本語不法行為事件データセットは何を測るものか
1 判決数,事例数及び主張数は異なる
令和6年公表の構築論文は,判例秘書から収集した民事第一審判決を使って,日本語不法行為事件データセットを構築したと報告している。
対象は名誉毀損,プライバシー侵害及び信用毀損を中心とする不法行為関連事件であり,判決書3,477件から,不法行為に関する7,978事例と,原告・被告の主張59,697件が整理された(1045頁~1046頁)。
一つの判決が複数の不法行為事例又は多数の主張を含み得るため,7,978事例を7,978件の独立した訴訟と読んではならない。
また,この事件選択から,交通事故,労働,家事,倒産その他の分野全般について性能が確認されたとはいえない。
注釈作業には法曹,法科大学院生及び法学部生が参加しており,全ての注釈を実務経験のある弁護士だけが作成したという説明も正確ではない。
2 不法行為の成否と主張の採否を予測する
構築論文の入力は,争いのない事実,原告側の主張及び被告側の主張である。
一つの課題は不法行為が成立するかを二つの区分で予測するものであり,もう一つの課題は,与えられた各主張を裁判所が採用したかを予測するものである(1046頁・図1)。
後者の「根拠抽出」は,この課題では既に整理された主張の採否を分類する意味であり,未整理の判決全文から引用文を正確に抜き出す作業と同一ではない。
不法行為の成否を予測できても,請求額の全額認容,一部認容,損害額,費用,期間,控訴審の結果又は判決後の回収可能性まで測ったことにはならない。
相談者が「勝つ」と考える利益が,金銭の回収,記事の削除,謝罪,又は将来の行為の停止のどれであるかも,別に確認する必要がある。
3 正答率0.683は個別事件の勝訴確率ではない
構築論文の表4は,特定のモデルによる不法行為成否の予測について,正答率0.683,標準偏差0.020を報告する。
異なる乱数設定で5回実験した成績の平均であり,標準偏差はその実験間のばらつきを表す(1048頁)。
同論文は,判決書で事前学習したモデルについて,その事前学習用判決とデータセット構築用判決の間に重複がある点にも注意を促している。
したがって,この数字を「日本の民事訴訟で68.3%の確率で正しく勝敗を予測できる」と一般化したり,相談者へ「あなたの勝訴確率は68.3%である」と伝えたりすることはできない。
試験集合での正答率と,一件の事件について示す予測確率は別であり,後者が実際の頻度と対応するかも検証を要する。
令和6年の特定モデルの結果を,現在の汎用生成AI又は商用法務AIの性能として紹介することも避けるべきである。
第3 令和8年の研究から分かる抽出と評価の限界
1 原文を渡しても逐語抽出とは限らない
令和8年公表の研究論文は,整理済みの事実・主張を使う判決予測と,判決全文から裁判所の判断,争いのない事実,原告・被告の主張を抽出する課題を分けて検討している。
gpt-oss-120bを用いた同論文の設定での情報抽出では,出力の約半数について,判決原文内に完全一致する文字列がなかったと報告する。
書換えを禁止する指示を置いても,この不一致は大きく減らなかったという(4.4節・注7)。
この結果は,当該モデル・設定・資料での報告であり,生成AI全般の誤答率が50%であるという意味ではない。
しかし,原文を入力し「そのまま引用」と指示したことだけを逐語引用の確認に代えることはできない,という実務上の注意につながる。
2 引用一致,記載主体及び法的な裏付けを分ける
本記事では,判決を使う作業を,①抽出した文が原文に存在するか,②当事者の主張,争いのない事実,裁判所の認定・判断又は編集者の要旨のどれか,③その箇所が起案中の法的命題を支えるか,の三段階で確認することを提案する。
原文に実在する一文であっても,当事者が述べたにすぎない内容を裁判所の判示として引用すれば,法律調査としては誤りになる。
AIが作った要約は,逐語引用と表示上も区別する。
具体例として,知財高裁令和6年9月12日判決(令和6年(行コ)第10005号)の裁判所公開原文5頁には,Geminiを根拠とする法律の施行時期についての記載がある。
これは控訴人の主張であり,裁判所は6頁で,施行期日や経過措置に関するその主張を採用していない。
同判決は生成AIの精度一般又は弁護士によるAI利用の注意義務を判断した先例ではない。
本記事の作成では,同事件の判例秘書収録本文(L07920481)と裁判所公開原文を照合した。
原審判決から引用された部分について原審本文との独立照合はしておらず,上記の例は控訴審本文で確認した範囲に限る。
3 関連事例を分けただけでは未見の事件での評価にならない
令和8年の研究は,同じ判決に由来し,事実関係を共有する事例を無作為に分けると,関連例が学習側と評価側の双方へ入り,成績を高く見せる可能性を指摘する(3.4節・注6)。
また,分割方法や採点指標によってモデルの評価が変わり得ることを示している(5.2節~5.3節)。
事務所の評価では,同じ事件の原審・上訴審,同じ紛争から作った複数の模擬問題,結論だけを変えた類似問題を,一群として管理することを提案する。
プロンプトの調整に使った事件群と,最終評価の事件群を分け,正答率だけでなく,重大な誤引用,反対資料の欠落及び人へ戻す条件の違反も記録する。
これは実務向けの評価設計案であり,論文がそのまま同じ事務所運用を実証したものではない。
第4 相談・起案・和解検討ではどう使うか
1 相談時の資料と判決から整理された入力を区別する
研究用入力には,判決を読んだ作業者が整理した事実と双方の主張が含まれる。
これに対して初回相談では,相手方の主張,証拠の真偽,時系列,損害の裏付け又は管轄の前提がまだ分からないことが多い。
相談者の説明だけを完成した事実関係として入力すると,もっともらしい予測を得ても,不足情報による誤りを見えなくするおそれがある。
まず担当弁護士が,確認済みの事実,依頼者の説明,争いのある事実及び未確認事項を分ける。
その上でAIには,結論の確定よりも,確認すべき資料,相手方から予想される反論,法的構成の候補及び見通しを変える事情を列挙させる方法が考えられる。
取得できなかった相手方資料を推測で補わせず,不足のまま表示する。
2 受任・提訴・和解を予測値だけで決めない
受任や提訴の判断では,期限,利益相反,主張立証の見通し,費用,依頼者の目的及び対応能力を弁護士が確認する。
AIの予測値が低いという理由だけで,法的構成の再検討や追加資料の取得を省く運用は避けるべきである。
期限が近い事件,権利放棄を伴う和解,先例変更を求める事件又は生命・身体・住居に関わる事件では,予測値の高低にかかわらず人による個別判断へ戻すことを提案する。
和解案は,予測勝率だけでなく,認容額の見通し,立証に必要な費用,回収可能性,解決までの時間,守秘条項,謝罪又は再発防止等を分けて比較する。
例えば,削除と金銭賠償を求める事件では,不法行為成否の予測があるだけで,削除範囲や解決金額まで適切に決まるわけではない。
未検証の予測値を掛け算して和解の「正解額」を作らない。
3 依頼者への説明例と採否記録
依頼者への説明では,例えば「この数字は一定の研究用問題での成績であり,あなたの事件の勝訴確率を測ったものではない。現在は相手方資料と損害の裏付けが不足しており,その取得後に見通しを検討する」と,数字の対象と不足資料を併せて伝える方法が考えられる。
類似事例の件数又は結果分布を示す場合も,採用・除外の基準,確認した判決本文及び事実の相違を説明する。
採否記録には,①依頼者が求める解決,②基準日と資料の版,③確認済みの事実・争い・不足資料,④AIの出力と使ったモデル・設定,⑤確認した条文・判決本文・証拠原本,⑥採用又は修正した理由,⑦追加資料によって再検討する条件を残す。
担当弁護士が,何を自ら確認し,何をまだ判断できないか説明できる状態にすることが目的である。
非公開の事件情報を一般公開のナレッジ又は他事件で共用する評価データへ移さない。
第5 判例秘書・研究用データの利用条件
1 論文が公開されていても判決データを業務利用できるとは限らない
GSKの配布ページは,日本語不法行為事件データセットを学術研究目的の利用に限定し,営利企業には配付しないと明示している。
README及び利用申請書兼誓約書では,元の判決文書と注釈データの条件が分かれている。
論文の公開ライセンスを,収録判決データの利用許諾へ置き換えない。
同誓約書の元文書に関する特記事項は,商業目的の利用に製品・システム・サービスの開発やその準備も含め,第三者公開,改変及び利用期間について条件を置く。
注釈データにも独自の学術目的等の条件があるため,元文書と同じ条件とも,無条件で自由に使えるものとも扱わない。
法律事務所の業務用AIの学習,検索参照又は性能評価に使いたい場合は,用途と提供先を具体化し,配布元・権利者の条件及び必要な個別許諾を確認する。
2 閲覧,外部AIへの投入及び再配布を分ける
判例秘書で判決を閲覧できること,その全文を外部AIへ送れること,事務所で共用する評価用データへ複製できること,第三者へ再配布できることは,それぞれ別の確認事項である。
今回,判例秘書の一般契約からこれらを一括して許す条件を確認したわけではない。
また,研究用データセット本体の取得,利用申請又は再実験は行っていない。
最初の試験は,利用条件を確認した公開原典と,秘密情報を含まない模擬事例を中心に設計する方法が考えられる。
公開情報であっても,第三者の権利,利用目的,データベースの契約条件及び外部AIの取扱条件の確認を省略しない。
第6 導入効果と残る検証事項
1 生成時間ではなく確認済み成果物までを測る
AIが数秒で予測や文章を返しても,引用の照合,事実の追加聴取,反対資料の調査及び弁護士の修正に時間を要するなら,業務全体が短縮したとは限らない。
同じ課題について,人だけで処理する場合とAIを補助に使う場合を,品質の必須条件を固定して比較することを提案する。
記録するのは,確認・修正を含む総時間,重大な誤り,見落とした資料,依頼者へ説明できる根拠及び人へ戻した件数である。
2 この記事から確定できないこと
今回読んだ研究は,整理済みの判決情報を用いる予測や特定設定での情報抽出を検討したものである。
日本の法律事務所の実案件で,受任判断や和解判断を改善した効果,依頼者の利益,費用・期間の削減又は先例変更を必要とする事件への影響を直接実証した資料としては扱わない。
現在の商用製品別の日本法精度と,未整理の相談資料から最終判断に至る全工程の性能は,別途の検証を要する。
一橋大学の法務AIに関する催事報告は本記事の調査の起点であるが,全講演の逐語記録ではない。
本記事で扱う各論文や数値が当日の講演資料と同一であったことは確認していない。
大学の紹介,研究者の実験報告,行政の説明及び裁判所の判断を,それぞれの確認範囲で用いる。
第7 関連記事
①AIの勝訴予測は訴訟を萎縮させるか―和解圧力・司法アクセス・新判例への影響
②法務AIのベンチマーク順位を日本の法律事務所でどう読むか
③法律事務所の生成AIをどう評価・改善するか
④AI作成又はAIリライトの記事のハルシネーション防止方法
⑤会社が社内向けの法務AIアシスタントを作るときの法的チェックリスト
第8 出典と確認した範囲
①山田寛章ほか「日本語不法行為事件データセットの構築」言語処理学会第30回年次大会発表論文集,2024年,1045頁~1050頁。本文,課題設計,表3・4及び事前学習データ重複の留意点を確認した。
②門脇・狩野「Japanese Legal Judgment Prediction Using ModernBERT and Generative AI-based Information Extraction」(日本語判決予測にModernBERTと生成AIによる情報抽出を用いる研究。本記事による題名の仮訳),The Review of Socionetwork Strategies,2026年3月3日公表。3.4節,4.1節~4.4節,5.2節~5.3節,6.1節~6.2節及び注記を確認した。
③言語資源協会「GSK2024-A 日本語不法行為事件データセット」,README,利用申請書兼誓約書。配布案内,データ構成,元文書と注釈データの利用条件を確認した。データセット本体は未取得である。
④知財高裁令和6年9月12日判決(令和6年(行コ)第10005号)。裁判所公開原文5頁~6頁と判例秘書L07920481の収録本文を照合した。研究論文の精度や一般的なAI利用責任を裏付ける判例としては用いていない。
⑤一橋大学HQウェブマガジン「AIは法務実務をどう変えるのか―生成AI・リーガルテックと法制度の現在地」,令和8年10月1日掲載。令和8年7月11日の催事を紹介する大学の報告本文を確認した。講演録画・スライドは未確認である。