第1 この記事が扱う対象第2 なぜ防止の仕組みが必要か1 2023年当時の汎用モデルでは高率の誤りが報告された2 判例データベースに接続しても誤りは残る3 架空の判例引用が制裁に至った事例第3 当ブログにおける防止方法1 生成段階――記憶から書かせない2 裁判例の確認――記載する前に実在と内容を確かめる3 引用・出典段階――読者が検証できる形で示す4 公開前検証段階――執筆と検証を同じ工程に混ぜない5 事後の検証と再発防止6 作業体制の設計上の工夫7 日本語整文と法的検証を別工程にする8 事実から評価・予測へ移るときの確認第4 弁護士業務に関する指針との関係1 弁護士会が示している考え方2 これらの指針と当ブログの方法との対応第5 残された課題出典・参考資料1 法令・会規2 裁判例3 文献4 ウェブ資料第1 この記事が扱う対象
当ブログには,生成AIを用いて作成し,又は既存の記事を生成AIに書き直させた記事が多数掲載されており,これらの記事にはタイトル末尾に「(AI作成)」と付記している。生成AIは,事実に基づかない誤った情報を,もっともらしい文章の形で出力することがあり,この現象は一般に「ハルシネーション」と呼ばれる。本記事は,当ブログがこうした記事を投稿するに当たって実際に行っている誤り防止の方法を,工程ごとに説明するものである。あわせて,その前提として,生成AIの誤りがどの程度の頻度で生じるかを示す実証研究,架空の判例引用が裁判所の制裁に至った事例及び弁護士会が示す指針を,公表されている一次資料に基づいて整理する。本記事も生成AIを用いて作成し,記載した数値及び条文は原資料と照合した。なお,訴状,準備書面その他の裁判所へ提出する書面については,本記事で述べる方法とは別に,より重い確認の手順を置いており,その内容は別記事(山中弁護士がClaudeコードを使って裁判所提出書面を作成するときに行っているハルシネーション防止方法(AI作成))で説明している。
第2 なぜ防止の仕組みが必要か1 2023年当時の汎用モデルでは高率の誤りが報告された
米国スタンフォード大学の研究チームが2023年当時の主要な汎用大規模言語モデルに約80万件規模の法律質問を投げかけた実証研究では,ハルシネーション率がGPT-4で58%,GPT-3.5で69%,PaLM 2で72%,Llama 2で88%に達し,いずれのモデルも自らの誤りを予測できず,利用者が示した誤った法的前提をそのまま受け入れる傾向も確認された。この研究は査読を経て法学専門誌に掲載されている。
2 判例データベースに接続しても誤りは残る
同じ研究チームが2024年に公表し2025年に査読誌へ掲載した別の実証研究では,判例データベースに接続した検索拡張型(いわゆるRAG)の商用リーガルAIツール3種類に202件の法律質問を投げかけたところ,ハルシネーション率は17%から33%にとどまり,最も正答率が高いLexisNexis社のLexis+ AIでも65%であった。判例データベースへの接続は誤りを減らす方向に働くものの,これを根絶するものではない。したがって,利用者の側で確認の工程を設ける必要がある。
3 架空の判例引用が制裁に至った事例
生成AIが生成した架空の判例が法廷に提出され,裁判所の制裁に至った事例として最もよく知られているのが,米国ニューヨーク州南部地区連邦地方裁判所のMata v. Avianca, Inc.事件(事件番号22-cv-1461)である。2023年,原告代理人が却下申立てに対する意見書において,ChatGPTが生成した6件の完全に架空の判決(実在の裁判官の名を用いて作出されたものを含む)を引用して裁判所に提出した。同年6月22日,担当のP. Kevin Castel判事は連邦民事訴訟規則11条違反を認定し,代理人及びその所属事務所に5,000ドルの制裁金を科すとともに,架空判決に名前を使われた各裁判官への訂正書簡の送付を命じた。裁判所又は審判機関が生成AIの幻覚的な内容への依拠を認定した事案を継続的に集計しているデータベースによれば,この種の事案は令和8年8月6日現在で合計1,846件に達しており,米国が全体の約7割を占める。
第3 当ブログにおける防止方法
当ブログにおける誤り防止は,単一のルールによるものではなく,生成,引用及び出典の明記,公開前の検証,事後の再発防止並びに作業体制の設計という複数の段階にわたる一連の仕組みとして組み立てている。以下,工程ごとに説明する。
1 生成段階――記憶から書かせない
生成AIに法令の条文を書かせる場面では,AIの記憶や学習データからの書き起こしをそのまま採用せず,e-Gov法令検索から取得した公式データの条文本文のみを用いることとしている。生成AIは,条文の内容自体はおおむね正しくても,条番号や項番号を実際とは異なる形でもっともらしく生成することがあるため,条番号,項番号及び号番号を一件ずつ照合する。
もっとも,公式データを取得しさえすれば足りるというものではない。当ブログの運用では,次の限界を実際に経験するたびに記録し,個別の代替手段を整えてきた。すなわち,①改正前の条文(旧法や経過措置が関わる場面)は現行条文の取得だけでは対応できないこと,②法令名を正確に特定できないと類似する別の法令に誤って行き着き得ること,③条文本文の一部が取得の過程で欠落することがあること,④最高裁判所規則のように公式の法令データベースに収録されていない法令があること,⑤附則や別表のように条文番号の体系の外にある部分は同じ方法では取得できないことである。④については,裁判所ウェブサイトが公開している規則の公式PDFを確認する方法によっている。本記事で後記の民事訴訟規則85条を引用するに当たっても,この方法により条文本文と見出しを確認した。
条文を根拠に「〜が必要である」「〜はできない」と断定する文を書く場面では,取得した条文本文について,ただし書やかっこ書の有無,これが結論を反転させないか,原則を許容した上で例外を定める規定なのか要件を課す規定なのか,及び引用しようとする内容が本当にその項に含まれるかを確認することとしている。条文の本文だけを読んで結論を組み立てると,ただし書によって結論が逆転する場面で必ず誤るためである。
2 裁判例の確認――記載する前に実在と内容を確かめる
裁判例については,出力に書く前に必ず裁判所ウェブサイトの裁判例検索で実在及び内容を確認することとしている。確認の対象は,裁判所名,裁判年月日及び事件番号が一致する裁判例が実際に掲載されているかという点だけでなく,記事に書こうとする判旨や規範が判決の本文によって裏付けられるかという点にも及ぶ。特に,ある裁判例の判示が限定的な場面について述べたものであるにもかかわらず,これをより広い一般命題の根拠として引用していないかという射程の照合を行う。
裁判所ウェブサイトに掲載されていない裁判例については,判例秘書等の商業データベースで個別に全文を確認できたものに限り引用可能とし,個別に確認していない裁判例は,実務書その他の文献に紹介されていても,孫引きによっては引用しない。文献が紹介する裁判例は,上告審の有無,裁判年月日又は結論を誤っていることがあり,実際に,ある実務書の紹介に基づいて記録した内容を裁判所ウェブサイトで検証したところ,紹介されていた上告審が実在しないことが判明した例がある。また,裁判所ウェブサイトで発見できないことは,その裁判例が存在しないことの証明にはならないため,「存在しない」ではなく「裁判所ウェブサイト未掲載」と書き分けている。下級審の裁判例は,最高裁判例と比較して掲載率が必ずしも高くないためである。
裁判例の確認記録は,①未検索,②検索実施,③件数のみ確認,④一覧又は事件ヘッダー確認,⑤全文確認,⑥判旨確認及び⑦記事中の命題との直接関連性確認という状態に分ける。
検索を実施した場合は,検索日,データベース,検索欄,検索語,結果件数及び事件IDを残す。
一覧に表示されたことと判決本文を読んだこと,本文を読んだことと当該命題を直接裏付ける判示があることを同一視しない。
限定検索で該当例を発見できなかった場合も,「存在しない」ではなく,検索範囲を示して「確認できなかった」と記載する。
法令,会規,裁判例,行政資料及びデータベースの確認状態を分けて記録する方法は,法律事務所の生成AI利用ガイドラインの作り方-許可サービス,入力情報,出力確認,委託先及び事故対応(AI作成)でも整理している。
さらに,確認箇所について,記載した主体と裁判所による採否を記録する。
原文に存在する文でも,当事者の主張,争いのない事実,裁判所の認定・判断及びデータベースの編集者による要旨を混同すれば,法的な裏付けの確認にはならない。
具体例として,知財高裁令和6年9月12日判決(令和6年(行コ)第10005号)の裁判所公開原文5頁にはGeminiを根拠とする施行時期の記載があるが,これは控訴人の主張であり,裁判所は6頁でその施行期日・経過措置の主張を採用していない。
今回,同事件の判例秘書L07920481の本文と裁判所公開原文を照合した。原審本文との独立照合はしておらず,控訴審の上記箇所を確認した範囲に限る。
生成AIの精度一般又は弁護士の注意義務を判断した先例として紹介しない。
3 引用・出典段階――読者が検証できる形で示す
出典は本文に明記することとしている。インターネット上で第三者が確認できる根拠(裁判所ウェブサイトや弁護士会の会報等)は,URLを本文に記載する。これに対し,ログインを要する商業データベースで確認した根拠は,第三者が同じURLを開くことができない以上,URLを掲載せず,実際に確認した書誌情報及び頁を記載することとし,確認していない頁を推測で書くことはしない。法令,裁判例及び文献は,散文の中に埋め込まず箇条書きで示す。
引用の完全一致と,要約の内容の正確さも別に確かめる。
令和8年の日本語判決予測・情報抽出研究は,gpt-oss-120bを用いた特定設定で,抽出出力の約半数が判決原文に完全一致せず,書換えを禁じる指示でも大きく減らなかったと報告している(4.4節・注7)。
この数字を生成AI一般の誤答率とは扱わないが,逐語引用と表示する文は原文と照合し,要約文は要約と明示して,記載主体,採否及び起案中の命題との対応を確認する。
この確認方法と研究の限界は,日本語判決予測AIの実務上の注意点でも説明している。
資料の内容が正確であることと,その資料を取得・外部送信・公開できることは別に確認する。
有料の書籍又は会員制データベースでは,指定された閲覧・コピー・印刷・ダウンロードの範囲,外部AIに送る情報と送信先,原文を引用又は転載する権限を工程ごとに点検する。
出典の表示や学習オフ設定だけで,資料提供者からの利用許諾を得たことにはならない。
弁護士ドットコムLIBRARYについては,利用規約第4条,第13条及び第14条の一般的な利用制限と,第20条のサービス内AIが生成する短文の利用制限を分ける必要がある。
同サービスのAIアシスタントによる短文を公開原稿へ転用しない。
外部AI処理について許諾が未確認の状態で利用する方針を採る場合も,それを許諾済みと表示せず,対象範囲,送信先,目的及び確認状況を記録する。
具体的な工程の分け方は,有料の法律・税務資料を生成AIで分析するときの利用権限で整理している。
4 公開前検証段階――執筆と検証を同じ工程に混ぜない
記事を対外公開する前には,独立した確認の工程を設けている。本文中の全ての引用及び全ての法令条文並びに用いない旨を定めている表現を機械的に照合し,一件でも確認できない事項又は違反があれば公開を止める仕組みであり,記事を執筆する工程とは別の機会に行うこととしている。
この工程を分けているのは,文章を書いている最中は,その文章の流れに乗って未確認の引用をそのまま書き進めてしまう危険があり,執筆の作業と確認の作業を同じ工程に置くと,この危険を防ぎにくいという経験によるものである。実際,過去に公開した記事において,検索結果に表示された裁判例の識別番号を照合しないまま本文のリンクに用い,公開後の検証によって当該番号が全く別の事件を指していたことが判明した例がある。執筆の後に検証するのでは,誤った引用が本文に組み込まれた状態のまま公開まで通ってしまう。
官公庁の統計資料を用いる記事では,この工程で数値も原資料と照合する。法務省の司法試験の受験状況のように表の形をしたPDFは,文字を順に取り出すと項目と数字の対応が崩れることがあり,取得ツールが正常なPDFを「破損している」と答えることもある。そのため,PDFを保存して文字の座標から行を組み直し,頁の画像と突き合わせ,内訳の合計が合計欄と一致するかを検算することとしている。具体例は,AIエージェントで法務省の司法試験ページを読むときの障壁―403拒否,二重のリンク,PDFの表の崩れ及び確認手順で紹介している。
さらに,公開前の検証では,引用及び数値が原資料と一致するかだけでなく,最終的な執筆者が,①記事の中心命題とそれを直接支える一次資料,②最も重要な例外,反対資料又は未確認事項,③どの資料又は前提が変われば記事の結論を改める必要があるか,の三点を自分の言葉で説明できるかを確認する。説明できない場合は,機械的な検査を通過していても公開を保留する。
この理解確認は,引用確認の代わりではなく,その後の法改正,資料の訂正又は読者からの指摘に対応するための別工程である。詳しくは,AIが難問を解いても人間の思考過程を残す理由-形式検証,独立査読,若手育成及び法律実務への示唆(AI作成)で整理している。
5 事後の検証と再発防止
誤りが生じた場合には,その失敗の型を個別に記録し,同じ型の誤りが繰り返されたときには,対応を一段強めることとしている。これまでに記録された型としては,前記の識別番号を未照合のまま用いる誤りのほか,条文が削除されたという結論を裏付けの確認なしに述べてしまい,実際には存在する条文を存在しないものとして扱ってしまう誤りがある。ある条文が改正によって削除された場合であっても,その条番号が空いたままになるとは限らず,同じ番号に全く別の内容の条文が置かれていることがあるためである。この型の誤りは,条文を引用していないという理由で確認の対象から外れやすい一方,読者が現行法令を引けば直ちに露見する点で危険が大きい。
記録した失敗の型は,作業のたびにAIに読ませる手順書として用いるため,古い記載が残ると,道具の仕様が変わった後も不要な回避策を指示し続けることになる。そこで,記録には日付と適用範囲(どの作業で,どの環境で起きたか)を付け,同じ事実を重ねて書かず,新しい実測で改めたときは旧記載にその旨を残すこととしている。失敗の記録の作り方と保守の方法は,AIの仕事の評価基準を育てる手順―失敗の言語化,理想の成果物,落とし穴メモ及び評価を作り込む業務の選び方(AI作成)で整理している。
6 作業体制の設計上の工夫
このほか,生成AIに特有の傾向を踏まえた工夫も講じている。生成AIは利用者の意に沿う回答を優先する傾向があるとされることから,AI自身が作成した文章を,別の者が作成した草案であるかのように扱わせて添削させる,根拠が弱い点を挙げさせるといった方法により,この傾向を相殺することとしている。
また,条文や裁判例という動かない事実の層は機械的に確認する一方,そこからどのような評価や見立てを導くかという層は,性質上,同じようには確認できないものと位置づけている。この区別に基づき,AIが示した独自の見立てをそのまま署名記事に用いることはせず,弁護士本人が採否を判断したものに限って公開版へ反映することとしている。事実の層について求められる慎重さが評価の層にまで無自覚に及ぶと,正確ではあるが当たり障りのない記事に倒れるため,両者を意識的に書き分けている。なお,個別の事案への当てはめを留保する趣旨の定型的な断り書きは用いず,個別の論点ごとに「当該事案では」等の限定的な表現を用いて,確信の程度を書き分けることとしている。
モデル,プラン,コネクタ,利用規約又は実行環境を変更するときは,モデル名の置換だけで済ませない。
新しいモデルは,既存の指示ファイル,スキル及び長期記録に対する反応が変わり得るため,対象範囲,優先順位,停止条件,外部への保存・送信・公開権限及び完了判定が矛盾していないかを監査する。
OpenAIのGPT-6 Astra向け公式ガイドも,同モデルはスキル及びAGENTS.md等の指示に影響されやすいとして,参照可能な指示ファイルの監査を推奨している。
ただし,これは製品の挙動に関する提供者の説明であり,日本法の条文又は裁判例の引用精度を保証する一次資料ではない。
モデル変更の可否は,代表的な法律業務の人工事例を用い,一次資料への到達,条文・裁判例・URLの一致,対象外変更の有無,外部書込み前の権限確認及び保存後の読戻しを比較して判断する。
平均点が高くても,重大な一項目の誤りが成果物全体を不適切にし得るため,必須条件については一件でも欠落すれば不合格とする。
同じAIによる再点検の限界と停止条件
AI自身が作成した文章を別人の草案として批判させる方法は,弱点候補を増やすためには有用である。しかし,作成時の誤った前提,欠落資料又は評価基準の偏りを同じAI及び同じ会話が共有するため,独立した検証とは扱わない。重要な命題は,一次資料,別系統の評価又は弁護士本人の確認へ戻す。
また,反復回数,費用上限,無改善で止める回数及び重大な誤りが一件でも生じたときの停止条件を開始前に定める。平均点又は文章の自然さが改善しても,存在しない裁判例,引用命題と原文の不一致又は適用時点の誤りを相殺しない。代理指標,独立確認及び人への返却条件の詳しい整理は,「AIの改善ループが失敗する条件-代理指標,仕様ゲーミング,遅れて分かる成果及び人が決める停止条件(AI作成)」を参照されたい。
7 日本語整文と法的検証を別工程にする
文章が自然であることと,法律内容が正確であることは別の合格条件である。
そのため,記事の構成及び根拠を固める工程と,日本語表現を整える工程を分け,整文を行うモデルには,事実,数字,日付,固有名詞,引用,URL,法的評価及び出典の位置付けを追加,削除又は変更させないこととしている。
整文前には,一次資料から採用する命題とその根拠を対応させた主張台帳を作り,整文後は元原稿及び主張台帳との意味の差分を確認する。
機械的な文章検査で警告が0件になった場合でも,意味の変化,条件の脱落又は新しい断定の混入がないとは限らないため,警告0件だけでは公開可能と判断しない。
モデルを選ぶ場合は,同一の公開資料又は人工事例を用いて複数回実行し,重大な事実誤り,引用誤り又は必須条件の欠落が1件でもあれば不合格とした上で,人による修正時間,再実行回数,費用,最悪の結果及び出力のばらつきを比較する。
生成速度が速いことと,検証及び修正を含む総作業時間が短いことも区別する。
Xへの投稿では,Gemini 3.8 Flashが投稿者の500本を超える日本語検査規則を警告0件で通過し,推敲時間が減ったとの使用結果が報告されている。
もっとも,検査規則,入力原稿,プロンプト,全出力及び反復結果は公開されていないため,これは有用な使用報告ではあるが,同モデルの日本語文章能力が一般的に優れていることを確認する資料ではない。
Googleのモデル仕様によれば,Gemini 3.8 Flashは安定版として提供されているが,モデルカードは基盤モデルに一般的な限界としてハルシネーションが生じ得ることを明記している。
また,Harvey's Legal Agent Benchmarkの評価結果では,同モデルの個別基準合格率は90.2パーセントであるのに対し,全基準を満たしたタスク完遂率は10.0パーセントである。この評価は日本法又は日本語文章に特化したものではないが,法律関係の成果物では平均的な合格率だけでなく,全ての必須条件を満たすかを確認する必要があることを示す例となる。
さらに,Anthropicが令和8年9月に公表したClaude Fable 5.1及びClaude Mythos 5.1のSystem Cardでは,Legal Agent Benchmarkの1,235問について,Fable 5.1の平均criterion-pass rateは90.81%である一方,all-pass rateは19.09%であった。held-out setでも,xhigh effortにおいてcriterion-pass rateは93.3%,all-pass rateは16.7%であった。もっとも,同評価は合成資料及びLLMによる判定を含み,日本法,裁判所ウェブサイト,e-Gov法令検索又は判例秘書を用いる当ブログの作業を直接評価したものではない。したがって,これらの数値は日本の法律実務にそのまま移すのではなく,大半の確認項目が正しくても,重大な一項目の欠落が成果物全体を不適切にし得ることを示す資料として用いる。
異なる試験の順位や全項目合格率を日本の法律事務所でどう扱うかについては,法務AIのベンチマーク順位を日本の法律事務所でどう読むか―Gemini 4 Argon,Harveyの全項目合格率及び判例秘書を使う評価方法(AI作成)で整理した。
8 事実から評価・予測へ移るときの確認
出典が実在し,引用が正確であっても,そこから導いた評価又は予測まで裏付けられるとは限らない。
この点を確認するための追加項目として,記載を①原資料で確認した事実,②資料の作成者又は発言者が述べた内容,③記事作成者の推論・評価,④将来の予測に分け,それぞれの前提と確認方法を明示することが有用である。
これは本記事で補う検証上の提案であり,従前の全記事でこの分類が一律に実施済みであると説明するものではない。
(続きを読む...)山中弁護士がAI作成又はAIリライトの記事を投稿するときに行っているハルシネーション防止方法(AI作成)