メインコンテンツへスキップ
       

山中弁護士がAI作成又はAIリライトの記事を投稿するときに行っているハルシネーション防止方法(AI作成)

第1 この記事が扱う対象

当ブログには,生成AIを用いて作成し,又は既存の記事を生成AIに書き直させた記事が多数掲載されており,これらの記事にはタイトル末尾に「(AI作成)」と付記している。生成AIは,事実に基づかない誤った情報を,もっともらしい文章の形で出力することがあり,この現象は一般に「ハルシネーション」と呼ばれる。本記事は,当ブログがこうした記事を投稿するに当たって実際に行っている誤り防止の方法を,工程ごとに説明するものである。あわせて,その前提として,生成AIの誤りがどの程度の頻度で生じるかを示す実証研究,架空の判例引用が裁判所の制裁に至った事例及び弁護士会が示す指針を,公表されている一次資料に基づいて整理する。本記事も生成AIを用いて作成し,記載した数値及び条文は原資料と照合した。なお,訴状,準備書面その他の裁判所へ提出する書面については,本記事で述べる方法とは別に,より重い確認の手順を置いており,その内容は別記事(山中弁護士がClaudeコードを使って裁判所提出書面を作成するときに行っているハルシネーション防止方法(AI作成))で説明している。

第2 なぜ防止の仕組みが必要か

1 2023年当時の汎用モデルでは高率の誤りが報告された

米国スタンフォード大学の研究チームが2023年当時の主要な汎用大規模言語モデルに約80万件規模の法律質問を投げかけた実証研究では,ハルシネーション率がGPT-4で58%,GPT-3.5で69%,PaLM 2で72%,Llama 2で88%に達し,いずれのモデルも自らの誤りを予測できず,利用者が示した誤った法的前提をそのまま受け入れる傾向も確認された。この研究は査読を経て法学専門誌に掲載されている。

2 判例データベースに接続しても誤りは残る

同じ研究チームが2024年に公表し2025年に査読誌へ掲載した別の実証研究では,判例データベースに接続した検索拡張型(いわゆるRAG)の商用リーガルAIツール3種類に202件の法律質問を投げかけたところ,ハルシネーション率は17%から33%にとどまり,最も正答率が高いLexisNexis社のLexis+ AIでも65%であった。判例データベースへの接続は誤りを減らす方向に働くものの,これを根絶するものではない。したがって,利用者の側で確認の工程を設ける必要がある。

3 架空の判例引用が制裁に至った事例

生成AIが生成した架空の判例が法廷に提出され,裁判所の制裁に至った事例として最もよく知られているのが,米国ニューヨーク州南部地区連邦地方裁判所のMata v. Avianca, Inc.事件(事件番号22-cv-1461)である。2023年,原告代理人が却下申立てに対する意見書において,ChatGPTが生成した6件の完全に架空の判決(実在の裁判官の名を用いて作出されたものを含む)を引用して裁判所に提出した。同年6月22日,担当のP. Kevin Castel判事は連邦民事訴訟規則11条違反を認定し,代理人及びその所属事務所に5,000ドルの制裁金を科すとともに,架空判決に名前を使われた各裁判官への訂正書簡の送付を命じた。裁判所又は審判機関が生成AIの幻覚的な内容への依拠を認定した事案を継続的に集計しているデータベースによれば,この種の事案は令和8年8月6日現在で合計1,846件に達しており,米国が全体の約7割を占める。

第3 当ブログにおける防止方法

当ブログにおける誤り防止は,単一のルールによるものではなく,生成,引用及び出典の明記,公開前の検証,事後の再発防止並びに作業体制の設計という複数の段階にわたる一連の仕組みとして組み立てている。以下,工程ごとに説明する。

1 生成段階――記憶から書かせない

生成AIに法令の条文を書かせる場面では,AIの記憶や学習データからの書き起こしをそのまま採用せず,e-Gov法令検索から取得した公式データの条文本文のみを用いることとしている。生成AIは,条文の内容自体はおおむね正しくても,条番号や項番号を実際とは異なる形でもっともらしく生成することがあるため,条番号,項番号及び号番号を一件ずつ照合する。

もっとも,公式データを取得しさえすれば足りるというものではない。当ブログの運用では,次の限界を実際に経験するたびに記録し,個別の代替手段を整えてきた。すなわち,①改正前の条文(旧法や経過措置が関わる場面)は現行条文の取得だけでは対応できないこと,②法令名を正確に特定できないと類似する別の法令に誤って行き着き得ること,③条文本文の一部が取得の過程で欠落することがあること,④最高裁判所規則のように公式の法令データベースに収録されていない法令があること,⑤附則や別表のように条文番号の体系の外にある部分は同じ方法では取得できないことである。④については,裁判所ウェブサイトが公開している規則の公式PDFを確認する方法によっている。本記事で後記の民事訴訟規則85条を引用するに当たっても,この方法により条文本文と見出しを確認した。

条文を根拠に「〜が必要である」「〜はできない」と断定する文を書く場面では,取得した条文本文について,ただし書やかっこ書の有無,これが結論を反転させないか,原則を許容した上で例外を定める規定なのか要件を課す規定なのか,及び引用しようとする内容が本当にその項に含まれるかを確認することとしている。条文の本文だけを読んで結論を組み立てると,ただし書によって結論が逆転する場面で必ず誤るためである。

2 裁判例の確認――記載する前に実在と内容を確かめる

裁判例については,出力に書く前に必ず裁判所ウェブサイトの裁判例検索で実在及び内容を確認することとしている。確認の対象は,裁判所名,裁判年月日及び事件番号が一致する裁判例が実際に掲載されているかという点だけでなく,記事に書こうとする判旨や規範が判決の本文によって裏付けられるかという点にも及ぶ。特に,ある裁判例の判示が限定的な場面について述べたものであるにもかかわらず,これをより広い一般命題の根拠として引用していないかという射程の照合を行う。

裁判所ウェブサイトに掲載されていない裁判例については,判例秘書等の商業データベースで個別に全文を確認できたものに限り引用可能とし,個別に確認していない裁判例は,実務書その他の文献に紹介されていても,孫引きによっては引用しない。文献が紹介する裁判例は,上告審の有無,裁判年月日又は結論を誤っていることがあり,実際に,ある実務書の紹介に基づいて記録した内容を裁判所ウェブサイトで検証したところ,紹介されていた上告審が実在しないことが判明した例がある。また,裁判所ウェブサイトで発見できないことは,その裁判例が存在しないことの証明にはならないため,「存在しない」ではなく「裁判所ウェブサイト未掲載」と書き分けている。下級審の裁判例は,最高裁判例と比較して掲載率が必ずしも高くないためである。

裁判例の確認記録は,①未検索,②検索実施,③件数のみ確認,④一覧又は事件ヘッダー確認,⑤全文確認,⑥判旨確認及び⑦記事中の命題との直接関連性確認という状態に分ける。
検索を実施した場合は,検索日,データベース,検索欄,検索語,結果件数及び事件IDを残す。
一覧に表示されたことと判決本文を読んだこと,本文を読んだことと当該命題を直接裏付ける判示があることを同一視しない。
限定検索で該当例を発見できなかった場合も,「存在しない」ではなく,検索範囲を示して「確認できなかった」と記載する。

法令,会規,裁判例,行政資料及びデータベースの確認状態を分けて記録する方法は,法律事務所の生成AI利用ガイドラインの作り方-許可サービス,入力情報,出力確認,委託先及び事故対応(AI作成)でも整理している。

さらに,確認箇所について,記載した主体と裁判所による採否を記録する。
原文に存在する文でも,当事者の主張,争いのない事実,裁判所の認定・判断及びデータベースの編集者による要旨を混同すれば,法的な裏付けの確認にはならない。
具体例として,知財高裁令和6年9月12日判決(令和6年(行コ)第10005号)の裁判所公開原文5頁にはGeminiを根拠とする施行時期の記載があるが,これは控訴人の主張であり,裁判所は6頁でその施行期日・経過措置の主張を採用していない。
今回,同事件の判例秘書L07920481の本文と裁判所公開原文を照合した。原審本文との独立照合はしておらず,控訴審の上記箇所を確認した範囲に限る。
生成AIの精度一般又は弁護士の注意義務を判断した先例として紹介しない。

3 引用・出典段階――読者が検証できる形で示す

出典は本文に明記することとしている。インターネット上で第三者が確認できる根拠(裁判所ウェブサイトや弁護士会の会報等)は,URLを本文に記載する。これに対し,ログインを要する商業データベースで確認した根拠は,第三者が同じURLを開くことができない以上,URLを掲載せず,実際に確認した書誌情報及び頁を記載することとし,確認していない頁を推測で書くことはしない。法令,裁判例及び文献は,散文の中に埋め込まず箇条書きで示す。

引用の完全一致と,要約の内容の正確さも別に確かめる。
令和8年の日本語判決予測・情報抽出研究は,gpt-oss-120bを用いた特定設定で,抽出出力の約半数が判決原文に完全一致せず,書換えを禁じる指示でも大きく減らなかったと報告している(4.4節・注7)。
この数字を生成AI一般の誤答率とは扱わないが,逐語引用と表示する文は原文と照合し,要約文は要約と明示して,記載主体,採否及び起案中の命題との対応を確認する。
この確認方法と研究の限界は,日本語判決予測AIの実務上の注意点でも説明している。

資料の内容が正確であることと,その資料を取得・外部送信・公開できることは別に確認する。
有料の書籍又は会員制データベースでは,指定された閲覧・コピー・印刷・ダウンロードの範囲,外部AIに送る情報と送信先,原文を引用又は転載する権限を工程ごとに点検する。
出典の表示や学習オフ設定だけで,資料提供者からの利用許諾を得たことにはならない。

弁護士ドットコムLIBRARYについては,利用規約第4条,第13条及び第14条の一般的な利用制限と,第20条のサービス内AIが生成する短文の利用制限を分ける必要がある。
同サービスのAIアシスタントによる短文を公開原稿へ転用しない。
外部AI処理について許諾が未確認の状態で利用する方針を採る場合も,それを許諾済みと表示せず,対象範囲,送信先,目的及び確認状況を記録する。
具体的な工程の分け方は,有料の法律・税務資料を生成AIで分析するときの利用権限で整理している。

4 公開前検証段階――執筆と検証を同じ工程に混ぜない

記事を対外公開する前には,独立した確認の工程を設けている。本文中の全ての引用及び全ての法令条文並びに用いない旨を定めている表現を機械的に照合し,一件でも確認できない事項又は違反があれば公開を止める仕組みであり,記事を執筆する工程とは別の機会に行うこととしている。

この工程を分けているのは,文章を書いている最中は,その文章の流れに乗って未確認の引用をそのまま書き進めてしまう危険があり,執筆の作業と確認の作業を同じ工程に置くと,この危険を防ぎにくいという経験によるものである。実際,過去に公開した記事において,検索結果に表示された裁判例の識別番号を照合しないまま本文のリンクに用い,公開後の検証によって当該番号が全く別の事件を指していたことが判明した例がある。執筆の後に検証するのでは,誤った引用が本文に組み込まれた状態のまま公開まで通ってしまう。

官公庁の統計資料を用いる記事では,この工程で数値も原資料と照合する。法務省の司法試験の受験状況のように表の形をしたPDFは,文字を順に取り出すと項目と数字の対応が崩れることがあり,取得ツールが正常なPDFを「破損している」と答えることもある。そのため,PDFを保存して文字の座標から行を組み直し,頁の画像と突き合わせ,内訳の合計が合計欄と一致するかを検算することとしている。具体例は,AIエージェントで法務省の司法試験ページを読むときの障壁―403拒否,二重のリンク,PDFの表の崩れ及び確認手順で紹介している。

さらに,公開前の検証では,引用及び数値が原資料と一致するかだけでなく,最終的な執筆者が,①記事の中心命題とそれを直接支える一次資料,②最も重要な例外,反対資料又は未確認事項,③どの資料又は前提が変われば記事の結論を改める必要があるか,の三点を自分の言葉で説明できるかを確認する。説明できない場合は,機械的な検査を通過していても公開を保留する。

この理解確認は,引用確認の代わりではなく,その後の法改正,資料の訂正又は読者からの指摘に対応するための別工程である。詳しくは,AIが難問を解いても人間の思考過程を残す理由-形式検証,独立査読,若手育成及び法律実務への示唆(AI作成)で整理している。

5 事後の検証と再発防止

誤りが生じた場合には,その失敗の型を個別に記録し,同じ型の誤りが繰り返されたときには,対応を一段強めることとしている。これまでに記録された型としては,前記の識別番号を未照合のまま用いる誤りのほか,条文が削除されたという結論を裏付けの確認なしに述べてしまい,実際には存在する条文を存在しないものとして扱ってしまう誤りがある。ある条文が改正によって削除された場合であっても,その条番号が空いたままになるとは限らず,同じ番号に全く別の内容の条文が置かれていることがあるためである。この型の誤りは,条文を引用していないという理由で確認の対象から外れやすい一方,読者が現行法令を引けば直ちに露見する点で危険が大きい。

記録した失敗の型は,作業のたびにAIに読ませる手順書として用いるため,古い記載が残ると,道具の仕様が変わった後も不要な回避策を指示し続けることになる。そこで,記録には日付と適用範囲(どの作業で,どの環境で起きたか)を付け,同じ事実を重ねて書かず,新しい実測で改めたときは旧記載にその旨を残すこととしている。失敗の記録の作り方と保守の方法は,AIの仕事の評価基準を育てる手順―失敗の言語化,理想の成果物,落とし穴メモ及び評価を作り込む業務の選び方(AI作成)で整理している。

6 作業体制の設計上の工夫

このほか,生成AIに特有の傾向を踏まえた工夫も講じている。生成AIは利用者の意に沿う回答を優先する傾向があるとされることから,AI自身が作成した文章を,別の者が作成した草案であるかのように扱わせて添削させる,根拠が弱い点を挙げさせるといった方法により,この傾向を相殺することとしている。

また,条文や裁判例という動かない事実の層は機械的に確認する一方,そこからどのような評価や見立てを導くかという層は,性質上,同じようには確認できないものと位置づけている。この区別に基づき,AIが示した独自の見立てをそのまま署名記事に用いることはせず,弁護士本人が採否を判断したものに限って公開版へ反映することとしている。事実の層について求められる慎重さが評価の層にまで無自覚に及ぶと,正確ではあるが当たり障りのない記事に倒れるため,両者を意識的に書き分けている。なお,個別の事案への当てはめを留保する趣旨の定型的な断り書きは用いず,個別の論点ごとに「当該事案では」等の限定的な表現を用いて,確信の程度を書き分けることとしている。

モデル,プラン,コネクタ,利用規約又は実行環境を変更するときは,モデル名の置換だけで済ませない。
新しいモデルは,既存の指示ファイル,スキル及び長期記録に対する反応が変わり得るため,対象範囲,優先順位,停止条件,外部への保存・送信・公開権限及び完了判定が矛盾していないかを監査する。
OpenAIのGPT-6 Astra向け公式ガイドも,同モデルはスキル及びAGENTS.md等の指示に影響されやすいとして,参照可能な指示ファイルの監査を推奨している。
ただし,これは製品の挙動に関する提供者の説明であり,日本法の条文又は裁判例の引用精度を保証する一次資料ではない。

モデル変更の可否は,代表的な法律業務の人工事例を用い,一次資料への到達,条文・裁判例・URLの一致,対象外変更の有無,外部書込み前の権限確認及び保存後の読戻しを比較して判断する。
平均点が高くても,重大な一項目の誤りが成果物全体を不適切にし得るため,必須条件については一件でも欠落すれば不合格とする。

同じAIによる再点検の限界と停止条件
AI自身が作成した文章を別人の草案として批判させる方法は,弱点候補を増やすためには有用である。しかし,作成時の誤った前提,欠落資料又は評価基準の偏りを同じAI及び同じ会話が共有するため,独立した検証とは扱わない。重要な命題は,一次資料,別系統の評価又は弁護士本人の確認へ戻す。

また,反復回数,費用上限,無改善で止める回数及び重大な誤りが一件でも生じたときの停止条件を開始前に定める。平均点又は文章の自然さが改善しても,存在しない裁判例,引用命題と原文の不一致又は適用時点の誤りを相殺しない。代理指標,独立確認及び人への返却条件の詳しい整理は,「AIの改善ループが失敗する条件-代理指標,仕様ゲーミング,遅れて分かる成果及び人が決める停止条件(AI作成)」を参照されたい。

7 日本語整文と法的検証を別工程にする

文章が自然であることと,法律内容が正確であることは別の合格条件である。
そのため,記事の構成及び根拠を固める工程と,日本語表現を整える工程を分け,整文を行うモデルには,事実,数字,日付,固有名詞,引用,URL,法的評価及び出典の位置付けを追加,削除又は変更させないこととしている。

整文前には,一次資料から採用する命題とその根拠を対応させた主張台帳を作り,整文後は元原稿及び主張台帳との意味の差分を確認する。
機械的な文章検査で警告が0件になった場合でも,意味の変化,条件の脱落又は新しい断定の混入がないとは限らないため,警告0件だけでは公開可能と判断しない。

モデルを選ぶ場合は,同一の公開資料又は人工事例を用いて複数回実行し,重大な事実誤り,引用誤り又は必須条件の欠落が1件でもあれば不合格とした上で,人による修正時間,再実行回数,費用,最悪の結果及び出力のばらつきを比較する。
生成速度が速いことと,検証及び修正を含む総作業時間が短いことも区別する。

Xへの投稿では,Gemini 3.8 Flashが投稿者の500本を超える日本語検査規則を警告0件で通過し,推敲時間が減ったとの使用結果が報告されている。
もっとも,検査規則,入力原稿,プロンプト,全出力及び反復結果は公開されていないため,これは有用な使用報告ではあるが,同モデルの日本語文章能力が一般的に優れていることを確認する資料ではない。

Googleのモデル仕様によれば,Gemini 3.8 Flashは安定版として提供されているが,モデルカードは基盤モデルに一般的な限界としてハルシネーションが生じ得ることを明記している。
また,Harvey’s Legal Agent Benchmarkの評価結果では,同モデルの個別基準合格率は90.2パーセントであるのに対し,全基準を満たしたタスク完遂率は10.0パーセントである。この評価は日本法又は日本語文章に特化したものではないが,法律関係の成果物では平均的な合格率だけでなく,全ての必須条件を満たすかを確認する必要があることを示す例となる。

さらに,Anthropicが令和8年9月に公表したClaude Fable 5.1及びClaude Mythos 5.1のSystem Cardでは,Legal Agent Benchmarkの1,235問について,Fable 5.1の平均criterion-pass rateは90.81%である一方,all-pass rateは19.09%であった。held-out setでも,xhigh effortにおいてcriterion-pass rateは93.3%,all-pass rateは16.7%であった。もっとも,同評価は合成資料及びLLMによる判定を含み,日本法,裁判所ウェブサイト,e-Gov法令検索又は判例秘書を用いる当ブログの作業を直接評価したものではない。したがって,これらの数値は日本の法律実務にそのまま移すのではなく,大半の確認項目が正しくても,重大な一項目の欠落が成果物全体を不適切にし得ることを示す資料として用いる。

異なる試験の順位や全項目合格率を日本の法律事務所でどう扱うかについては,法務AIのベンチマーク順位を日本の法律事務所でどう読むか―Gemini 4 Argon,Harveyの全項目合格率及び判例秘書を使う評価方法(AI作成)で整理した。

8 事実から評価・予測へ移るときの確認

出典が実在し,引用が正確であっても,そこから導いた評価又は予測まで裏付けられるとは限らない。
この点を確認するための追加項目として,記載を①原資料で確認した事実,②資料の作成者又は発言者が述べた内容,③記事作成者の推論・評価,④将来の予測に分け,それぞれの前提と確認方法を明示することが有用である。
これは本記事で補う検証上の提案であり,従前の全記事でこの分類が一律に実施済みであると説明するものではない。

例えば,民間の賞を受賞したことと,弁護士会又は法曹界全体が正式に評価したことは別である。
不開示の範囲が変わったことと,決定者が特定の請求者を警戒したことも別であり,裁判官の経歴から個別事件での判断・訴訟指揮を確定することはできない。
評価を述べる場合には,確認できる対象,発言者,場面及び資料の範囲を超えていないかを点検する。

アクセスが「20〜30%減る」,ある反応の可能性が「極めて高い」等の表現では,分母,対象,期間,観測値又は推定方法を確認する。
推定に必要な資料がない場合は,数値や確率を作らず,起こり得る複数の経過と,それぞれを判断するために必要な観測を示す。
将来予測が外れたことだけで直ちにハルシネーションと決まるわけではないが,未観測の予測を既成事実として記載したり,裏付けのない数値を実測値のように示したりすることは避けなければならない。

時点の管理も必要である。
過去の状況を論じるときは,サービスの開始日,機能の追加日,資料の公表日及び取得日を分け,現在の機能や後日公表された資料を,過去にも存在した根拠として使わない。
相手の発言を紹介する場合も,「そう述べていること」の確認と,「述べた事実が独立に確認できたこと」を区別する。

AI作成・AI要約という表示は,これらの確認を省略する理由にはならない。
本文を修正した場合には,要約,題名及び検索用説明文にも旧来の断定が残っていないかを照合する必要がある。
第三者による記事利用を検討するときの事実・権利・流入分析の区別は,自サイトの記事・データを他サイトに利用されたとき―著作権,出典表示,流入減少の立証と初動対応(AI作成)で具体化している。

第4 弁護士業務に関する指針との関係

1 弁護士会が示している考え方

東京弁護士会は,2025年3月27日に「弁護士業務における生成AIサービスの適正利用ガイドライン」を施行している。同会の会報に掲載された特集記事によれば,このガイドラインは,出力結果を業務に用いる場合には一次資料の確認を含む検証を行うことを推奨している。もっとも,同ガイドラインは,生成AIの適正利用を促進するための推奨事項であって,遵守を義務付けるものではなく,綱紀及び懲戒の直接の基準とされるものでもないとされており,その内容が秘密保持義務(弁護士職務基本規程第23条等),信用(同規程第6条)及び法令等の調査義務(同規程第37条)等と関係するものとして位置づけられている。出力内容の適切性について弁護士が原則として最終的な責任を負うという点は,同ガイドラインの内容としてではなく,弁護士の誠実義務及び専門家責任の観点から,同特集記事の執筆者の見解として述べられているものである。同特集記事に掲載された注意点の一覧表も,出力内容の検証という項目において,架空判例,誤引用及び誤った制度説明等のハルシネーションが生じる可能性を踏まえ,一次資料その他の信頼できる資料により確認すべきことを挙げている。

日本弁護士連合会のAI戦略ワーキンググループも,2025年9月,「弁護士業務における生成AIの利活用等に関する注意事項」を取りまとめ,2026年2月に更新版を公表している。同注意事項は,会員限りの資料とされ,会員外への交付等を控えるべきものとされているため,本記事ではその内容を引用しない。なお,同注意事項は,日本弁護士連合会としての公式な見解を示すものではなく,綱紀・懲戒の直接の基準とされることも想定していないものとされている。

2 これらの指針と当ブログの方法との対応

前記第3で述べた方法は,弁護士会が示す考え方のうち,出力内容を検証した上で専門職として独立した判断を行うという部分を,記事の作成という場面において具体的な工程に落としたものと整理することができる。当ブログの記事は訴訟における主張立証とは異なるが,条文及び裁判例を根拠として示す点では共通しており,誤った条文又は架空の裁判例を掲げた場合に生じる不利益も同様である。

根拠となる規律としては,次のものが挙げられる。

  • 弁護士職務基本規程第37条(法令等の調査)第1項は,「弁護士は,事件の処理に当たり,必要な法令の調査を怠ってはならない。」と定め,同条第2項は,「弁護士は,事件の処理に当たり,必要かつ可能な事実関係の調査を行うように努める。」と定める。
  • 同規程第7条(研鑽)は,「弁護士は,教養を深め,法令及び法律事務に精通するため,研鑽に努める。」と定める。
  • 同規程第6条(名誉と信用)は,「弁護士は,名誉を重んじ,信用を維持するとともに,廉潔を保持し,常に品位を高めるように努める。」と定める。
  • 民事訴訟規則第85条(調査の義務)は,「当事者は,主張及び立証を尽くすため,あらかじめ,証人その他の証拠について事実関係を詳細に調査しなければならない。」と定める。

これらの規律は,いずれも生成AIの利用を直接の対象とするものではないが,生成AIが出力した条文や裁判例をそのまま用いる行為が,調査を怠ったものと評価される場面があり得ることを示している。当ブログが,記事の作成という場面においてまで確認の工程を設けているのは,この理解に基づく。

第5 残された課題

前記の実証研究が示すとおり,判例データベースへの接続は誤りを減らすとしてもこれを根絶するものではなく,本記事で述べた方法も,人が定めた手順を実行するものである以上,実行の漏れが生じ得る。手順を定めていること自体が正確性を保証するわけではないため,公開後に誤りが判明した場合の記録と手順の見直しを継続する必要がある。生成AIの技術動向及び各弁護士会の指針は今後も変化し得るため,資料ごとの確認日又は公表日を出典欄で区別する。モデル評価に関する追記は,令和8年10月1日までに確認した公表資料に基づく。

以上の検証工程を,作業時間ではなく一次資料の確認,事実評価,説明可能性及び意思決定支援という専門価値の観点から整理したものとして,AI時代に弁護士の価値は「作業時間」からどこへ移るか―一次資料,事実評価,戦略判断及び意思決定支援(AI作成)がある。

出典・参考資料

1 法令・会規

①弁護士職務基本規程(平成16年11月10日会規第70号)第6条・第7条・第23条・第37条(日本弁護士連合会)
②民事訴訟規則(平成8年最高裁判所規則第5号)第85条(裁判所ウェブサイト)
③連邦民事訴訟規則(Federal Rules of Civil Procedure)第11条(コーネル大学ロースクール法情報研究所)

2 裁判例

①Mata v. Avianca, Inc., 678 F.Supp.3d 443(米国ニューヨーク州南部地区連邦地方裁判所,2023年6月22日,事件番号22-cv-1461(PKC),判決文(カリフォルニア大学バークレー校ロースクール))

3 文献

①M. Dahl, V. Magesh, M. Suzgun & D. E. Ho, “Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models,” Journal of Legal Analysis, Vol.16 No.1(2024年)64頁~93頁(Oxford Academic)
②V. Magesh, F. Surani, M. Dahl, M. Suzgun, C. D. Manning & D. E. Ho, “Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools,” Journal of Empirical Legal Studies(2025年)1頁~27頁(スタンフォード大学)
③特集「弁護士業務における生成AIの利活用と留意点」LIBRA Vol.26 No.7-8(2026年7-8月号)2頁~18頁のうち,有本真由「弁護士業務における生成AI活用上の主な注意点」14頁~18頁(東京弁護士会)
④日本弁護士連合会AI戦略ワーキンググループ「弁護士業務における生成AIの利活用等に関する注意事項」2026年(令和8年)2月更新版(会員限りの資料)

4 ウェブ資料

①AI Hallucination Cases Database(Damien Charlotin運営,令和8年8月6日最終更新分を確認)
②e-Gov法令検索(デジタル庁)
③裁判所ウェブサイト 裁判例検索(最高裁判所)
④Gemini 3.8 Flashによる日本語執筆の使用報告(令和8年9月6日確認)
⑤Google AI for Developers「Gemini 3.8 Flash」(令和8年9月2日更新)
⑥Google DeepMind「Gemini 3.8 Flash – Model Card」
⑦Vals AI「Harvey’s Legal Agent Benchmark」(令和8年9月4日更新)
⑧Anthropic「Claude Fable 5.1 & Claude Mythos 5.1 System Card」(令和8年9月。Legal Agent Benchmarkは81頁~84頁。基盤モデル提供者による評価資料)
⑨OpenAI「Model guidance」(GPT-6 Astraに関する提供者の公式説明。令和8年9月7日確認)

今回の追記の出典(令和8年10月4日確認):①知財高裁令和6年9月12日判決・令和6年(行コ)第10005号,裁判所公開原文5頁~6頁及び判例秘書L07920481(控訴人の主張と裁判所の判断の区別)。②門脇・狩野「Japanese Legal Judgment Prediction Using ModernBERT and Generative AI-based Information Extraction」,2026年3月3日公表,4.4節・注7(当該モデルと設定による抽出結果)。
①の判決で②の研究結果又はAI利用責任を裏付けたものではない。