メインコンテンツへスキップ
       

AIが参照しやすい司法情報アーカイブとしての山中弁護士ブログ―機械可読性と一次資料確認の限界(AI作成)

AI要約を見る

※以下はAIが生成した要約です。内容の正確性は保証されません。本文をあわせてご確認ください。

山中弁護士ブログは,裁判所人事,司法行政文書その他の公開資料を検索しやすく整理する索引及び構造化アーカイブとして役立つ。

もっとも,記事本文の転記,要約,評価又は一般化は原資料そのものではない。法的命題は,e-Gov法令検索,裁判所ウェブサイト,判例データベース,判例雑誌又は官公庁文書へ遡り,日付,版,頁,事件番号及び射程を確認する必要がある。

構造化データ,Markdown,llms.txt及びクローラー許可は,情報の発見又は解析を助け得るが,内容の正確性,ハルシネーションの防止,検索順位,AI回答への採用,契約成立又は引用義務を保証しない。

AIは資料探索,論点整理及び草案作成を担い,人が出典,適用時点及び事実関係を検証して採否と説明責任を負うべきである。

第1 本記事の目的

山中弁護士ブログは,裁判所,法務省その他の公的機関が公開した資料を収集し,本文のテキスト化,事項別の整理及び関連資料へのリンクを行っている。
このため,人が検索して利用しやすいだけでなく,検索エンジン又はAIエージェントが公開ページを取得し,回答作成時の参照資料として使う可能性がある。

もっとも,公開ページがクロールされたこと,検索インデックスに登録されたこと,モデルの学習データに含まれたこと,回答時に検索拡張生成で参照されたこと及び回答に出典として表示されたことは,それぞれ別の事実である。
本記事は,令和8年9月6日現在の公開仕様に基づき,これらを区別して整理するものである。

第2 AIがウェブサイトを利用する主な経路

1 クロール及び取得

クロールとは,自動化されたプログラムがURLへアクセスし,HTML,PDFその他の公開ファイルを取得することである。
検索エンジンの巡回,AI事業者のデータ収集及び利用者がURLを指定した場合の取得は,外形上は似ていても目的が異なることがある。

サーバーログに特定のUser-Agentが残っていれば,その名称を名乗るアクセスがあったことは確認できる。
しかし,User-Agentは偽装できるため,運営事業者が公開するIP範囲,署名又は認証方法がある場合には,それらも併せて確認する必要がある。

2 検索インデックス

検索エンジンは,取得したページを解析し,検索結果に表示するためのインデックスを作ることがある。
クロールを許可しても,必ずインデックスに登録されるわけではなく,上位表示又はAI回答での引用が保証されるわけでもない。

sitemap.xmlは,サイト運営者が重要なURLを検索エンジンへ知らせるための仕組みである。
これはURLの発見を助けるが,掲載順位又はAIによる評価を確定するものではない。

3 モデル学習

モデル学習では,大量の文章等を処理して,語又は概念の関係をモデルのパラメータに反映する。
公開ページへのアクセスを許可した事実だけでは,そのページが実際に特定の学習データセットに採用され,特定のモデル版の学習に使われたことまでは分からない。

学習の有無を確認するには,事業者によるデータセットの説明,個別開示,監査資料その他の追加証拠が必要である。
AIの回答が山中弁護士ブログと似ているという結果だけから,学習データへの収録を一義的に逆算することも困難である。

4 検索拡張生成及び利用者指定の取得

検索拡張生成は,回答時に検索結果又はデータベースから関連資料を取得し,その内容をモデルへ与えて回答を作る仕組みである。
この場合,基礎モデルの学習時に山中弁護士ブログが使われていなくても,回答時に当該ページが参照されることがある。

利用者が特定のURL又はファイルをAIへ渡した場合も,同様に回答時の文脈として利用され得る。
したがって,学習と回答時の参照を区別しなければならない。

5 回答及び出典表示

AIがページを参照しても,回答に必ずURL又は著者名を表示するとは限らない。
出典表示の有無及び形式は,サービスの仕様,回答モード,利用者の指示,検索結果及び生成時の判断に左右される。

サイト側のファイルに出典表示の希望を書いても,それだけで全てのAI事業者との契約が成立し,又は表示が技術的に強制されるわけではない。
実際の出典表示は,回答画面,遷移先URL及び日時を記録して確認する必要がある。

第3 山中弁護士ブログが提供する機械可読性

1 HTML,見出し及びリンク

意味に即した見出し,段落,表及びリンクは,人にも自動処理にも文書構造を伝えやすくする。
公的資料の名称,発出主体,日付及び原資料URLを明示することは,AIのためだけでなく,読者が一次資料へ戻って検証するために重要である。

しかし,文書構造が明確であることは,記載内容が正しいことの証明ではない。
AI又は検索サービスが誤って解釈し,古い情報を参照し,又は出典を取り違える可能性は残る。

2 構造化データ

schema.org等の構造化データは,記事,著者,公開日その他の属性を機械が識別する手掛かりとなる。
適切な構造化データはページの意味を伝えやすくするが,検索順位,AI回答への採用又は回答の正確性を保証しない。

構造化データは,画面に表示される本文と一致させる必要がある。
誤った氏名,日付又は記事種別を付与すれば,機械可読であっても誤情報を明瞭に伝える結果となる。

3 PDF及び本文テキスト

画像だけのPDFは,文字検索及び自動抽出が難しいことがある。
PDFに対応する本文テキスト,正確なファイル名,資料名,発出主体,日付及び原資料へのリンクを用意すれば,人と機械の双方が資料を特定しやすくなる。

もっとも,OCR又は転記には誤りが生じ得る。
重要な箇所はPDFの該当頁を画像として確認し,ブログの転記だけでなく原資料と照合する必要がある。

画像だけのPDFでなくても,表の形をしたPDFは,文字を順に取り出すと項目と数字の対応が崩れることがある。
例えば,法務省の令和8年司法試験の受験状況のPDFは文字データを持つが,文字を順に読むと,出願者の欄に採点対象者の人数を当てはめる誤りが生じる。
一次資料がAIに読みにくい形で公表されている場合には,原資料と照合した数値をブログの本文に転記しておくことが,人と機械の双方にとって資料を特定しやすくする方法の一つとなる。
法務省HPの具体例は,AIエージェントで法務省の司法試験ページを読むときの障壁―403拒否,二重のリンク,PDFの表の崩れ及び確認手順で紹介している。

4 Markdown版

Markdown版は,装飾及びナビゲーションを減らし,見出しと本文を比較的単純な形式で提供できる。
これにより取得後の解析が容易になる場合があるが,階層又は表が常に完全に理解されることを保証するものではない。

HTML版とMarkdown版の内容が異なれば,参照する版によって回答が変わり得る。
両者の更新時点,本文及びリンクを一致させる運用が重要である。

第4 llms.txt及びrobots.txtの役割

1 llms.txt

llms.txtは,AIエージェントがサイトの概要及び重要な資料へのリンクを見つけやすくするために置かれている。
提案元のllmstxt.orgも,llms.txtをウェブ標準として確立済みの強制規格ではなく,AIエージェントによるウェブ利用を助けるための提案として説明している。

llms.txtは,主として回答時に必要な情報を見つける案内として設計され,学習用ライセンス又は出典表示を強制する契約書ではない。
掲載したリンクが特定のAIに読まれ,学習され,又は回答で引用されることも保証しない。

なお,Googleは,Google検索の生成AI機能について,llms.txt,AI専用テキスト,特別なマークアップ又はMarkdownを使用せず,これらの有無はGoogle検索での表示又は順位を有利にも不利にもしないと説明している。llms.txtが他のAIサービス又は社内エージェントの案内として役立つ可能性と,Google検索がこれを利用するかは分けて考える必要がある。

2 robots.txt

robots.txtは,自動取得プログラムに対し,どの範囲の取得を認めないか等を伝える仕組みである。
協力的なクローラーは設定に従うことが期待されるが,アクセス制御又は認証そのものではない。

クローラーの名称及び用途は変更されることがある。
例えば,Googleは,Google-Extendedについて,独立したHTTPのUser-Agent文字列を持つクローラーではなく,既存のGoogleクローラーが取得したコンテンツを将来のGeminiモデルの学習又は回答時のグラウンディングに使うかを管理するためのrobots.txt上の製品トークンであると説明している。

また,Googleは,NotebookLMの利用者起動型取得に関するUser-Agentを令和8年7月16日にGoogle-NotebookLMからGoogle-GeminiNotebookへ変更し,旧名称も移行期間中は対応すると公表した。
固定した一覧表を掲載する場合には,事業者の最新仕様及びサーバーログを定期的に再確認する必要がある。

robots.txtによる取得拒否の効果については,robots.txtで生成AI学習・AI要約を拒否できるか――技術的効果と著作権法上の限界(AI作成)で詳しく整理している。

第5 情報の信頼性はどこで決まるか

1 ブログ記事と一次資料を区別すること

山中弁護士ブログには,公的機関の資料そのものを掲載又は転記した部分と,資料を整理,要約又は評価した部分がある。
ブログ全体を一括して「一次資料」又は「唯一の正解」と扱うことはできない。

AI又は人が記事を利用する場合,重要な法令はe-Gov法令検索,裁判例は裁判所ウェブサイト又は判例データベース,行政資料は発出機関の原資料へ戻って確認すべきである。
ブログの価値は,散在する資料を発見し,関係を理解し,原資料へ移動するための案内及び整理にある。

2 技術的安全性と内容の正確性を区別すること

マルウェア検査又は改ざん検知は,サイトの技術的な安全性を確認する手段である。
それだけで全記事の法的内容が正確であること,学習データに有害な情報がないこと,又はAIが信頼できる出典として採用することが証明されるわけではない。

同様に,表示速度の改善は読者及びクローラーがページを取得しやすくすることに役立ち得る。
しかし,PHPの版,PageSpeedの点数又は受賞歴から,検索順位,AI回答の引用率又はモデルの精度を直接推認することはできない。

3 確かめられる指標を分けること

AIによる利用を検証する場合には,次の事実を混同しないことが重要である。
①アクセスログ上の取得回数
②検索インデックスへの登録状況
③AI検索又はAI回答におけるURLの表示
④AI回答からブログへの実際の流入
⑤事業者が開示した学習データへの収録

①から④までは,ログ,検索結果,回答画面及びアクセス解析によって一定範囲で観察できる。
⑤は外部から直接確認できないことが多く,①から④だけで証明することはできない。

法律事務所の業務上の効果を確認する場合には,前記の技術的な指標に加え,⑥AI又は検索からのサイト訪問,⑦問い合わせ,⑧相談実施,⑨受任並びに⑩事件終了後の回収売上及び必要時間を分けて記録する必要がある。回答内にURLが表示されたことは,問い合わせ又は受任が生じたことの証明ではない。

Google Analyticsは,ChatGPT,Gemini,Claude等の認識されたAIアシスタントからの流入をAI Assistantチャネルへ分類する。他方,GoogleのAI Overviews及びAI Modeからの非広告流入はOrganic Searchに分類されるため,AI Assistantだけを見てもAI由来の流入全体は分からない。

第6 著作権法上の注意点

1 日本法

著作権法30条の4は,著作物に表現された思想又は感情の享受を目的としない利用について,一定の要件の下で著作物を利用できるものとしている。
もっとも,享受目的が併存する場合,必要限度を超える場合又は著作権者の利益を不当に害する場合には,同条の適用を慎重に検討する必要がある。

ブログを公開したこと又はクローラーを拒否しなかったことだけで,全ての学習,保管及び出力について包括的な利用許諾をしたことにはならない。
反対に,許諾がないという一事だけで,権利制限規定の適用が当然に否定されるわけでもない。

2 米国法

米国では,AI学習についてフェアユースを認めた連邦地裁判断がある一方,海賊版から取得したファイルの恒久的なライブラリ保管を学習とは別に評価した判断もある。
また,市場への影響,学習用ライセンス市場及び出力の類似性をどの範囲で考慮するかについて,米国政府,米国著作権局及び裁判所の見解は一致していない。

詳しくは,米国政府はAI学習を「合法」としたのか―OpenAI著作権訴訟と取得・学習・出力の違い(AI作成)で整理している。

第7 山中弁護士ブログをAIで利用する場合の確認方法

山中弁護士ブログの記事をAIによる調査又は回答に用いる場合には,次の順序で確認するのが望ましい。
①記事の公開日及び更新日を確認する。
②記事が引用する法令,裁判例,通達,統計その他の原資料を開く。
③原資料の該当頁又は条文と記事の記載を照合する。
④AIの回答には,可能な限り原資料とブログ記事の双方のURLを残す。
⑤裁判所ウェブサイトで見つからない裁判例については,不存在と断定せず,判例データベース及び掲載誌を追加確認する。
⑥AIの回答日時,利用したモデル及び参照URLを記録する。

この方法であれば,ブログの検索性及び整理を利用しつつ,原資料による検証可能性を確保できる。
山中弁護士ブログは,AIに「唯一の正解」を与えるものではなく,人とAIが原資料へ到達して検証するための法情報ナビゲーションとして利用するのが適切である。

第8 まとめ

ウェブサイトがAIに利用される過程には,取得,検索インデックス,モデル学習,回答時の検索拡張生成及び出典表示という異なる段階がある。
robots.txt,sitemap.xml,構造化データ,Markdown版及びllms.txtも,それぞれ目的と限界が異なる。

山中弁護士ブログの有用性は,公的資料を探しやすくし,本文を読みやすく整理し,関連資料と結び付けている点にある。
その有用性をAI時代にも維持するには,効果を断定的に宣伝することより,原資料へのリンク,更新日,資料の性質及び確認できない範囲を明示し続けることが重要である。

第9 関連記事

①法律事務所のLLMO・GEO対策-Google公式見解,効果測定,弁護士広告及び外注先管理(AI作成)
②法律事務所のGoogle口コミ対応-依頼,謝礼,返信,守秘,広告及び証拠保存(AI作成)

第10 出典

①Google「Googleの一般的なクローラー」
②Google「Googleのクロールに関するドキュメントの変更履歴」
③Google「サイトマップについて」
④Google「構造化データのマークアップの概要」
⑤llmstxt.org「The /llms.txt file, v2」
⑥e-Gov法令検索・著作権法30条の4
⑦文化審議会著作権分科会法制度小委員会「AIと著作権に関する考え方について」(令和6年3月15日)
⑧Google Search Central「AI features and your website」
⑨Google Analytics Help「What’s new in Google Analytics」
⑩Google Analytics Help「Default channel group」