メインコンテンツへスキップ
       

AIに主張案を複数書かせて選ぶとき―項目別の採点,弁護士が決める重み,書き手と別の採点役及び選び方が割れた案の確認(AI作成)

第1 本記事の対象と結論

1 扱う問い

生成AIに準備書面の主張,相手方への反論又は依頼者への説明の案を何本か書かせることは,既に珍しくない。本記事は,その次の工程である「書かせた案のうち,どれを採るか」をどう決めるかを扱う。基準日は令和8年10月1日である。

契機は,YouTubeチャンネル「海外Yパパラジオ 世界を読み解く」が令和8年9月25日に公開した動画「しゃべらない最新AI『Jev』はガチの議論に使えることが分かった」である。投稿者は,文章を書かずに判断だけを返すAI(Jev)を,AI同士のディベートで発言案を選ぶ係に置く実験を報告している。

2 結論の要旨

結論は次の4点である。

①案を書くAIと,案を選ぶ仕組みを分ける。書いたAI自身に全体の印象で選ばせると,自分の書きぶりに近い案へ寄る偏りが入り得る。<br>②選ぶときは,全体の印象ではなく,項目ごとの採点を重み付きで合計する。<br>③採点項目と重みは,書面の読み手と目的に応じて弁護士が決める。<br>④二つの選び方の結果が割れた案に,弁護士の確認時間を集中させ,採用した案の条文・裁判例は原典で確かめる。

他方,動画の実験は投稿者の自己申告で,第三者の再現はない。採点で選ぶことが,裁判で勝つ主張を選ぶことと同じだと考えてはならない。

第2 動画で報告された実験

1 実験の仕組み

以下は動画の説明(自動生成字幕による)であり,本記事で再現したものではない。

両陣営とも同じ生成AI(Claude)が発言する。各陣営は,発言の番が来るたびに候補を5本書く。違うのは5本から1本を選ぶ方法だけである。一方の陣営では,Jevが論理性,反論の的確さ,根拠の具体性及び説得力の4項目(投稿者の説明の要約)で各候補を採点し,合計が最も高い案を出す。他方の陣営では,候補を書いたClaude自身に同じ4項目を示して1本を選ばせる。最初の主張では,まだ相手の発言がないため,反論の項目を外して採点したという。

論題は,きのこの山とたけのこの里のどちらがよいかのように決着のつかないもの20本で,立場を入れ替えて2回ずつ,計40回行われた。各陣営の発言は,最初の主張,相手への反論及び最後のまとめの3回である。勝敗は,米国と中国のAI7体を審判とする多数決で決め,どちらがJevに選ばせた側かは審判に伏せたとされる。

2 報告された結果

投稿者の報告によれば,Jevに選ばせた側が27勝13敗であった。立場を入れ替えた2回の両方で勝った論題が8本,両方で負けた論題が1本で,審判7体のいずれもJev側に多く票を入れ,審判が付けた4項目の平均点もすべてJev側が上回った。

JevとClaudeが同じ案を選んだ割合は55%で,5本から無作為に選んだ場合の20%より高い。差がついたのは,選ぶ案が割れた残りの部分である。1回の選択に要した時間は,Jevが平均0.7秒,Claudeが呼出しを含めて5秒弱で,API料金に換算するとJevが約0.03円,Claudeが約1.7円であったという。

投稿者は,Jevが項目ごとに点を付けて足すため選び方がぶれないこと,Claudeは5本を読んで全体の印象で選び,しかも自分が書いた候補なので自分好みの案に引っ張られやすいことを,勝因の見立てとして挙げている。

3 結果をどう読むか

この結果には,少なくとも次の留保が付く。

①投稿者の自己申告であり,プロンプト,候補文及び採点の生データは公開されていない。<br>②40回という標本は小さく,統計的な検定も示されていない。<br>③審判もAIであり,審判のモデル名も字幕からは分からない。<br>④論題は遊びの題材で,事実と証拠に基づく法的な主張ではない。<br>⑤審判は,選ぶときと同じ4項目で採点している。

⑤は特に重要である。選ぶ物差しと勝敗を決める物差しが同じであれば,その物差しで選んだ側が勝ちやすいのは自然である。これは,測りやすい代理指標を高めることが本当の成果と一致するとは限らないという,AIの改善ループ一般の問題と同じ構造である(「AIの改善ループが失敗する条件-代理指標,仕様ゲーミング,遅れて分かる成果及び人が決める停止条件」)。

それでも,同じAIが書いた同じ候補から,選び方だけを変えて結果に差が出たという報告は,選ぶ工程の設計に意味があることを示す材料にはなる。

第3 なぜ項目別の採点が効き得るのか

1 書いたAIに選ばせると自分の案に寄り得る

生成AIを評価者に使う研究では,評価者のAIが自分の出力を高く採点する偏り(自己選好)が報告されている。Panickssery,Bowman及びFengの論文(arXiv:2404.13076,NeurIPS 2024)は,GPT-4等のモデルが自分の出力を他のモデルや人の文章と見分ける能力を一定程度持つこと,及び追加学習で見分ける能力を変えると,その強さと自己選好の強さとの間に線形の相関が見られることを報告している。

もっとも,Zhengらの論文(arXiv:2306.05685,NeurIPS 2023)は,GPT-4が自分に約10%,Claude-v1が自分に約25%高い勝率を付けた例を示しつつ,データが限られ差も小さいため,自己強化の偏りの有無は断定できないとしている。同論文は,回答の提示順に左右される偏りや,長い回答を好む偏りも挙げている。

したがって,「書いたAIに選ばせると必ず偏る」とまではいえない。しかし,偏りが入り得る以上,選ぶ工程を書き手と分けておく方が安全である。

2 項目に分けて測り,足す

人の評価でも,全体の印象で決めるより,項目を決めて採点する方が結果をよく予測することが知られている。Sackettらの論文(Journal of Applied Psychology,doi:10.1037/apl0000994)は,人事選考手法の妥当性を見直し,構造化面接の平均妥当性を0.42,非構造化面接を0.19と推計し,構造化面接を選考手法の首位としている。

Jevを提供するTypeSafe AIの公式ドキュメントも,複雑な判断を独立した項目に分けて別々に採点し,重みは利用者のプログラム側で持って合計する使い方(Composite scoring)を示している。重みが手元にあるため,合計点がどう作られたかを確認でき,順位が期待と合わなければ重みを調整できる,というのがその理由である。

3 判定専用AIの位置付け

Jevは,令和8年9月15日に早期アクセスとして公開された,文章を書かないAIである。回答の型は,選択肢から選ぶもの,順序のある段階で採点するもの及びYes/Noの確率を返すものの3つで,回答は利用者が定めた選択肢・段階の中に収まる。入力はテキストだけで,画像・音声は扱えない。料金は入力100万トークン当たり0.042ドルで,出力には課金されない(いずれも公式ドキュメント)。

公式ドキュメントは,段階の説明について「程度ではなく状況を書く」ことを勧め,答えの分かっている例で回答を確かめるよう求めている。確信度が高いことは,段階の説明が良いことを示さないとも述べている。また,英語が主な学習言語であり,日本語等は扱えるが同じ精度ではないとしている。

Jevの仕組みと確信度の意味は,「AIが示す「確信度」はどこまで信じてよいか―較正の意味,自動振分けの閾値及び期限が絡む分類を人が見る理由」で整理している。

第4 法律実務で使う手順

1 読み手と目的を決める

最初に,その書面を誰が読み,何を決めてもらうためのものかを決める。裁判所に提出する準備書面,相手方代理人との交渉書面及び依頼者への説明文では,重く見るべき点が違う。

2 採点項目と段階を作る

採点項目は,文章の印象ではなく,その書面が果たすべき役割から作る。裁判所に出す主張であれば,例えば次のような項目が考えられる。

項目段階の書き方の例(最上位)重く見る場面
要件事実との対応主張する法律効果の要件ごとに,対応する具体的事実を示している訴状・準備書面
証拠との対応各事実に,提出済み又は提出予定の証拠の番号と頁を付けている争点整理の後半
相手方主張への応答相手方の主張を要件ごとに特定し,認否と反論を一つずつ示している反論書面
条文・裁判例の正確さ引用した条文・裁判例が原典と一致し,射程の違いを説明している法律論が争点の事件
表現の節度相手方・関係者への評価が事実と証拠の範囲にとどまっている感情的対立のある事件

段階は「よくできている」「やや不十分」のような程度の言葉ではなく,「相手方の主張の一つ一つに応答している」「一部の主張に応答していない」のように,状況で書く。

3 重みを弁護士が決める

項目ごとの重みは,事件の段階,裁判所の関心及び相手方の主張に応じて弁護士が決める。全項目を同じ重みで足すことも一つの選択であり,その選択自体が判断である。

4 候補を書かせる

同じ指示で,構成の違う案を何本か書かせる。書かせる段階では,条文・裁判例を記憶から書かせず,事件記録と確認済みの資料の範囲で書かせる。

5 書き手と別の仕組みで採点し,合計する

項目ごとの採点は,候補を書いたAIとは別の仕組み(別のモデル,判定専用AI又は人)で行い,重みを掛けて合計する。提示順に左右される偏りを避けるため,候補の順序を入れ替えて採点することも考えられる。

6 選び方が割れた案を弁護士が読む

書いたAIの選択と,項目別採点の合計が同じ案を指すときは,どちらで選んでも結果は変わらない。差が出るのは選択が割れたときであるから,弁護士の確認時間はそこに集中させる。合計点が僅差の案も同じ扱いにする。

7 採用する案を原典で確かめる

採用した案に出てくる条文と裁判例は,原典で確かめる。弁護士職務基本規程37条1項は,「弁護士は、事件の処理に当たり、必要な法令の調査を怠ってはならない。」と定める。AIの採点が高いことは,この調査の代わりにならない。

8 採否と理由を記録し,項目と重みを見直す

どの案をなぜ採ったか,採点と弁護士の判断がどこで食い違ったかを記録する。食い違いが続く項目は,段階の書き方か重みを見直す。評価用の記録の残し方は,「法律事務所の生成AIをどう評価・改善するか―トレース,評価データセット,回帰試験,一次資料確認及び守秘義務」で整理している。

第5 注意点

1 採点が高い案と裁判で通る案は別である

裁判所は,要件事実と証拠に基づいて判断する。AIの審判に好まれる文章を目標にすると,採点項目そのものが目的になり,本来の目的からずれる。採点項目を,要件事実・証拠・相手方主張への応答から作るのはそのためである。

2 事件の事実を外部AIへ送るときの守秘義務

弁護士職務基本規程23条は,「弁護士は、正当な理由なく、依頼者について職務上知り得た秘密を他に漏らし、又は利用してはならない。」と定める。候補の作成と採点に別々のAIサービスを使えば,事件の事実を送る先も増える。

TypeSafe AIの顧客契約(Master Customer Agreement,令和8年9月23日更新版)は,顧客データをモデルの学習に同意なく使わないとする一方,4.1条で顧客データからテレメトリを作るための利用を期間の限定なく認め,4.3条で,技術ログ,ハッシュ,要約統計,分類結果等のテレメトリを同社が制限なく処理できると定める。「学習に使わない」ことと,入力から作られる派生データを使わないことは別である(「「学習に使わない」と書いてあっても―AIサービス規約の派生データ条項(ログ・分類結果・利用統計・フィードバック)の読み方と弁護士の守秘義務」)。

当職は,現時点では,依頼者の事件の事実をJevへ送る用途は控えるべきであると考える。公開情報だけを扱う用途(例えば,公開済みの裁判例の分類)で試すことは考えられる。外部サービスを使う前の確認項目は,「法律事務所が生成AIのDPAを確認するときのチェックリスト-学習不使用,保持期間,ZDR,再委託,国外処理及びコネクタ」を参照されたい。

3 日本語の法律文書での精度は未検証である

動画の論題は日本語の遊びの題材であり,日本語の法律文書をJevが項目別に正しく採点できるかは確かめられていない。提供者自身が日本語の精度は英語と同等でないとしているため,使うなら,答えの分かっている例(過去の自分の書面と,その採否)で先に試す。

4 点数と確率は1件ごとの正しさを保証しない

採点や確率は,多数の判断をならしたときの傾向であり,1件ごとの正しさを約束するものではない。合計点が最も高い案をそのまま採用せず,最後の採否と責任は弁護士が持つ。弁護士職務基本規程5条は,弁護士が真実を尊重し,信義に従い,誠実かつ公正に職務を行うものとすると定めており,AIの採点を理由にこの判断を省くことはできない。

5 回数を増やせばよいわけではない

投稿者は,以前はAI同士に何百回もディベートさせて最後に最良の筋を選んでいたが,費用と時間がかかり,どれが本当に良いかも分からないという問題があったと述べている。項目別の採点で各回の選択を安く速くすれば,少ない回数で良い筋に近づける可能性はある。ただし,それを確かめるのは採点項目が事件の目的と合っているときに限られる。

第6 本記事の確認状況

動画の内容は,自動生成字幕と概要欄で確認した。画面の図表は確認していない。実験の設計と結果は投稿者の自己申告であり,本記事では再現していない。前編の動画(令和8年9月24日公開)も字幕で確認した。

Jevの仕様・料金・言語の説明は,TypeSafe AIの公式ブログ,公式ドキュメント及び顧客契約で確認した。自己選好と構造化面接の記述は,上記の各論文の本文で確認した。弁護士職務基本規程の条文は,日本弁護士連合会の公表PDFで確認した。

本記事は裁判例を根拠とする命題を採用していないため,判例秘書の検索は行っていない。関連裁判例が存在しないという結論も示していない。

第7 関連記事

①AIが示す「確信度」はどこまで信じてよいか―較正の意味,自動振分けの閾値及び期限が絡む分類を人が見る理由<br>②法律事務所の生成AIをどう評価・改善するか―トレース,評価データセット,回帰試験,一次資料確認及び守秘義務<br>③AIの改善ループが失敗する条件-代理指標,仕様ゲーミング,遅れて分かる成果及び人が決める停止条件<br>④司法試験の採点実感から学ぶ法律文書の書き方―準備書面・意見書・相談メモのチェックリスト<br>⑤AIに代替される弁護士業務と人が担う役割-仕事がなくなる条件・根拠・限界

第8 出典・参考資料

1 提供資料

①海外Yパパラジオ 世界を読み解く「しゃべらない最新AI『Jev』はガチの議論に使えることが分かった」(YouTube,令和8年9月25日)<br>②同「判断だけする新型AI『Jev』。2億回訓練した機械学習と判断勝負してみてた。」(YouTube,令和8年9月24日)

2 AI提供者の公式資料

①TypeSafe AI「Introducing System One Models and Jev」<br>②TypeSafe AI Docs「Models」<br>③TypeSafe AI Docs「Score」<br>④TypeSafe AI Docs「Composite scoring」<br>⑤TypeSafe AI「Master Customer Agreement」

3 論文

①Panickssery, Bowman and Feng, LLM Evaluators Recognize and Favor Their Own Generations(arXiv:2404.13076)<br>②Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(arXiv:2306.05685)<br>③Sackett, Zhang, Berry and Lievens, Revisiting Meta-Analytic Estimates of Validity in Personnel Selection(Journal of Applied Psychology)

4 会規

①日本弁護士連合会「弁護士職務基本規程」

第9 別の機会に掘り下げる点

本記事のテーマは「AIが書いた複数の主張案を,項目別の採点で選ぶ方法」である。次の点は,本記事では検討しておらず,別の機会に掘り下げる。

①日本語の法律文書で,判定専用AIと生成AIの項目別採点が,弁護士の採否とどの程度一致するか(過去の書面と採否を使った実測)<br>②採点項目のうち,裁判所の判断(判決理由)と結び付く項目は何か<br>③書き手のAIと採点役のAIを別系統にしたときに,自己選好の偏りが日本語でも観測されるか<br>④候補の作成と採点に別々の外部サービスを使う場合の,依頼者への説明と同意の要否