第1 公表順位から直ちに導入を決めない
令和8年9月30日にGoogleがGemini 4 Argonを発表した。Googleは法務・金融を含む複雑な業務での性能を説明し,Vals Index及びHarveyのLegal Agent Benchmark(LAB)を挙げている。これはモデル提供者による公表であり,日本法に関する法律事務所の案件での正確性を実証したものではない。Googleの発表とVals AIのモデル別結果を区別して読む必要がある。
本記事では,令和8年10月1日に確認できた公表資料から,数値の意味と,日本の法律事務所で実機評価をする手順を整理する。特定モデルの採用を勧めるものではない。
第2 68.90%と19.58%は別の試験の数値である
1 Vals Indexの68.90%
Vals AIの説明によれば,Vals Indexは金融,コーディング,法務及び税務の課題を米国GDP上の各分野の比重で集計する指標である。Vals AIのモデル別ページは,Gemini 4 Argonの結果を68.90%と表示している。これは日本法の調査正答率でも,すべての法務作業を最後まで完了した割合でもない。
同じモデル別ページには,Legal Research Benchが54.81%,HarveyのLABが19.58%と,別の試験の結果も掲載されている。試験集合,課題,採点方法及び実行条件が異なる以上,68.90%から19.58%を差し引いて法律業務における性能低下と評価することはできない。
2 HarveyのLABの19.58%
HarveyによるLABの設計説明では,指示,案件資料及びレビュー可能な成果物を一つの課題とし,事実,結論,引用,分析,形式などについて専門家が作成した必須基準で検査する。課題を完了と数えるのは,その課題の必須基準をすべて満たした場合だけである。Vals AIの19.58%は同サイトに表示された当該試験の値であり,個々の基準を満たした割合と読み替えてはならない。
Harveyの初期結果の説明も,全基準合格率と,モデルがどの順番で資料を探しツールを使ったかという実行経過を分けている。この採点方法は,平均点が高くても重要な引用又は不利な資料を一つ落とす成果物が残る,という実務上の問題を見えるようにする。
3 数字の比較に必要な条件
順位を読む際には,①試験の対象法域と課題,②公開問題か未公開問題か,③モデルだけか検索・道具を含むシステムか,④入力資料と使用権限,⑤採点基準,⑥モデルの版と実行日,⑦費用と所要時間を並べて記録する。同じ名称の試験でも更新により順位が変わり得るため,数値には確認日と出典URLを付ける。
Googleは同モデルの出力上限を100万トークンに拡大したと説明する。他方,Vals AIのモデル別ページは評価時の最大出力を262,144トークンと表示する。前者は提供者によるモデル能力の説明,後者はVals AIが表示する評価設定として扱い,両者を同じ値であったかのように混同しない。
第3 現時点の利用可能性と測定の限界
Googleの発表によれば,令和8年9月30日の発表時点で提供先は選ばれたサイバー防御関係者等に限定され,開発者,企業及び一般利用者への提供は今後の予定とされている。したがって,公表ベンチマークをもって,通常の法律事務所が同一条件で今日すぐ実機検証できると考えてはならない。利用可能な版,契約,料金,入力・出力上限及びデータ取扱条件は,実際に使う時点で公式資料と管理画面を再確認する。
本記事の作成に際し,私はGemini 4 Argonを用いた日本法の独自試験を実施していない。以下の評価設計は,公表された試験方法を参考にした実務提案であり,特定モデルの日本法での測定結果ではない。
第4 日本の法律事務所で使う評価問題を作る
1 問いと正解資料を固定する
最初は公開資料だけで解ける10問から20問を選び,法域,基準日,手続段階,当事者の立場,必要な成果物及び使用を許す資料を各問に記す。現行条文だけでなく,改正前後,経過措置,反対方向の裁判例,例外及び判断を留保すべき問題を混ぜる。プロンプト等の調整に使う問題と,調整後の成績を測る未使用の問題を分ける。
各問の「正解」は結論の一文だけでは足りない。参照すべき法令・判決・行政資料の原文と確認日,拾うべき不利な事情,必要な留保,引用箇所及び人に戻す条件まで指定する。公開資料から作る模擬事例なら,依頼者の秘密情報を外部の評価環境へ移さずに済む。
2 工程別の率と全必須項目合格率を併記する
検索候補に正解資料が入った率,候補の本文を取得できた率,引用箇所の一致率,結論の妥当性及び人への引継ぎの成否を別々に記録する。その上で,「正解資料の本文を確認した」「法的命題の射程を外していない」「重要な反対材料を落とさない」「期限や未確認事項を誤表示しない」など,課題ごとの必須項目がすべて通った割合を別に出す。一つでも重大な項目を落とした課題は,平均点が高くても完了扱いにしない。
全項目合格率は,基準を増やすほど下がりやすい。異なる問題集合や異なる基準数の率を,そのまま横並びにしない。採点票,問題集合の版,担当者及び不合格理由を残して初めて,モデルや検索方法を変えた前後の比較に使える。
3 時間と費用も同時に測る
見かけの回答時間だけでなく,検索,原文確認,弁護士の修正,やり直し及び最終承認までの総時間を測る。トークン代,検索サービス代及び人の確認時間も同じ課題で記録する。全項目合格率が上がっても,確認負担が増える仕組みは採用判断を別に要する。
第5 判例秘書を使うときの出典台帳
裁判例を正解資料にする問題では,裁判所ウェブサイトの掲載と,判例秘書その他の利用を許されたデータベースでの確認を分ける。各問題に,①データベース名,②検索日,③検索語及び検索対象範囲,④ヒット件数と実際に本文を読んだ件数,⑤裁判所名・裁判年月日・事件番号,⑥本文の該当箇所と命題との対応,⑦確認できなかった範囲を記録する。
検索結果に出なかったこと,検索していないこと,検索できなかったことは別の状態である。いずれも裁判例の不存在を証明しない。要旨だけを見て本文を読んでいない場合も「本文確認済み」としない。判例秘書の利用条件に従い,全文の外部AIへの投入や第三者への再配布が許されるかを確認する。
本記事はベンチマークの読み方と評価方法を扱い,特定の裁判例の法的命題を採用していない。そのため,本記事自体について新たな判例秘書検索は実施していない。将来,個別の日本法の結論を示す記事又は評価問題を作る際には,対象となる裁判例の一次資料確認を別途行う。
第6 外部AIへ送る前に確かめること
実案件で試す場合,入力する事件資料,検索結果,トレース及び評価データが,どの提供者又は接続先へ渡るかを整理する。学習への利用,保存期間,閲覧権限,再委託,削除及び障害時の連絡を,利用するプランの契約と設定で確認する。公開資料による模擬試験の成績と,守秘情報を含む実案件での運用可否は別の判断である。
モデルに調査や起案を任せても,法令・判決・証拠の原文との照合と最終判断を弁護士の手続から外さない。詳細な記録方法は法律事務所の生成AIをどう評価・改善するかで,ハルシネーション対策はAI作成記事のハルシネーション防止方法で整理している。
第7 出典と確認状況
①Google「Gemini 4 Argon: our next era of frontier intelligence」(令和8年9月30日。モデル提供者の発表。提供状況,出力上限,試験への言及を確認)
②Vals AI「Gemini 4 Argon」(令和8年10月1日確認。Vals Index,Legal Research Bench及びHarveyのLABの表示値並びに評価設定を確認)
③Vals AI「AI Benchmark Leaderboards」(令和8年10月1日確認。Vals Indexの対象分野と米国GDP比重の説明を確認)
④Harvey「Open-Sourcing Harvey’s Long Horizon Legal Agent Benchmark」(令和8年5月6日。課題の構成と全必須項目合格方式を確認)
⑤Harvey「Initial Results on Legal Agent Benchmark」(令和8年5月26日。未公開評価問題及び実行経過の説明を確認)
Googleの発表は提供者による説明,Vals AIの数値は同社が表示する試験結果,Harveyの資料は試験設計者による説明である。いずれも日本法上の個別命題又は日本の法律事務所での独自測定を裏付けるものではない。