第1 LangSmithとは何か
LangSmithは,生成AI又はAIエージェントの実行過程を記録し,問題のある処理を調べ,既知の事例で変更前後を比較し,本番中の品質を監視するための開発・評価基盤である。
LangChainの公式資料は,LangSmithを,モデル呼出し,取得した文脈,ツールの動作及びフィードバックをトレースとして記録し,オフライン評価とオンライン評価を通じて改善を繰り返すためのプラットフォームと説明している。
法律事務所でいえば,回答だけを見て「今回は正しかった」又は「今回は誤った」と評価するのではなく,問いの理解,法令・裁判例の検索,原文取得,引用,ツール操作及び最終編集のどこで期待から外れたかを調べるために使うことが考えられる。
もっとも,LangSmithは法律情報データベースでも法律相談AIでもなく,そこに記録が残っていること自体は,法令又は裁判例の内容が正しいことを意味しない。
本記事は,令和8年9月30日時点の公式資料に基づくLangSmith自体の紹介である。
機能,料金,保存期間,提供地域及び契約条件は変更され得るため,導入時には必ず最新の公式資料,実際の管理画面及び適用される契約を確認する必要がある。
第2 LangChain及び生成AIモデルとの違い
LangChainは,モデル,検索,ツール及び処理手順を組み合わせてAIアプリケーションを作るためのオープンソースの枠組みである。
LangGraphは,状態を持つ長い処理又は人の承認を含む処理を組み立てるための実行基盤であり,LangSmithは,それらを含むAIアプリケーションのトレース,評価及び監視を担う商用プラットフォームである。
LangSmith自体は,質問に答える生成AIモデルではない。
また,LangChain又はLangGraphを使ったアプリケーションだけに限定されず,公式資料は,OpenAI,Anthropic,CrewAIその他の構成についても,自動連携又は手動の計装によってトレースを送れるとしている。
したがって,LangSmithを導入するかという問題と,どの生成AIモデルを採用するかという問題は分けて検討する必要がある。
モデル提供者,検索サービス,外部コネクタ,LangSmith及び評価に使う別のモデルは,それぞれ異なる情報処理先になり得る。
第3 LangSmithの主な機能
1 トレースによる実行過程の可視化
トレースは,一つの依頼又は処理について,モデル呼出し,プロンプト,入力,出力,検索又は文書取得,ツール呼出し,処理時間,エラー,コスト及びフィードバック等を関連付けて表示する機能である。
最終回答だけでは分からない中間過程を見ることにより,検索結果が不足していたのか,正しい資料を取得したのに最終回答が無視したのか,又は想定外のツールを実行したのかを切り分けやすくなる。
公式資料は,対応する枠組み又はモデル提供者との連携による自動トレースと,任意の関数又は処理区間を明示的に記録する手動計装を案内している。
どの項目をどの粒度で記録するかは,調査のしやすさだけでなく,秘密情報の最小化及び費用にも影響する。
2 データセット,実験及びオフライン評価
データセットは,繰り返し試す入力,期待する出力又は評価基準を保存する集合である。
同じデータセットに変更前後のアプリケーションを通して実験結果を比較すれば,プロンプト,モデル,検索対象又はツールを変更したために以前できていた処理が悪化していないかを確認できる。
LangSmithの公式資料は,公開前のオフライン評価として,ベンチマーク,単体試験,過去の本番例を使うバックテスト及び二つの出力を比較する評価を挙げている。
評価方法には,形式又は必須項目を機械的に確認するコード評価,別のモデルに基準に沿って採点させるLLM-as-a-judge,人による確認及び複数の指標を組み合わせる方法がある。
法律実務では,最終文章の自然さだけでなく,対象法域,基準日,参照すべき条文,裁判年月日,事件番号,原文の該当箇所,不利な資料,必要な留保及び人の承認条件を評価例へ付ける必要がある。
別のAIによる高得点は,原典確認の代わりにはならない。
3 オンライン評価と人によるフィードバック
オンライン評価は,本番中のトレースを対象として,出力の形式,異常な処理時間,エラー,特定のツール利用又は定めた品質基準を継続的に確認する機能である。
公式資料によれば,対象とするトレースの条件及びサンプリング率を設定し,必要な処理だけを評価することもできる。
本番で見つかった失敗を人が確認し,秘密情報を削減した上で評価データセットへ戻せば,その失敗を次の版の回帰試験に使える。
LangSmithの実務上の中心は,トレース,評価,人の訂正及び次の試験を一方向の監視で終わらせず,改善の循環へつなぐ点にある。
4 現在の製品範囲
現在のLangSmithは,Observability及びEvaluationだけでなく,Deployment,Engine,Sandboxes,LLM Gatewayその他の機能を含む広い製品群として案内されている。
本記事は,法律事務所が生成AIを点検する場面と直接関係するトレース,データセット,評価及び監視を中心に扱う。
製品名が同じでも,観測・評価機能と,AIエージェントを実際に稼働させる機能では,処理されるデータ,料金及び責任分界が異なり得る。
導入台帳には「LangSmith」とだけ書かず,使用する機能,プラン,接続先及びデータの流れを具体的に記録する必要がある。
第4 run,trace,thread及びtrajectoryの意味
公式資料では,runは,モデル呼出し,プロンプト整形,文書取得又はツール実行等の一つの作業単位をいう。
traceは,一つの処理に属する複数のrunを木構造としてまとめたものであり,projectは,特定のアプリケーション又はサービスに関するtraceの入れ物である。
threadは,複数回のやり取りに属するtraceを一つの会話又はセッションとして結び付けたものである。
trajectoryは,同じ処理経過を,人,AI及びツールのメッセージが現れた順序に並べて読みやすくした表示であり,runの入れ子構造をそのまま示すtraceとは目的が異なる。
法律事務所で一つの相談又は事件番号をそのままthreadの識別子にすると,メタデータだけでも秘密情報又は個人情報になり得る。
外部基盤へ送る識別子は,実名又は事件番号ではなく,事務所内の対応表だけで復元できる無意味なIDにすることが考えられる。
第5 法律事務所で考えられる利用場面
1 法律調査の失敗工程を切り分ける
法律調査AIが誤ったときは,検索式,検索対象,候補の順位付け,原文取得,命題化,引用及び最終回答を分けて確認する必要がある。
LangSmithのトレースは,どの検索語を使い,どの資料を取得し,どのモデル呼出しが最終結論を作ったかを記録できるため,失敗工程の特定に役立ち得る。
もっとも,裁判所ウェブサイト又は判例データベースへ正しくアクセスできたか,利用権限のある本文を実際に開いたか,及び引用が原文と一致するかは,別途確認しなければならない。
トレースに資料名が表示されたことだけで,その一次資料を確認済みとしてはならない。
2 文書作成及び情報抽出を回帰試験する
契約書,判決書又は証拠資料から指定項目を抽出する処理では,必須項目,日付及び金額の形式,引用箇所,未記載事項の扱い並びに不明時の停止条件を固定ルールで検査できる。
モデル又はプロンプトを変更したときに,同じ公開資料又は模擬資料で再試験すれば,見栄えが良くなった一方で重要項目の欠落が増えたという退行を発見しやすい。
文章の明確さ又は質問への適合性は別のAIの補助評価を使えるが,条文の射程,裁判例の評価,証拠の信用性及び依頼者にとっての選択は,弁護士が確認する必要がある。
形式評価,AIによる補助評価及び一次資料に基づく人の確認を混同しないことが重要である。
3 AIエージェントのツール操作を確認する
メール送信,ファイル保存,期限登録,ウェブ公開又はデータ削除を行うAIエージェントでは,最終回答の文章よりも,どのツールをどの引数で実行し,どの結果を読み戻したかが重要になる。
トレースは,承認前に外部操作をしたか,失敗後に無制限の再試行をしたか,又は誤った対象へ保存したかを調べる資料になり得る。
ただし,トレース上の成功表示は,外部システムで保存又は送信が完了したことの証明とは限らない。
重要な外部作用については,対象システムからの読戻し,公開画面又は送信済み記録等を別に確認する必要がある。
第6 LangSmithだけでは証明できないこと
LangSmithは,AIが何をし,どこで時間又は費用を使い,どの評価結果を受けたかを調べるための道具である。
次の事項は,LangSmithの画面又は評価点だけでは証明できない。
①適用法令が基準日時点の現行法であること
②裁判例が実在し,事件番号,裁判年月日,判示及び射程が正しいこと
③契約条項又は証拠の引用が原本と一致すること
④判例秘書その他のデータベースを必要な範囲で検索し終えたこと
⑤弁護士が個別事情,不利な資料及び依頼者の目的を踏まえて法的判断をしたこと
⑥外部システムへの保存,送信又は公開が実際に完了したこと
⑦守秘義務,個人情報保護及び契約上の条件を満たすこと
LLM-as-a-judgeは,大量の出力を一定の基準で振り分ける補助にはなるが,評価に使うモデルも誤り,評価基準の書き方によって点数が変わる。
高得点を法的正確性の保証とせず,重大な誤りについては一次資料と人による確認を独立して残す必要がある。
第7 守秘義務及び個人情報との関係
1 トレースへ送られる情報を先に洗い出す
トレースには,プロンプトと最終回答だけでなく,取得した文書,ツール引数,検索結果,添付ファイル,メタデータ,利用者のフィードバック及び評価結果が含まれ得る。
モデル提供者へ送る情報を制限しても,観測基盤に同じ情報又はより詳細な中間過程が保存される場合がある。
導入前には,入力,出力,取得文書,添付ファイル,メタデータ及び識別子のうち何を送信するかを項目別に確認する。
依頼者名,事件番号,相手方名,メールアドレス,認証情報及び原資料全文を,検索しやすさだけを理由として重複保存しない。
2 記録しない又は送信前に削減する
LangSmithの公式資料は,入力及び出力を隠す設定,メタデータを削除又は変換する設定,正規表現等による匿名化,特定の関数だけに対する送信前処理並びに条件付きでトレースを無効にする方法を案内している。
秘密情報を含む処理について保存が許されない場合は,マスキングだけに頼らず,その処理自体をトレースしない設計を検討する必要がある。
匿名化処理は,氏名又はメールアドレス等を必ず全て検出できるとは限らない。
実在事件を使う前に,公開情報又は架空事例で,どの階層及び添付ファイルに情報が残るかを実測する必要がある。
3 保存期間と削除単位を分けて確認する
令和8年9月30日に直接確認した公式料金ページは,基本トレースの保存期間を14日,延長トレースの保存期間を180日としている。
公式の観測概念ページも,SaaSのトレースは取込みから180日で削除され,一部の利用統計用メタデータが残る旨を説明している。
他方,トレースをデータセットへ追加すると,データセットは元のトレースが削除された後も存続すると説明されている。
したがって,トレースの保存期間だけでなく,データセット,添付ファイル,評価結果,フィードバック及び統計用メタデータの保存期間と削除方法を別々に確認する必要がある。
検索結果の要約又は古い記事には,現在と異なる保存期間が表示されることがある。
ブログ記事の数字だけに依存せず,契約,最新の料金ページ,管理画面及び実際の設定を同一基準日で照合する必要がある。
4 保存地域とセルフホスト
公式の地域FAQは,クラウドの地域別インスタンスとして米国,EU,APACその他のURLを案内し,現在は組織を地域間で移行できないとしている。
作成後に簡単に移せるとは限らないため,最初の組織作成時に保存地域を確認する必要がある。
セルフホスト版は,公式資料上,Enterpriseプラン向けの追加機能であり,自社の基盤上にLangSmithの観測,評価及びプロンプト関連機能を構築するものである。
セルフホストであっても,モデル提供者,アップデート,ライセンス確認,サポート及び外部評価器への通信が全くないとは限らないため,構成図と通信先を確認する必要がある。
5 学習利用がないことと保存されないことは異なる
公式料金ページは,LangSmithへ送信されたデータをモデル学習に使用せず,トレース,プロンプト及び出力は当該組織内で非公開であると説明している。
これは製品提供者の公式説明として重要であるが,「学習しない」ことは,「保存しない」,「人が一切アクセスしない」,「再委託先がない」又は「日本国内だけで処理する」ことと同じではない。
弁護士法23条の秘密保持義務,弁護士職務基本規程その他の職務上の規律及び個人情報保護法上の取扱いを踏まえ,利用目的,入力の必要性,保存先,アクセス権,削除,事故通知,再委託先及び契約上の責任分界を確認する必要がある。
個人情報保護委員会の注意喚起も,個人情報を含むプロンプトについて利用目的の範囲及び提供者による機械学習利用の有無等を十分に確認するよう求めているが,学習利用だけを確認すれば他の問題が全て解消するという趣旨ではない。
第8 料金プランを読むときの注意点
令和8年9月30日時点の公式料金ページには,Developer,Plus及びEnterpriseの各プランが掲載されている。
Developerは1席で月額0米ドル及び月5,000件までの基本トレース,Plusは1席当たり月額39米ドル及び月10,000件までの基本トレースを含み,超過後は従量課金になると説明されている。
ただし,LangSmithの料金は席数又はトレース件数だけで決まるとは限らず,計算量を示すLCU,保存量を示すLSU,評価器,デプロイその他の機能による課金があり得る。
無料枠があることは,秘密情報を入力してよいこと,又は本番利用に必要な管理機能が全て含まれることを意味しない。
料金及びプラン別機能は変わりやすいため,本記事の数字は導入判断の根拠ではなく,確認項目の例として扱うべきである。
契約前には,想定するトレース数,延長保存への自動移行条件,評価の実行回数,席数,エクスポート,アクセス制御及び必要なサポートを含めて試算する必要がある。
第9 法律事務所での最小導入手順
LangSmithを試す場合でも,最初から実在事件又は依頼者情報を使う必要はない。
次のような小規模な検証から始めることが考えられる。
①公開法令,裁判所の公開裁判例又は架空事例だけを使う検証用projectを作る。
②トレースされる入力,出力,取得文書,ツール引数,添付ファイル及びメタデータを実測する。
③入力及び出力の非記録,匿名化,条件付きトレース並びにアクセス権を試す。
④代表例,境界例及び既知の失敗例を10件から20件程度の評価データセットにする。
⑤形式及び必須項目は固定ルール,説明の質はAIによる補助評価,法的正確性は一次資料と弁護士で確認する。
⑥モデル,プロンプト,検索対象又はツールを変える前後で同じ評価例を実行する。
⑦保存期間,削除,エクスポート,料金及び管理権限を確認した後に,秘密情報を扱うかを別途判断する。
少数の公開事例で有用性を確認できない段階では,実在事件を入力してまで本番導入する合理性は乏しい。
逆に,失敗工程の特定,変更前後の比較及び人の確認負荷の削減に具体的な効果がある場合は,事務所の許可サービス台帳,情報区分及び承認手順へ組み込むことを検討できる。
第10 一次資料及び判例の確認状況
LangSmithの機能,料金,保存期間,地域及びマスキングに関する記述は,製品提供者であるLangChainの公式サイト又は公式ドキュメントで確認した。
これらは製品仕様及び提供者の説明を確認するための一次資料であるが,第三者による中立的な性能評価又は日本法上の適法性を保証する資料ではない。
法的な注意事項は,弁護士法,弁護士職務基本規程,個人情報保護法及び個人情報保護委員会の注意喚起を参照した。
Zennの「LangSmithの概要と使い方【LLMOps】」は,調査の出発点となった二次資料であり,現在の製品仕様,料金,保存期間又は法的結論の根拠にはしていない。
本記事は,特定の紛争における法的責任又は裁判例の射程を論じるものではないため,今回,新たな判例秘書の認証検索は実施しておらず,裁判例を直接の根拠として用いていない。
これは関連裁判例が存在しないという意味ではなく,個別事件で責任,証拠価値又は守秘義務違反の成否を検討する場合は,争点及び基準日を特定して裁判所ウェブサイトと判例秘書その他の利用可能なデータベースを改めて確認する必要がある。
第11 関連記事
①法律事務所の生成AIをどう評価・改善するか―トレース,評価データセット,回帰試験,一次資料確認及び守秘義務(AI作成)
②弁護士情報セキュリティ規程とは―全7条の内容,基本的な取扱方法及び漏えい等事故の対応(AI作成)
③法律事務所の生成AI利用ガイドラインの作り方-許可サービス,入力情報,出力確認,委託先及び事故対応(AI作成)
④法律事務所のAIエージェント業務設計-目的・コンテキスト・権限・完了条件をどう分けるか(AI作成)
第12 出典・参考資料
①e-Gov法令検索・弁護士法23条
②e-Gov法令検索・個人情報の保護に関する法律
③日本弁護士連合会「弁護士職務基本規程」
④個人情報保護委員会「生成AIサービスの利用に関する注意喚起等について」(令和5年6月2日)
⑤LangChain「What is LangSmith?」(製品提供者の公式資料。2026年9月7日)
⑥LangChain Docs「Observability concepts」(製品提供者の公式資料)
⑦LangChain Docs「Evaluation types」(製品提供者の公式資料)
⑧LangChain Docs「Manage datasets」(製品提供者の公式資料)
⑨LangChain Docs「Prevent logging of sensitive data in traces」(製品提供者の公式資料)
⑩LangChain Docs「Regions FAQ」(製品提供者の公式資料)
⑪LangChain Docs「Self-hosted LangSmith」(製品提供者の公式資料)
⑫LangSmith Plans and Pricing(製品提供者の公式資料)
⑬LangChain Trust Center(製品提供者のセキュリティ・コンプライアンス情報)
⑭LangChain Terms of Service(製品提供者の契約資料)
⑮umi_mori「LangSmithの概要と使い方【LLMOps】」(二次資料。現在の製品仕様又は法的評価の根拠には用いていない。)