法務AIの91%を見てから測り直しに至る流れの図。発表の91%は項目の通過率で、同じ採点を課題ごとに数えると全項目合格は16.4%。採点は訓練でも評価でもAIで、報酬の8割は項目の通過率にあった。重みと評価の記録は公開されているため、自社の契約で測り直せる。全体を弁護士の見直しが包み、出口は下書きの出来である。
イメージアブストラクト ── 記事の全体像を 1 枚に(画像を押すと拡大)

法務 AI の会社 Ivo は 2026 年 10 月 1 日、契約の仕事向けに追加で訓練した AI モデル Ivo Sage を無償で公開し、契約の課題で採点項目の通過率が 0.701 から 0.913 に上がったと発表した。法務向け AI の「91%」は、契約の審査を任せてよい水準を示すのか。示さない。すべての採点項目を満たした契約の課題は 16.4% にとどまり、点をつけたのも AI だった。この点数で言えるのは、弁護士が見直す前の下書きの出来までである。

01Ivo Sage の 91% は採点項目の通過率で、契約を任せてよい率ではない

Ivo は米サンフランシスコにある法務 AI の会社だ。Ivo Sage は、DeepSeek が出したモデル DeepSeek V4 Flash を土台にして、契約の仕事向けに追加で訓練したモデルである。Ivo はモデルの重みを、誰でも無料で使い、手を加えられる MIT ライセンスで公開した。

発表には二つの数字がある。契約の課題で、Ivo Sage は採点項目の 91.3% を満たした。ところが、一つの課題のすべての項目を満たせたのは、課題全体の 16.4% だった。点をつけたのは、採点役の AI である。弁護士は採点していない。

私は、この点数から言えるのは弁護士が見直す前の下書きの出来までだと考える。契約の審査に AI を入れたい人は、点数をうのみにせず、公開された記録を使って自社の契約で測り直すことになる。

0291.3% と 16.4% は、同じ採点を別の数え方で数えた数字だ

91.3% と 16.4% は、同じ評価から出た数字だ。違うのは数え方である。

Ivo が Hugging Face に載せたモデルの説明書(モデルカード)によると、Ivo は訓練に使わなかった 180 の課題で Ivo Sage を試した。そのうち契約の課題は 55 件ある。採点役の AI は、課題ごとの採点基準に沿って、成果物を 3 回ずつ採点した。モデルカードは、この採点役を LLM の判定者と呼んでいる。

91.3% は、採点基準に並んだ項目のうち、通った項目の割合である。16.4% は、すべての項目が 3 回とも通った課題の割合だ。項目が一つでも落ちれば、その課題は全項目合格に数えない。私は、全項目合格のほうが、成果物をそのまま弁護士に渡せるかに近い数え方だと考える。

図 1 一つの採点から二つの数字が出るまで
項目で数える課題で数える契約課題 55 件AI が 3 回採点採点基準の項目ごと項目の通過率0.913全項目合格16.4%項目で数える課題で数える契約課題 55 件AI が 3 回採点採点基準の項目ごと項目の通過率0.913全項目合格16.4%
同じ採点を項目で数えると 0.913、課題ごとに全項目を求めると 16.4% になる。発表の 91% は前者である。

Ivo Sage の土台になった DeepSeek V4 Flash は、同じ課題で項目の 70.1% を通し、全項目合格は 5.5% だった。Ivo Sage は、項目の通過率を 21 ポイント上げ、全項目合格を 3 倍近くにした。伸びは本物である。それでも、契約の課題の 6 件に 5 件は、どこかの項目で落ちている。

評価に使った LAB は、法務 AI の会社 Harvey が公開している評価の課題集だ。LAB は Legal Agent Benchmark の略で、実際の法務の仕事に近い課題で AI を試すために作られた。

03契約の審査で出力を見直すのは弁護士だと、モデルカードも米法曹協会も書いている

すべての項目を満たした契約の課題は、16.4% しかなかった。残りの 8 割あまりの課題では、採点役の AI がどこかの項目を落としており、その箇所を人が見直す必要がある。契約の審査で直す役を負うのは、弁護士である。

Ivo Sage のモデルカードは、用途を「資格のある弁護士が見直す成果物を作る」と書いている。Ivo 自身が、弁護士の見直しを前提にしている。

米法曹協会は 2024 年 7 月 29 日、生成 AI を使う弁護士に向けて正式意見 512 を出した。National Law Review の要約によれば、弁護士は使う道具を見極め、出力を確かめ、道具の結論だけに頼ってはならない。意見 512 は、弁護士が自分の判断を AI に任せることも認めていない。

日本では、法務省が 2026 年 8 月 21 日に、AI などで法務の仕事を助けるサービスについて新しいガイドラインを出した。AI による契約審査の支援と、弁護士法 72 条の関係を扱うガイドラインだ。私はガイドラインの本文をまだ読んでいないので、中身には立ち入らない。

ここで扱う範囲は、契約と法務の現場に限る。ほかの分野の審査に同じことが言えるかは、この記事の資料からは言えない。

04Ivo Sage は訓練でも AI に採点され、報酬の 8 割は通った項目の割合で決まった

評価で点をつけたのは採点役の AI だった。訓練でも、同じ型の採点が報酬として使われている。

モデルカードによれば、Ivo Sage は LAB の 1,040 の課題で強化学習を受けた。強化学習では、モデルの答えに点をつけ、点が上がる方向へモデルを少しずつ変えていく。この訓練で点をつけたのも、採点役の AI である。

報酬の式は、項目の通過率に 0.8、全項目合格に 0.2 の重みを置いている。モデルにとっては、項目を一つでも多く通すほうが、報酬を増やしやすい。

図 2 訓練と評価に同じ型の採点が使われた
訓練評価訓練の1,040課題AI が採点項目に 8 割の重み別の 180 課題AI が 3 回採点項目の通過率 91%訓練評価訓練の1,040課題AI が採点項目に 8 割の重み別の 180 課題AI が 3 回採点項目の通過率 91%
課題は分けてあるが、採点の型は訓練と評価で共通している。報酬の 8 割が項目の通過率に置かれていた。

結果を見ると、項目の通過率は 21 ポイント上がり、全項目合格は 16.4% にとどまった。報酬の 8 割が項目の割合に置かれていたことを思えば、この伸び方に不思議はない。ただし、重みが原因だと確かめた資料は無い。私は、重みと伸び方が合っている、とまでしか言えない。

偏った見方にならないよう、別の数字も書いておく。訓練に使っていない別の評価 RedlineBench でも、Ivo Sage の点は 30.8 から 45.7 に上がった。訓練で使った採点役の AI の好みだけで点が伸びたとは、この数字からは言えない。

05重みと 180 課題の記録が公開され、使う側が採点を読み直せる

採点役の AI の点数をうのみにしなくても、使う側には確かめる材料がある。Ivo は、評価の記録をまとめて公開した。

Hugging Face のデータセットには、検証に使った課題の一覧と、課題ごとの作業記録・成果物・採点役の判定が載っている。Ivo Sage の重みは誰でもダウンロードでき、土台の DeepSeek V4 Flash に足して使う。

①

重み

誰でも使える MIT ライセンスで、土台のモデルに足す追加の重みとして配られている。

②

評価の記録

検証の全課題について、作業記録・成果物・採点役の判定が読める。

③

課題の一覧

訓練と検証に使った課題の一覧があり、自社の契約と重なりを比べられる。

モデルカードには、ほかのモデルとの比べも載っている。費用は、各モデルが使ったトークンを、各社の定価で換算した値である。

見るところIvo SageDeepSeek V4 Flash(土台)Fable 5.1
項目の通過率0.9130.7010.941
全項目合格16.4%5.5%29.1%
1 課題あたりの費用1.24 ドル1.33 ドル142.39 ドル

Fable 5.1 は、全項目合格が 29.1% で、Ivo Sage の倍に近い。その代わり、1 課題あたりの費用は 142.39 ドルで、Ivo Sage の 1.24 ドルの 100 倍を超える。同じ表で、GPT-6 Astra は全項目合格が Ivo Sage と同じ 16.4% で、費用は 74.29 ドルだった。

この費用は定価での換算で、実際の契約の仕事でかかる額ではない。安く同じ点が出るという話は、あくまでこの 55 件の課題での話である。

06AI の点数は数え方で変わり、採点したのも AI だが、自社で試すための材料は公開されている

重みも作業記録も費用の表も、すべて公開された。ここまでの節で示した事実から、点数の読み方について、私は三つのことを言える。

発表の「91%」を見たら、まず数え方を確かめる

同じ 55 の契約課題で、項目の通過率は 0.913、全項目合格は 16.4% だった。どちらの数字を見出しに使うかで、読む人の受け取り方は大きく変わる。法務 AI の点数を見たら、項目で数えたのか、課題で数えたのかを先に確かめる。数え方が分かるまで、点数は比べられない。

点数は、採点役の AI がつけた出来の点である

評価の点も訓練の報酬も、採点役の AI がつけた。だから点数は、弁護士が合格とした割合とは別のものとして読む。採点役の AI の判定も道具が出した結論の一つで、米法曹協会の正式意見 512 は、弁護士に道具の結論だけに頼らないよう求めている。

導入を決める前に、自社の契約で試し直せる

図 3 点数を自社の契約で測り直す流れ
判定の記録を読む公開の 180 課題自社の契約で試す全項目を満たすか弁護士が見直す判定の記録を読む公開の 180 課題自社の契約で試す全項目を満たすか弁護士が見直す
どこで外れるかを公開記録で先に読み、自社の契約で全項目の合否を数える。最後に見直すのは弁護士である。

Ivo は、重みも作業記録も判定も公開した。導入を考える会社は、自社の契約で同じ試しを自分で回せる。Ivo の CEO の Min-Kyu Jung は、発表でこう述べている。法務チームの文書や手引き、仕事の進め方をモデルに渡すと、良い成果が出る、と。自社の契約で試せば、自社の文書の中身がモデルに伝わっているかも分かる。

07日本語の契約や自社の型での正確さは、公開された資料ではまだ測られていない

測り直す材料は公開された。それでも、Ivo Sage について、公開された資料が測っていないことが残っている。

Ivo Sage は英語だけで訓練された。日本語の契約でどれだけ正確かは、モデルカードに示されていない。自社の契約の型に合うかも、まだ分からない。社内の雛形や、これまでの修正の癖を Ivo Sage が拾えるかを示した資料は無い。

採点役の AI の判定と、人の弁護士の判定がどれだけ一致するかも、モデルカードには書かれていない。技術報告書の中身までは、私は読んでいない。

①

日本語の契約

訓練は英語だけで、日本語の契約での点数は示されていない。

②

採点役と弁護士の一致

採点役の AI の判定と、人の弁護士の判定の一致度は、モデルカードに無い。

日本の会社が Ivo Sage を契約の審査に試すなら、日本語の契約で一から測ることになる。そうした結果は、この記事で当たった資料には載っていない。

私が次に探すのは、採点役の AI と弁護士の判定を突き合わせた数字である。その数字があれば、AI がつけた 91% を、弁護士がつけた点と比べられる。

Key Points ── 持ち帰る 3 つ
  1. Ivo Sage は、契約の課題で項目の 91.3% を通したが、すべての項目を通した課題は 16.4% だった。発表の数字を見たら、どの数え方かを先に確かめる。
  2. 評価の点も訓練の報酬も採点役の AI がつけ、報酬の 8 割は項目の通過率に置かれた。点数は、弁護士の合否とは別のものとして読む。
  3. Ivo は重みと、検証の全課題の作業記録と判定を公開した。導入するかどうかは、自社の契約で測り直してから決められる。
結語

法務向け AI の 91% は、契約の審査を任せてよい水準を示さない。91% は、採点役の AI が項目ごとにつけた点である。すべての項目を満たした契約の課題は、16.4% だった。

導入は自社の契約で測り直してから決め、測り直した後も弁護士の見直しは外さない。私は AI の点数を見たら、まず誰がどう数えたかを確かめる。

出典·参考文献
  1. LawFuel. Legal AI – Ivo Becomes The First Legal AI Company to Publish a Free Open-Source Model Post-Trained for Long-Horizon Contract Work. 2026-10-01.
  2. Ivo AI. Ivo Sage(Hugging Face のモデルカード). 2026-10-01.
  3. Ivo AI. Ivo Sage training artifacts(Hugging Face のデータセット). 2026-10-01.
  4. Harvey. harvey-labs: Legal Agent Benchmark (LAB). GitHub, 2026-10-05 閲覧.
  5. The National Law Review. American Bar Association Issues Formal Opinion on Use of Generative AI Tools. 2024-08-14.
  6. 法務省. 弁護士法(その他)── AI等法務業務支援サービス. 2026-08-21.