頼んでいない成果が出た場合の流れ。まず結果の範囲を確かめる。Claudeは零点の67.2%以上が直線上にあると示したが、予想は未解決である。次に確かめを内側と外側に分ける。13の検証役はClaude自身で、Leanと別の証明が外側にあたる。さらに650の失敗案など経過の記録を求める。最後に学術誌の査読を待ち、それまでは条件付きで採用する。
イメージアブストラクト ── 記事の全体像を 1 枚に(画像を押すと拡大)

2026年10月1日、米国の科学メディア Live Science は、Anthropic の研究用 AI である Claude がリーマン予想の証明には失敗したものの、途中で別の数学の結果を出したと伝えた。AI が頼まれていない成果を出してきたとき、それが正しいと言えるのは何を通ったときか。私の答えは、AI と独立した確かめを通ったときである。Claude の結果は、証明検査ソフトによる機械の検査と、数学者 Youness Lamzouri による別の証明を通った。学術誌の査読は、まだ通っていない。

01AIはリーマン予想の証明に失敗したが、途中で別の定理を証明した

Anthropic が研究用の Claude に頼んだのは、リーマン予想の証明だった。Claude は、その証明に失敗した。代わりに Claude が返したのは、誰も頼んでいない結果である。

リーマン予想は、ゼータ関数という関数の値が 0 になる点についての予想である。数学者は、この点を零点と呼ぶ。予想によれば、自明でない零点はすべて、実部が 1/2 の一本の直線の上に並ぶ。数学者は、直線の上に乗っている零点が全体の少なくとも何割あるかを、証明で少しずつ引き上げてきた。Anthropic によると、これまで証明されていた割合は 41.6% だった。Claude は、零点の 67.2% 以上が直線の上にあることを証明した。

図 1 失敗した依頼から副産物が出るまで
予想に挑む依頼Anthropic の依頼650の案が失敗1 回目のセッション約60の下位AI2 回目のセッション下限が67%台に頼まれていない成果予想に挑む依頼Anthropic の依頼650の案が失敗1 回目のセッション約60の下位AI2 回目のセッション下限が67%台に頼まれていない成果
頼んだのは予想の証明で、返ってきたのは別の結果だった。成果は依頼の失敗の途中で生まれた。

Anthropic は 2026年8月10日に、Claude の結果を自社のサイトで公表した。その後、Claude の結果はいくつもの確かめを通った。証明検査ソフトの Lean が、証明を機械で調べた。Anthropic 社内の数学者 2 人が証明を読み、社外の専門家 2 人にも論文が渡った。9 月 2 日には、数学者の Lamzouri が別のやり方で同じ割合を証明した。学術誌の査読は、まだ済んでいない。

私の結論は単純だ。AI の成果を受け入れるかどうかは、成果の大きさでは決まらない。AI の外にある誰か、または何かが確かめたかどうかで決まる。Claude の中で動いた 13 の検証役は、AI の外の確かめには数えない。

02Claudeが上げたのは割合の下限で、予想そのものは解けていない

Claude が返したのは、頼まれた証明とは別の、割合についての結果だった。Claude の結果が何を示し、何を示していないのかを、先に分けておく。

Clay 数学研究所は、リーマン予想を懸賞問題の一つに挙げている。研究所の説明では、最初の 10 兆個の零点が直線の上にあることは、計算で確かめられている。それでも、零点は無限にあるので、計算だけでは予想を証明できない。

見るところリーマン予想今回の結果
主張自明でない零点の実部はすべて 1/2直線の上にある零点は 67% を超える
状態未解決。Clay 研究所の懸賞問題プレプリント。学術誌の査読前
確かめ最初の 10 兆個を計算で確認Lean の検査、社内の数学者 2 人、別の証明

リーマン予想は、すべての零点が直線の上にあると主張する。Claude が示したのは、直線の上にある零点が 67% を超えるということだけである。残りの 3 割あまりの零点がどこにあるかは、Claude の結果からは分からない。Live Science も、Claude の結果は予想そのものの前進ではないと伝えている。

Anthropic 自身も、Claude の手法が予想の証明につながるとは見ていないと書いた。結果を発表した会社が、成果の届く範囲を自分で限っている。

記事によって数字が少し違う。Anthropic の発表では 67.2% で、Lamzouri の論文の要旨と Live Science の記事では 67.25% である。この記事では、どちらの資料の数字かを分けて書く。

03結果を確かめたのは、Claudeの検証役、Lean、社内の数学者2人、別の証明者だった

Claude の結果は予想の証明ではないが、それでも新しい定理である。新しい定理を、誰がどこで確かめたのかを順に並べる。

最初の確かめは、Claude の内側で行われた。Claude は作業の中で、13 の小さなエージェントに検証役を任せた。検証役のエージェントは、反例を探し、証明を一からやり直した。

次に、Claude の証明は Lean で調べられた。Lean は、数学の証明をコンピュータが一行ずつ確かめるためのソフトである。証明を Lean で調べるには、まず証明を Lean が読める形式に書き直す。

人間の数学者も、Claude の証明を読んだ。Anthropic の数学者 Alpöge と Furman が、証明を確かめた。Lamzouri の論文の要旨にも、Claude の証明はこの 2 人に確かめられたと書かれている。Channel Insider によると、Anthropic は社外の専門家 Conrey と Goldston にも論文を渡した。

最後に、Lamzouri が 9 月 2 日、論文の公開サイト arXiv に別の証明を出した。Claude の証明は、行列を使う枠組みで組み立てられていた。Lamzouri は行列を使わず、別の種類の不等式で同じ割合を導いた。

確かめた者AI からの独立見たもの
13 の検証役エージェント同じ Claude で独立していない反例探しと、一からの再証明
Lean の検査独立(小さな信頼核)形式化された証明
Alpöge・Furman・Conrey・Goldston社内 2 人、社外 2 人論文
Lamzouri独立(別の数学者)行列を使わない別の証明

Anthropic は、Claude の論文を arXiv ではなく自社のサイトに置いた。Channel Insider は、Claude の結果が学術誌の通常の査読をまだ通っていないと書いている。

04同じモデルの検証役は、AIと独立した確かめにはならない

Claude の結果を確かめた者と論文を受け取った者は、全部で五つある。検証役のエージェント、証明検査ソフトの Lean、社内の数学者 2 人、社外の専門家 2 人、そして数学者の Lamzouri である。私は、このうちどれが Claude から独立しているかを分けたい。

Claude の結果を最初に調べた 13 の検証役は、どれも Claude が自分で動かしたエージェントだった。検証役が反例を探しても、証明をやり直しても、判断は Claude というモデルの中で下されている。だから私は、13 の検証役を AI と独立した確かめには数えない。私は、検証役が何かを見落としたと言いたいのではない。Claude が自分の答えを自分で調べても、外からの確かめにはならないと言いたいだけである。

証明検査ソフトの Lean は、Claude の外にある。Lean の公式サイトは、小さな信頼核と呼ばれる中心部分が証明の正しさを保証すると説明している。Lean は、Claude がどう考えたかとは関係なく、書き直された証明を一行ずつ規則に照らす。

Lamzouri の証明も、Claude から独立している。数学者の Lamzouri は行列を使わずに、Claude と同じ割合にたどり着いた。仮に Claude の証明のどこかに誤りがあっても、Lamzouri は別の道で証明したので、その誤りを受け継がない。

図 2 AIの内側の確かめと、外側の確かめ
AI の内側AI の外側検証役13同じ Claude反例探し内側の確かめ自前の再証明内側の確かめLeanの検査小さな信頼核社内外の数学者4人論文を読む別の道の証明LamzouriAI の内側AI の外側検証役13同じ Claude反例探し内側の確かめ自前の再証明内側の確かめLeanの検査小さな信頼核社内外の数学者4人論文を読む別の道の証明Lamzouri
上の段は同じモデルの中の確かめで、下の段は AI から独立した確かめである。受け入れの根拠になるのは下の段だ。

Alpöge と Furman は、Claude とは別に証明を読んだ人間である。ただし 2 人は、結果を発表した Anthropic の社員でもある。社外の Conrey と Goldston がどんな結論を出したのかを、私は確かめられていない。

05Claudeが動かした約60のエージェントのうち、鍵の発想を出したのは2つだった

Claude の作業の経過は、数えられる記録として残っていた。私は、この記録が、外の人が Claude の経過を追う手がかりになると考える。Anthropic が公表した記録の中身を見る。

Anthropic の報告によると、Claude は 2 回の作業で 3,100 万の出力トークンを使った。1 回目の作業で Claude が試した 650 の案は、すべて失敗した。

2 回目の作業で、Claude は約 60 の小さなエージェントを動かした。Anthropic は、60 のエージェントが何をしたかを数で公表している。

①

鍵の発想を出した

2 つ。2 つのエージェントが、中心となる数学の発想を組み立てた。

②

発想を渡した

13。13 のエージェントが、中心の 2 つに発想を送った。

③

発想に至らなかった

30。新しい発想を探したが、どのエージェントも出せなかった。

④

検証した

13。13 のエージェントが証明を確かめ、別の 2 つが論文の下書きを手伝った。

2 回目の作業では、コンピュータへの命令が 2,400 回実行された。Anthropic は、鍵の発想を出した 2 つのエージェントだけを見せたのではない。何も出せなかった 30 のエージェントも、数に入れて公表した。

外の数学者は、Anthropic の記録を読めば、Claude がどこで何を試し、どこで行き詰まったかを追える。Anthropic が失敗の数まで公表したことは、外で確かめる人の助けになると私は考える。

06受け入れの決め手は、独立した確かめ、残された経過、査読の時間

650 の失敗案と 2,400 回の命令が記録に残り、外の数学者が経過を追える形になった。私はここから、AI の成果を受け入れるときの決め手を三つ取り出す。

エージェントの「検証済み」は、受け入れの根拠にならない

Claude の結果を最初に確かめた 13 の検証役は、Claude 自身のエージェントだった。Claude の外から結果を確かめたのは、Lean と Lamzouri である。AI エージェントが「検証済み」と報告してきても、受け取る人はその報告だけで成果を受け入れられない。受け取る人は、AI の外の誰か、または何かが確かめたかを尋ねることになる。

成果と一緒に、途中の記録を求める

Anthropic は、650 の失敗案と、60 のエージェントの役割の内訳を公表した。外の数学者は、Anthropic の記録を手がかりに経過を追える。AI に仕事を頼む人は、成果物だけでなく、AI が何を試して何に失敗したかの記録も受け取っておくとよい。記録が無いと、外の人は結果だけを前にして一から確かめ直すしかない。

機械の検査が済んだ日と、数学界が結果を受け入れる日は別である

Lean による検査は、Anthropic が 8 月 10 日に発表した時点で済んでいた。数学者の Lamzouri の証明は、その 3 週間あまり後に出た。学術誌の査読は、まだ終わっていない。Clay 数学研究所の懸賞の規則は、論文の掲載から少なくとも 2 年がたち、数学界で広く受け入れられることを求めている。この規則は予想そのものの解決に向けたものだが、機械の検査とは別に、数学界の受け入れを条件に置いている。Lean の検査が通った日と、数学界が結果を受け入れる日は、別の日である。

図 3 頼んでいない成果を受け入れる前の手順
まだ成果を受け取る経過の記録も求める独立に確かめたか機械の検査形式化できる範囲外部の人が読む別の道で再現条件付きで使う査読まで留保まだ成果を受け取る経過の記録も求める独立に確かめたか機械の検査形式化できる範囲外部の人が読む別の道で再現条件付きで使う査読まで留保
同じ AI による検証の報告は、分かれ目の手前で止める。機械と人の確かめを経た後も、査読までは条件付きで扱う。

Claude の結果は、AI の外からの確かめを通り、作業の記録も公表されている。学術誌の査読だけが、まだ終わっていない。

07学術誌の査読が終わるまで、Claudeの67%台は数学界の受け入れの途中にある

Claude の結果に残っているのは、学術誌の査読だけである。査読を待つあいだに何が起こりうるかを見ておく。

Claude の論文も Lamzouri の論文も、いまは査読前の原稿である。学術誌の査読者がどう判断するかは、まだ分からない。私は、査読の結果を予想しない。

①

学術誌の査読

Claude の論文も Lamzouri の論文も、査読の結果はまだ出ていない。

②

予想への道

Anthropic は、Claude の手法で予想が解けるとは見ていないと書いた。

Claude はリーマン予想の証明に失敗し、その途中で割合の記録を上げた。67% 台という数字は、予想を解くための近道として出てきたものではない。

AI が数学の結果を出す速さに、学術誌の査読がどう追いつくのかも、まだ確かめられていない。今回、Anthropic が Claude の結果を発表してから、数学者の Lamzouri が別の証明を出すまでは 3 週間あまりだった。Clay の規則が求める時間は、年の単位で数える。査読にかかる時間は、この記事の資料からは分からない。AI と査読の速さの差が縮まるのか広がるのかを示す資料は、まだ無い。

Key Points ── 持ち帰る 3 つ
  1. Claude の結果を最初に調べた 13 の検証役は Claude 自身で、外から確かめたのは証明検査ソフト Lean と数学者 Lamzouri だった。エージェントの「検証済み」は、受け入れの根拠にならない。
  2. Anthropic は 650 の失敗案と 60 のエージェントの役割を公表し、外の数学者が経過を追える形になった。成果と一緒に、経過の記録を求めることになる。
  3. Claude の結果は学術誌の査読前である。Clay 研究所の懸賞の規則は、掲載から 2 年と数学界の広い受け入れを求める。早い確かめと遅い確かめは、別のものとして扱う。
結語

AI が頼まれていない成果を出してきたとき、私たちがそれを正しいと言えるのは、AI の外の確かめを通ったときである。同じ AI の中で行われた検証は、外の確かめに入らない。

Claude が出した 67% 台という結果は、証明検査ソフト Lean による機械の検査と、数学者 Lamzouri による別の証明を通った。残るのは、学術誌の査読という時間のかかる確かめである。Lean の検査と別の証明が早く済んでも、それで査読が済んだことにはならない。

出典·参考文献
  1. Live Science. 'This is what happened with Claude and me': AI's failed attempt to crack the Riemann hypothesis led mathematician to a breakthrough. 2026-10-01.(出来事の報道。Lamzouri の関与と 67.25% という数字)
  2. Anthropic. Learning more about Claude's mathematical capabilities. 2026-08-10.(41.6% から 67.2% への改善、650 の失敗案、エージェントの内訳、Lean と数学者による確かめ)
  3. Youness Lamzouri. A new proof that more than 2/3 of the zeros of the Riemann zeta function are simple and on the critical line. arXiv, 2026-09-02.(行列を使わない別の証明)
  4. Channel Insider. Unreleased Claude Model Makes Breakthrough on 167-Year-Old Math Problem. 2026-08-17.(学術誌の査読前であること、社外の専門家への共有)
  5. Clay Mathematics Institute. Riemann Hypothesis. 2026-10-03 閲覧.(予想の定義と、最初の 10 兆個の零点の確認)
  6. Lean FRO. Lean: Programming Language and Theorem Prover. 2026-10-03 閲覧.(小さな信頼核による証明の検査)
  7. Clay Mathematics Institute. Rules for the Millennium Prize Problems. 2026-10-03 閲覧.(掲載後 2 年と数学界の受け入れという懸賞の条件)