1. 同じ中身なのに、書き方で点数が変わる

論文の査読に LLM を使う動きは、もう試行の段階を越えつつある。投稿前の自己点検に使う研究者もいれば、査読コメントの下書きに使う場面もある。そこで気になるのが、AI の査読者が科学の中身ではなく、書きぶりに反応していないかという点である。

著者らが問題にしているのは、まさにこの点だ。同じ実験、同じ結果、同じ結論を報告している原稿でも、言い回しを変えると AI 査読者の判定が変わることがある。そうなると、研究を良くするより、文章を AI 好みに整えるほうが得になる。著者らはこれを「修辞の最適化が科学の改善より報われる」おそれとして書いている。[1]

ただし、言い回しに揺れないことだけを求めると別の落とし穴がある。どんな原稿にもほぼ同じ点を付ける査読者は、言い回しには揺れないが、良い論文と悪い論文の区別もできない。この論文は、この二つを同時に満たすことを求めている。一次情報は arXiv に公開されたプレプリントで、査読前の段階にある。

2. 提案の芯は、全文の判断と「科学の芯」の判断を平均すること

著者らはまず、評価の目標を定義し直した。Rhetorical Robustness(修辞への頑健さ)と名づけ、内容を保ったままの書き換えに対して判定が安定していることと、別の論文どうしをきちんと見分けられることの、両方を同時に満たす要件とした。

そのうえで提案されたのが SciCore である。芯は一つに絞れる。原稿全体を読んで下す判断と、原稿から抜き出した構造化された「科学の芯」だけを読んで下す判断を、二本立てで出して平均するという設計である。後者は、問い・方法・結果といった中身を一定の形に整えたものを見るので、言い回しの差が入りにくい。前者は原稿全体の出来も見る。両方を合わせることで、原稿としての評価を残しながら、書きぶりへの敏感さを下げることを狙っている。

評価のための土台として、著者らは RobustReview というベンチマークも作った。原稿の全文を対象にし、内容を保った書き換え版を含めて 1,260 の原稿版を用意し、30 通りの査読者の構成を比べている。

3. abstract の範囲で示されたこと

ベンチマークからは三つのことが報告されている。第一に、見かけの頑健さがあった。書き換えへの反応が小さい査読者の中に、実は論文をまたいで点数がつぶれている、つまりどの論文にも似た点を付けているだけのものがあった。第二に、人間の査読者との一致度で並べた順位と、修辞への頑健さで並べた順位は一致しなかった。第三に、「中身に注目せよ」と指示するプロンプトの工夫は、バックボーンのモデルによって効いたり効かなかったりで、一貫した改善にはならなかった。

SciCore については、主に GPT-5.5 をバックボーンにした比較で、安定性と識別力を合わせた形で比べた査読者の中で最も良い位置にあり、人間との一致度も見劣りしなかった、と著者らは書いている。安定性と識別力の具体的な値、他の構成との差の大きさは abstract には書かれていない。

著者らの結論は、修辞への頑健さは人間との一致度とは別の評価目標として扱うべきだ、というものである。SciCore については「改善しうる可能性を示した」という控えめな言い方にとどめている。

4. 具体例で見る ── 社内文書の一次チェックを AI に任せたとき

研究報告書や申請関連文書の下書きを、AI に一次チェックさせる場面を考える。同じデータと同じ結論を持つ二つの版があり、一方は書き慣れた担当者が整えた文章、もう一方は箇条書きの多い粗い文章である。

確認担当:この二つ、中身は同じなのに AI の評価が違いますね。整った方は「論旨が明確」、粗い方は「根拠が不十分」と出ています。

品質保証:根拠の表は両方とも同じものを貼っているはずです。だとすると、AI は根拠ではなく書きぶりを見ている可能性がある。

確認担当:では評価が揺れないように、「中身だけを見て」と指示を足しますか。

品質保証:それで揺れが消えても安心はできません。どの文書にも同じ評価を返すようになっただけかもしれない。中身の違う文書を混ぜて、ちゃんと差が出るかも確かめる必要があります。

この会話の後半が、論文の言う「見かけの頑健さ」にあたる。揺れないことと、見分けられることは、別々に確かめなければならない。そしてこの論文の範囲では、プロンプトで「中身を見よ」と指示するだけでは、揺れの改善が安定しなかった。

5. 新しくない部分と、abstract から読み取れない限界

LLM に論文へのフィードバックを書かせ、人間の査読コメントとどれだけ重なるかを調べる研究は、以前からある。[3]研究の立案から論文執筆、自動査読までを一続きにする試みも報告されている。[4]入力を言い換えて出力の揺れを見る、という検査の考え方自体も、言語モデルの評価では広く使われてきた。この論文の寄与は、揺れないことと見分けられることを一組の要件として定義し、原稿全体を対象にした比較の場を作った点にある、と読める。

限界はいくつかある。第一に、SciCore の優位は主に一つのバックボーンでの比較として報告されており、他のモデルで同じ傾向が出るかは abstract からは分からない。第二に、「科学の芯」を抜き出す工程そのものが LLM に頼るなら、抜き出しの段階で中身を取りこぼしたり、書きぶりに引っ張られたりするおそれがある。その検証は abstract の範囲では示されていない。第三に、書き換え版がどのように作られ、内容が保たれていることをどう確かめたのかも、abstract には書かれていない。第四に、研究分野の範囲が示されておらず、臨床研究のような分野に同じ結果が当てはまるかは不明である。

なお「人間との一致度が見劣りしない」という言い方は、人間の査読者の判定を基準にしている。人間の査読者も書きぶりに影響されうるので、人間との一致が高いことは、そのまま書きぶりに揺れないことを意味しない。著者らが二つの順位が食い違ったと報告しているのは、この点を裏づける結果として読める。

6. この論文がいま目に留まった理由と、束になっていないこと

この論文は、Hugging Face の Daily Papers で 70 の upvote を集めた。[2]ただし upvote は読者が「読む価値がある」と投じた票であって、正しさや重要さを保証するものではない。当サイトの選定でも、この論文に立った signal は読者の票の系統だけで、公開実装の追随や報道の追随は確認されていない。

同じ問いを扱う論文の束もできていない。収集した論文の中で同じ主題に寄った論文は見つからず、束の大きさは 1 だった。つまり現時点では「AI 査読の頑健さ」という主題が一斉に立ち上がっている、とまでは言えない。一本の論文が話題になっている段階である。

それでも取り上げる理由は、AI に評価を任せる場面が研究の外にも広がっているからである。査読に限らず、文書の採点、申請の一次審査、提案書の比較など、LLM の判断を「審査」に使う場面は増えている。そこで書きぶりへの反応をどう測るかは、どの現場にも共通する問いになる。

7. 製薬・規制の現場から見ると

製薬の現場には、文書を評価する仕事が多い。プロモーション資材の審査、申請資料の品質確認、社内の研究計画の評価などである。ここに AI の一次チェックを入れる検討は各所で進んでいるが、この論文はその際に確かめるべき点を具体的にしている。

一つは、同じ中身を言い換えた文書で、判定が揺れないかを検査項目に入れることである。資材の審査では、表現の強さそのものが論点になる場面もあるので、何を「中身を保った書き換え」とみなすかは、評価する側が先に決めておく必要がある。もう一つは、揺れが小さいことを良い結果と早合点しないことである。問題のある文書と問題のない文書を混ぜた検査用の文書群で、判定に差が出るかを合わせて確かめる。この二つは、AI を使う仕組みの妥当性確認に組み込める。

SciCore の「中身を構造化して抜き出してから判断する」発想は、審査の現場で根拠資料と主張を突き合わせるやり方に近い。ただし抜き出しの段階の誤りが判定に直結するので、抜き出した結果を人が確かめられる形で残すことが前提になる。この論文はプレプリントであり、こうした運用上の効果はこの論文の範囲では確かめられていない。