まだ結果が存在しない計画を評価するとき、評価者が直接確認できるのは計画そのものだけである。研究計画なら、どの問題を解こうとしているか、提案した方法がその問題に対応しているか、既存研究との差が説明されているか、必要な実験や比較対象が想定されているかは、提案書を読んだ時点でも検討できる。一方、「この方法で性能がどれだけ上がるか」「必要なデータを本当に集められるか」「想定した評価方法で効果を識別できるか」「予定した時間と資源で研究を完了できるか」は、計画を書いた時点ではまだ観測されていない。評価者は、方法の妥当性、過去の研究、研究者の経験、必要資源など、現在利用できる情報から将来の結果を推定することになる。
この違いがあるため、提案評価と成果評価では参照する証拠が異なる。すべての研究案を実行してから採否を決めることはできないので、研究費配分、研究テーマ選定、実験計画の承認では事前評価が必要になる。その時点で評価対象となるのは、現在存在する提案の内容と、そこから予測される将来成果までである。実行が始まれば、性能、比較結果、必要工数、データ取得の成否、想定外の制約といった新しい情報が発生する。事前評価で高く評価された提案が実行後にも同じ評価を維持する保証がないのは、評価者の判断だけでなく、評価に利用できる証拠そのものが増えるためである。
この関係を具体的に追跡したのが、LLM が生成した研究アイデアと人間研究者が作った研究アイデアを比較した二つの研究である。第一の研究では、まだ実行されていない研究案を専門家が評価し、LLM 案は人間案より新規性を高く評価された。続く研究では、その案を研究者へ割り当て、実験、実装、評価を実際に行ったうえで、完成した研究成果を別の専門家が評価した。この二段階を比較すると、AI と人間の順位とは別に、提案段階では予測としてしか扱えなかった性質が、実行後には実測結果として評価可能になるという差が現れる。その情報の追加によって評価がどのように変化したかを観察できる。
1. 提案には、今評価できるものと未来を予測するしかないものがある
1.1 研究計画には二種類の情報が混在する
研究計画には、提案書が完成した時点ですでに存在する情報と、研究を実行しなければ得られない情報が同じ文章の中に並んでいる。解こうとしている問題は何か、提案した方法はその問題へ対応しているか、既存研究との差はどこにあるか、必要な実験や比較対象が計画されているかは、提案書そのものを対象として評価できる。研究者が何をしようとしているかを確認するために、実験結果が出るまで待つ必要はない。
計画の価値を判断するときには、将来の実行を予測して評価する性質も対象になる。「この手法なら既存手法より精度が上がる」「この実験なら仮説を検証できる」「この規模なら必要な統計的検出力を得られる」「予定したデータ量を確保できる」といった判断である。これらは計画の中では将来形で書けるが、評価時点ではまだ実測値を持たない。方法の理論的根拠、既存研究の結果、類似した実験の実績、研究者の経験などから、成功する可能性を推定している。
この二種類を分けることで、「研究計画を高く評価した」という表現の中にある、現在確認した事実と未来に対する予測を区別できる。たとえば、既存研究との差が明確であることは提案書から確認できる。その差が実際の性能改善につながるかは実験による確認が必要である。必要な比較実験が計画されていることは確認できても、その比較で想定した差が観測されるかは別の問いである。
| 評価対象 | 実行前 | 実行後 |
|---|---|---|
| 問題設定と方法の整合性 | 問題と提案方法の対応を提案書から評価できる。 | 実際の実験結果を踏まえ、方法が問題解決へどこまで寄与したかを再評価できる。 |
| 新規性 | 既存研究との差、方法の組み合わせ、着眼点から評価できる。 | 実際に成立した手法や得られた結果を含め、既存研究との差を再評価できる。 |
| 期待される効果 | 理論、過去の研究、類似事例から将来の効果を予測する。 | 実測した効果量、比較対象との差、再現性などを評価できる。 |
| 実行可能性 | 必要な人員、時間、計算資源、データ、評価手順から成立可能性を推定する。 | 実際の工数、データ取得、実装、評価手順の成否を確認できる。 |
| 研究成果 | 成果がまだ存在しないため、想定される結果としてしか扱えない。 | 論文、実験結果、コード、データ、追加分析などを直接評価できる。 |
表の左右にある項目名は共通していても、評価に使える証拠は異なる。新規性なら、実行前には「この発想は既存研究と違う」という計画上の差を評価する。実行後には、その発想が実際に成立したか、追加された実験によって既存研究との差が維持されたかまで確認できる。実行可能性も、事前には資源と工程から推定するしかないが、事後には「必要なデータを取得できたか」「予定した評価を実施できたか」という実績が存在する。
同じ「研究アイデアの評価」という名称であっても、実行前と実行後では評価対象の情報量が異なる。事前評価には、現在確認できる提案の性質と、将来その案を実行したときに起こる結果の予測が重なっている。実行後には、その予測の一部が観測結果へ置き換わる。この変化を無視すると、事前の高評価を完成した研究成果への高評価と取り違えることになる。
1.2 将来性の評価は、完成品の評価とは違う
未完成の候補から将来の成果を予測する難しさは、研究計画以外にも現れる。Justin M. Berg は、まだ発展させていない初期アイデアを参加者自身に順位付けさせ、その後に実際に発展させた成果の創造性と比較する実験を行った。五つの実験を通じて、参加者は最も潜在性の高い初期アイデアを低く順位付けする傾向を示し、事前に二番目と考えたアイデアが最終的には最も創造的になる傾向が報告された[1]。
この実験で重要なのは、評価時点では最終的な成果物そのものがまだ存在していなかったことである。初期アイデアには、発展させたときにどの性質が伸びるか、どの制約によって行き詰まるか、制作過程でどの修正が加わるかといった情報が含まれていない。そのため、評価者は現在のアイデアの見え方から、後の成果を推定する必要がある。
完成した二つの成果物を比較する場合、評価者は両方の結果を直接観察できる。未完成の候補を比較する場合には、一方または両方について、まだ存在しない性質を補って判断しなければならない。この差によって、現在もっとも完成度が高く見える案と、発展後にもっとも高い成果へ到達する案が一致しないことが起こる。
研究提案でも構造は同じである。新規性や論理整合性の一部は現在の提案から確認できるが、実際の性能、必要工数、比較結果、評価方法の成立性は将来の実行へ依存する。事前評価は、「現在提示されている計画としてどう見えるか」と「この計画を実行した場合、どの程度の成果へ到達すると予測できるか」という二つの問いを含む。
この区別を置くと、事前評価と事後評価の差は単純な採点誤差より広い問題になる。実行前には予測しかできなかった項目が、実行後には観測可能になるからである。事前評価の精度を考えるには、提案時の点数と、その提案を実際に発展させた後に予測がどこまで維持されたかを対応付けて追跡する必要がある。
2. 専門家による研究提案の評価にも、予測できる範囲と限界がある
2.1 研究費の審査は、成果が存在する前に行われる
科学研究では、成果が得られる前に研究の価値を判断することが制度として組み込まれている。米国国立衛生研究所(NIH)の競争的研究費では、申請された研究計画に対して二段階の査読が行われ、第一段階では研究分野の専門家が科学的・技術的価値を評価する。NIH Grants Policy Statement では、この査読を研究費申請の評価手続きとして位置づけ、専門家による科学的評価と、その後の資金配分判断を分けている[2]。
この順序には研究費配分固有の制約がある。研究には、人員、実験設備、データ取得、計算資源などの費用が必要になるため、成果を確認してから研究開始時の資金を配ることはできない。資金提供者は、まだ実験結果が存在しない段階で、どの研究へ有限の資源を配分するかを決めなければならない。そのため査読者は、問題の重要性、研究方法、実行可能性、想定される成果など、提案書から確認できる情報を使って、実行後にどの程度の成果へ到達し得るかを判断する。
研究費審査は、現在の計画から将来成果を推定したうえで資源配分を決める工程である。提案書の内容が具体的であっても、実験結果、効果量、再現性、予定したデータ取得の成否はまだ観測できない。研究費審査が必要になるのは成果が未確定だからであり、同時に、その未確定な成果を予測しなければ研究を開始できないからでもある。
2.2 事前評価には将来成果に関する情報も含まれている
事前評価には、将来成果を直接観測できない段階でも一定の識別力が含まれ得る。Danielle Li と Leila Agha は、1980 年から 2008 年までに NIH が資金提供した主要な研究助成枠 R01 を 13 万件以上追跡し、専門家による事前評価と、その後の研究成果との関係を調べた。対象となった成果には、論文数、引用数、高被引用論文、特許が含まれる。事前評価が良かった申請ほど、その後の成果も高い傾向があり、この関係は研究者の過去の業績や所属機関などを調整しても残った[3]。
この結果から、専門家による事前評価には将来成果と関係する情報が含まれていると読める。査読者は、提案された問い、方法、研究者の準備状況などから研究案ごとの差を読み取っている。実行前の情報しか使えなくても、その差から将来成果の違いをある程度識別できる。
ただし、「評価が良い申請ほど平均的には成果が高い」という関係と、「個々の申請を将来成果の順番どおりに並べられる」という能力は異なる。前者は集団としての関連を示すが、後者には、似た水準の研究案の中から将来もっとも大きな成果を出すものを細かく識別する精度が必要になる。事前評価に予測情報が含まれることを確認しただけでは、その順位を完成後の成果順位として扱う根拠にはならない。
2.3 上位候補の細かな順位まで将来成果を予測できるとは限らない
Ferric C. Fang らは、NIH の研究費データのうち上位 20 パーセンタイルに入った 102,740 件を分析し、事前のパーセンタイル順位と、資金提供後の論文数や引用数との関係を調べた。事前順位と成果指標の間には関係が残ったものの、その識別力は小さかった。特に引用成果について、事前順位によって説明される分散は小さく、一定水準以上の研究提案の中で、数ポイントの順位差から将来の生産性を精密に識別する能力には限界があると報告している[4]。
この結果が示すのは、事前評価の識別力の限界である。採択水準から大きく離れた案を選別することと、すでに高い評価を得た案どうしを将来成果の順番に並べることでは、必要な識別精度が異なる。Fang らの分析だけから識別力が小さい原因までは特定できないが、少なくとも、上位候補の事前順位を完成後の成果順位として扱えるほど強い関係は確認されていない。
Elizabeth L. Pier らは、同一の NIH 研究費申請を複数の専門家に評価させ、評価者間の一致度を調べた。同じ申請書と評価基準を与えても、総合評価の一致度は低かった[5]。評価者ごとに専門知識や重視する論点が異なれば、同じ提案書から抽出する情報と、その情報に付ける重みも変わる。未来の成果を直接確認できない状況では、この判断差がそのまま評価差として表れる。
NIH の事例から確認できるのは、専門家による事前評価には二つの性質が同時にあることである。第一に、事前評価はその後の研究成果と一定の関係を持ち、候補選択のための情報として機能する。第二に、その関係は個々の研究案の将来成果を精密に確定できるほど強いものではなく、同じ提案に対する専門家の判断にも幅がある。研究提案の評価は、完成前の限られた情報から将来成果を見積もり、資源配分を決める工程なのである。
3. LLM の研究アイデアは、実行前には人間案より新規性を高く評価された
3.1 研究アイデアの出所を伏せて専門家が評価した
事前評価が将来成果をどこまで予測できるかという問題を、LLM と人間の研究アイデアを使って調べたのが、Chenglei Si、Diyi Yang、Tatsunori Hashimoto による ICLR 2025 の研究である。対象は自然言語処理(NLP)の研究アイデアで、100 人を超える研究者がアイデア作成または評価に参加した。人間側では専門研究者が研究案を作成し、AI 側では LLM を中心とした研究アイデア生成エージェントが同じ研究テーマに対する案を生成した[6]。
比較するときに重要なのは、評価者が案の作成者を知らされていなかったことである。評価者には、人間が書いた案なのか、LLM が生成した案なのかを伏せた状態で研究提案を提示した。これにより、「AI が作った案だから高く評価する」「人間研究者が作った案だから信頼する」といった出所に対する先入観をできるだけ切り離し、提案書として読んだときの評価を比較できるようにした。
評価軸には、新規性、研究としての魅力度、実行可能性、期待される有効性、総合評価などが含まれた[6]。これらは同じ「研究アイデアの評価」に見えても、評価している性質は異なる。新規性なら既存研究との差を提案書から比較できる。研究としての魅力度は、その問いや結果が研究コミュニティーにどの程度の関心を持たれ得るかを判断する。実行可能性では、必要なデータ、計算資源、実験手順などから、計画が現実に遂行できるかを推定する。期待される有効性は、まだ得られていない実験結果を含むため、将来成果についての予測がより大きく入る。
この実験で比較された対象は、研究を始める前の提案である。評価者が見ているのは、問題設定、方法、想定される結果、必要な実験などを文章化した計画であり、実測性能や失敗した実験、追加された比較、予定外に必要となった作業はまだ存在しない。第 2 章で見た研究費審査と同じく、現在確認できる提案の性質と、実行後の成果についての予測が一つの評価の中に含まれている。
3.2 LLM 案は新規性で統計的に有意に高く評価された
この事前評価では、LLM が生成した研究アイデアは、人間の専門研究者が作成したアイデアより新規性を統計的に有意に高く評価された[6]。少なくとも提案書を読んだ段階では、専門家は LLM 案に、人間案より既存研究との差が大きい、新しい着眼点を含んでいると判断したことになる。
この結果は、LLM 案が人間案と比較しても新規だと認識される内容を含み得ることを示している。実行可能性については LLM 案の評価がやや低い傾向も報告された[6]。新規に見えることと、限られた資源や手順で実際に遂行できることは別の評価軸であり、LLM 案がすべての側面で一様に高く評価されたわけではない。
新規性の高評価が示す範囲は、提案段階で認識された新しさまでである。既存研究との違いは提案段階でも確認できるが、その新しい方法が実装できるか、比較対象より性能が向上するか、必要な実験を完了できるか、得られた差が統計的・実質的に意味を持つかは、まだ観測されていない。提案書に書かれた新規な発想と、その発想を実行して得られる成果の品質の間には、実験と検証の工程が残っている。
期待される有効性や実行可能性には、この未観測部分がさらに大きく入る。「この方法なら有効であるはずだ」という判断は、理論や既存研究を根拠にできても、最終的には実験結果によって確かめる必要がある。「この研究は実行可能である」という判断も、計画されたデータ取得、実装、評価が予定どおり成立することを前提としている。事前評価が高いほど将来の成功可能性を高く見積もっているとしても、その予測が実際に維持されるかは別に測らなければならない。
第一研究が明らかにしたのは、実行前の研究アイデアという条件では、LLM 案が少なくとも新規性について人間案より高く評価され得るということである[6]。同時に、この研究設計だけでは、その評価が実行後の研究成果まで維持されるかを確認できない。事前評価と事後評価の関係を調べるには、高く評価された案を実際に研究へ変え、実験結果や比較結果が存在する状態でもう一度評価する必要がある。
そこで残る問いは、LLM 案の新規性や期待される成果への評価が、実行という工程を通過した後にも保たれるかである。提案段階では予測だった実行可能性や有効性が実測可能になったとき、評価がどの程度変化するのか。この問いを直接追跡したのが、同じ研究グループによる次の実行研究である。
4. 研究案を実際に実行すると、AI 案の評価は大きく下がった
4.1 43 人の研究者が割り当てられたアイデアを実行した
第一研究で分かったのは、実行前の提案書を読んだ専門家が、LLM 案の新規性を人間案より高く評価したということだった。その評価が実際の研究成果まで維持されるかは、提案書を読むだけでは確認できない。方法が実装できるか、必要な実験を完了できるか、比較対象に対して期待した差が出るか、評価方法が実際にも成立するかは、研究を実行して初めて観測できるからである。
この未確認部分を追跡したのが、続く ICLR 2026 の研究である。研究では 43 人の専門研究者に、人間が作成した研究案または LLM が生成した研究案を無作為に割り当てた。参加者は平均 103 時間を費やして割り当てられた案を研究として実行した。実験や実装を進め、コードを作成し、得られた結果を 4 ページ以上の短い論文へまとめた。その後、58 人の専門研究者が研究案の出所を知らされない状態で完成したプロジェクトを評価し、合計 181 件のレビューが集められた[7]。
この実験設計によって、同じ種類の研究案について二つの時点を比較できる。第一の時点では、研究アイデアとして提示された段階の評価を見る。第二の時点では、そのアイデアを研究者が実際に遂行し、実験結果やコードが存在する状態での評価を見る。人間案は 19 件、AI 案は 24 件で、新規性、研究としての魅力度、有効性、総合評価という共通する四つの評価軸について、実行前後の変化が比較された[7]。
| 段階 | 評価者が確認できる主な情報 |
|---|---|
| 実行前 | 問題設定、提案方法、既存研究との差、想定する実験、期待される結果などを研究計画から評価する。 |
| 実行後 | 実行前の情報に加えて、実験結果、比較対象との差、実装上の制約、追加分析、評価方法の成否などを確認できる。 |
この設計によって、二つの集団の最終点数と、実行前後の評価変化をともに測定できる。研究案が高く評価されたあと、実行を通じてその評価がどの程度維持されたかを追跡できるからである。第二研究の焦点は、AI 案と人間案の最終的な順位よりも、提案段階の期待と実行後の評価との間にどれだけ差が生じたかに置かれている。
4.2 AI 案では四つの評価軸すべてで低下幅が大きかった
実行前後の変化を見るため、研究者らは実行後の評価から実行前の評価を引き、その差を「アイデア段階と実行段階の評価差(ideation-execution gap)」として比較した[7]。値が 0 に近ければ、提案段階の評価が実行後までおおむね維持されたことになる。負の値が大きいほど、提案時には高く評価されていたものが、実行後にはそれだけ低く評価されたことを示す。
| 評価軸 | 人間案の変化 | AI 案の変化 | 群間差 | 偽発見率(FDR)補正後 p 値 |
|---|---|---|---|---|
| 新規性 | -0.010 | -1.049 | 1.039 | 0.025 |
| 研究としての魅力度 | +0.078 | -1.760 | 1.835 | 0.001 |
| 有効性 | -0.052 | -1.879 | 1.827 | 0.003 |
| 総合評価 | -0.628 | -1.976 | 1.348 | 0.004 |
人間案では、新規性は -0.010、研究としての魅力度は +0.078、有効性は -0.052 であり、三つの指標は実行前後でほぼ同じ水準にとどまった。総合評価は -0.628 と低下しているが、他の三つほど大きな変化ではない。AI 案では、新規性が -1.049、研究としての魅力度が -1.760、有効性が -1.879、総合評価が -1.976 と、四つの指標すべてで明確な低下が見られた[7]。
重要なのは、AI 案の点数低下が、人間案との比較でも大きかった点である。群間差は新規性で 1.039、研究としての魅力度で 1.835、有効性で 1.827、総合評価で 1.348 となり、FDR 補正後の p 値はすべて 0.05 を下回った[7]。四つの評価軸すべてで、AI 案の評価低下幅が人間案より統計的に有意に大きかった。
この結果には二段階の変化が含まれている。第一に、実行前には AI 案が新規で魅力的、有効になり得る研究計画として評価されていた。第二に、実験、比較、実装、評価を実際に行うと、それまで予測だった部分が実測可能になり、その追加情報を踏まえた評価では事前の期待が大きく維持されなかった。AI 案では、この「提案時の期待から実行後の評価への移動」が、人間案より大きかった。
ただし、この数値は「すべての AI 案が失敗した」ことを意味しない。示されているのは各群の平均的な変化であり、個々の研究案には異なる結果が含まれる。また、AI 案の評価が下がったという事実だけから、その原因を一つに特定することもできない。提案された方法そのもの、比較対象、実験設計、必要資源、評価方法など、実行を通じて初めて確認できる複数の要素が最終評価に影響し得る。
第一研究の結果との対比は明確である。実行前の専門家評価では、AI 案は少なくとも新規性について人間案より高く評価された。それを実際に研究へ変えると、同じ AI 案の評価は人間案より大きく低下し、事前評価で観測された優位は実行後まで維持されなかった。
4.3 実行後の平均点は逆転したが、人間優位そのものは有意ではない
実行前後の平均点をそのまま並べても、変化の方向は確認できる。第二研究で実際に実行された 43 件に限ると、実行前には AI 案の平均点が、新規性、研究としての魅力度、有効性、総合評価の四つすべてで人間案を上回っていた。しかし、実行後には四つすべてで順位が逆転し、人間案の平均点が AI 案を上回った[7]。
| 評価軸 | 人間案・実行前 | AI 案・実行前 | 人間案・実行後 | AI 案・実行後 |
|---|---|---|---|---|
| 新規性 | 4.912 | 5.778 | 4.903 | 4.729 |
| 研究としての魅力度 | 4.404 | 5.653 | 4.482 | 3.896 |
| 有効性 | 4.833 | 6.003 | 4.782 | 4.125 |
| 総合評価 | 4.596 | 5.382 | 3.968 | 3.406 |
たとえば有効性では、実行前の平均点は人間案が 4.833、AI 案が 6.003 であり、AI 案が約 1.17 点高かった。実行後には人間案が 4.782、AI 案が 4.125 となり、平均値の順序は逆転している。研究としての魅力度でも、実行前は AI 案が 1 点以上高かったが、実行後には人間案が上回った。平均値だけを見れば、「実行すると人間案のほうが高く評価された」と読める。
しかし、この平均順位の逆転と、「人間案が AI 案より統計的に有意に優れていた」という結論は分けて読む必要がある。43 件の研究案を単位として実行後の人間案と AI 案を直接比較すると、新規性、研究としての魅力度、有効性、総合評価の四つすべてで群間差は統計的に有意ではなかった[7]。
第二研究では 58 人の評価者から 181 件のレビューが集められているため、一つの研究案に複数のレビューが付いている。181 件のレビューをそれぞれ独立した観測として扱う分析では一部の指標で有意差が出るが、同じ研究案への複数評価を完全に独立した研究成果として数えることはできない。研究者らは、研究案単位で比較した場合にはサンプル数が 43 件に限られ、実行後の人間案と AI 案の差を直接検出するには統計的検出力が十分ではないと説明している[7]。
| 読み取れること | 統計結果との対応 |
|---|---|
| AI 案の評価は実行後に大きく低下した | 四つの評価軸すべてで、AI 案の実行前後の低下幅が人間案より有意に大きい。 |
| 実行後の平均点では人間案が上回った | 四つの評価軸すべてで平均値の順位が逆転している。 |
| 人間案が実行後に AI 案より優れていると確定した | 研究案単位の直接比較では有意差が確認されていないため、この結論までは導けない。 |
この区別を保たないと、第二研究の結果を必要以上に強く読むことになる。統計的に明確なのは、AI 案の事前評価から事後評価への低下幅が、人間案より大きかったことである。実行後の平均値は人間案が上回ったが、その差そのものを人間優位の確定的な証拠とするには、この研究のサンプル数では足りない。
第一研究と第二研究をつなぐと、より限定された結論が得られる。LLM が生成した研究案は、実行前には少なくとも新規性について人間案より高く評価された。その案を研究者が実際に遂行し、実験結果を含む成果物として評価すると、事前の高評価は人間案より大きく低下した。次に問うべきなのは、この評価変化を「最初の評価が間違っていた」とだけ理解してよいのか、それとも実行によって評価可能な情報そのものが変化したと考えるべきなのかである。
5. 実行すると、評価者が利用できる情報そのものが増える
5.1 実行前の仮定が、実測結果へ置き換わる
実行後に評価が変わる直接的な理由は、提案段階では存在しなかった情報が新たに発生することである。研究計画に「この方法なら既存手法より改善する」と書かれていても、実行前に確認できるのは、その改善が起こりそうだという根拠までである。実行後には、実測した性能差、比較対象ごとの結果、条件を変えたときの変化などを確認できる。「この評価方法なら効果を測れる」という計画も、実行前には方法としての妥当性を判断するしかないが、実行後には必要な評価者を確保できたか、指標が研究目的に対応したか、評価値が安定して得られたかまで確認できる。
この変化では、情報量の増加と同時に、提案時には一つの仮定だったものが実行を通じて複数の観測結果へ分解される。たとえば「実行可能である」という一文は、実際には、必要なデータを取得できる、実装できる、計算資源が足りる、評価者を確保できる、予定した期間内に完了できるといった複数の条件から成り立っている。提案段階ではこれらをまとめて一つの見積もりとして扱えても、実行後には各条件の成否を別々に確認できる。
第二研究では、実行者が元の研究案をどの程度変更したかも調べている。人間案では平均 2.9 件、AI 案では平均 3.1 件の変更が加えられており、その多くはデータセット、モデル、評価指標、ハイパーパラメーター、比較対象などの実験詳細だった。提案されたアルゴリズムそのものを別の方式へ置き換えるような変更は報告されていない[7]。
この結果から、実行段階の中心は、提案時には十分に決まっていなかった実験条件を現実に合わせて具体化する過程だったと読める。どのデータセットを使うか、どの比較対象を採用するか、どの指標で評価するかという選択は、研究結果の解釈に直接影響する。提案書では成立しているように見えたアイデアでも、実行時に必要な条件を具体化した結果、当初の期待を支えられなくなることがある。
AI 案のうち 6 件では、提案されていた人間による評価が実行時に自動評価へ変更されていた[7]。人間評価には、評価者の募集、謝礼、時間調整、評価基準の統一などが必要になる。提案段階では「人間に評価してもらう」と一行で書けても、実際には費用と時間を伴う工程である。研究期間と予算の制約に入ったとき、その工程を維持できず、自動評価へ変更した事例が生じた。
ただし、この 6 件だけで AI 案の評価低下を説明することはできない。研究者らは、この 6 件を除外した場合でも、AI 案の実行前後の評価低下が人間案より大きいという主要結果が維持されることを確認している[7]。人間評価の実施困難は、実行によって顕在化した具体的な制約の一つではあるが、全体の差を生んだ単一原因ではない。
| 提案段階の記述 | 実行後に確認できる内容 |
|---|---|
| 既存手法より改善する | どの比較対象に対して、どの指標で、どれだけ改善したかを実測できる。 |
| 人間評価で有効性を確認する | 評価者を確保できたか、評価手順を実施できたか、評価結果が安定したかを確認できる。 |
| 十分な比較実験を行う | どの比較対象を実際に用いたか、より強い比較対象を追加したときにも優位が残るかを確認できる。 |
| 実行可能である | 必要なデータ、計算資源、実装時間、評価工程を実際に確保できたかを確認できる。 |
実行の役割は、提案書の中で一つにまとめられていた仮定を、現実の条件ごとに分解することにある。その結果、提案時には見えなかった制約が表面化し、評価者は当初より具体的な根拠を使って研究を判断できるようになる。
5.2 同じ評価軸でも、実行前後で参照している証拠が違う
実行前後で評価項目の名前が同じでも、評価者が参照できる証拠は実行後に増える。実行前の評価者は、提案された方法、想定された実験、期待される結果を読む。実行後の評価者は、それらと併せて、実験設計が実際にどう組まれたか、どの比較対象を使ったか、どの追加分析を行ったか、どの程度の性能が得られたかを確認できる。
第二研究のレビューコメント分析でも、この差が現れている。実行後の評価では、実験設計、比較対象との比較、追加分析、実測性能といった要素が、評価理由としてより多く登場した[7]。提案段階では「何をする予定か」が中心だった評価が、実行後には「実際に何を行い、何が得られたか」を含む評価へ変わっている。
たとえば、新規性という同じ評価軸でも、実行前と実行後では根拠が異なる。実行前には、提案された着眼点や方法が既存研究とどれだけ違うかを評価する。実行後には、その新しい方法が実際に成立したか、必要な修正を加えた後にも既存研究との差が残っているか、得られた結果が単なる組み合わせ以上の価値を持つかまで確認できる。有効性についても、実行前には「有効である可能性」を評価するが、実行後には実測性能や比較結果を直接使える。
| 評価軸 | 実行前に主に参照する証拠 | 実行後に追加される証拠 |
|---|---|---|
| 新規性 | 提案された方法と既存研究との差を参照する。 | 実際に成立した方法、追加された変更、得られた結果を含めて既存研究との差を再評価する。 |
| 研究としての魅力度 | 問いの重要性と期待される結果の意味を参照する。 | 実際に得られた結果が研究上どの程度の意味を持つかを参照する。 |
| 有効性 | 方法の理論的根拠や期待される改善を参照する。 | 実測性能、比較対象との差、追加分析を参照する。 |
| 総合評価 | 計画全体の整合性と将来成果への期待を参照する。 | 実験結果、実装上の制約、分析の十分性を含めて研究全体を評価する。 |
この違いがあるため、事前評価が 6 点で事後評価が 4 点になったとき、それを「最初の評価者が 2 点分だけ判断を誤った」とみなすのは適切ではない。実行前の評価者には、後から得られた実験結果、追加された比較、失敗した条件、実施できなかった評価方法を見る手段がなかった。事後評価では、同じ研究案に対して、より多くの証拠を使った判断が行われている。
既稿「測ることは、考えることの代わりにならない」では、測定値や指標は対象の一部を比較可能な形へ切り出したものであり、対象そのものではないことを論じた[8]。研究提案の評価スコアにも同じ区別が必要になる。新規性 5.8、有効性 6.0 という値は、その時点で利用可能な証拠に基づく評価結果であり、数か月後に完成する研究成果そのものを直接測定した値ではない。
実行前と実行後で同じ数値尺度を使っていても、その数値の意味が完全に同じとは限らない。実行前の有効性 6 点は、「この方法なら高い効果が期待できる」という予測を多く含む。実行後の有効性 6 点は、「実際に得られた性能や比較結果を見ても高く評価できる」という判断になる。数値表現は同じでも、その評価を支える証拠の種類が変わっている。
事前評価と事後評価の差を解釈するときには、情報集合の変化という要素を含める必要がある。実行によって、それまで予測だった部分が観測へ変わり、評価者が参照できる現実そのものが増えている。第二研究で AI 案の評価が大きく下がったという結果を読むときには、この情報集合の変化を含めて考える必要がある。
6. この研究から「AI の研究能力は人間より低い」とは言えない
6.1 対象は特定条件の NLP 研究アイデアである
二つの研究の対象範囲は、特定条件の自然言語処理(NLP)研究アイデアに限定される。第一研究では、当時利用可能だった特定の LLM と研究アイデア生成エージェントを使って、人間研究者が作成した案との比較を行っている[6]。第二研究も、その第一研究で得られたアイデアの一部を人間研究者へ割り当て、実際に研究として遂行させた実験である[7]。
この条件は、結果をどこまで一般化できるかを考えるうえで重要である。第二研究では、7 つの NLP トピックについて、3 か月以内に実行可能となるよう意図的に範囲を設定した研究案を対象としている[7]。研究分野、必要資源、実行期間、検証方法が変われば、アイデア段階で予測できることと、実行後にしか確認できないことの境界も変わる。
そのため、第二研究で観測された AI 案の評価低下幅の数値的な適用範囲は、この研究条件内に限られる。NLP で約 1 点から 2 点程度評価が下がったからといって、物理、化学、医学でも同じ程度の低下が起こる根拠はない。研究遂行に必要な期間、資源、データ、評価方法が異なれば、実行によって新たに明らかになる制約も異なるからである。
モデル側の条件も固定されている。第一研究で使われた LLM、検索方法、候補生成、順位付けの仕組みが変われば、生成される研究案の性質も変わり得る[6]。研究アイデアを生成した後に文献検索を追加する、コードを実行して簡単な実験を行う、複数の候補を自己評価して棄却する、といった工程が組み込まれれば、実行前の段階で除去できる失敗も増える可能性がある。
ここで区別すべきなのは、「この研究条件では AI 案の評価が実行後に大きく低下した」という観測結果と、「AI が生成する研究案は一般に実行後に低評価になる」という一般命題である。前者は実験で確認されている。後者を支持するには、モデル、研究分野、実行期間、評価方法を変えた追加研究が必要になる。
6.2 人間案が実行後に有意に優れていたわけでもない
第二研究では、実行後の平均点だけを見ると、人間案が新規性、研究としての魅力度、有効性、総合評価の四つすべてで AI 案を上回った[7]。この結果だけを取り出せば、「実際に研究すると人間のアイデアのほうが良かった」と読みたくなる。ただし、平均値の順序と統計的に確認された群間差は同じではない。
43 件の研究案を単位として、人間案と AI 案の実行後スコアを直接比較した分析では、四つの指標のいずれにも統計的有意差は確認されなかった[7]。平均値は人間案のほうが高かったが、このサンプル数では、その差が母集団でも存在すると判断するための十分な統計的検出力を持っていなかった。
実行前から実行後への変化量については結果が異なる。AI 案では、新規性、研究としての魅力度、有効性、総合評価の四つすべてで、人間案より評価低下幅が有意に大きかった[7]。この研究が統計的に強く示しているのは、「AI 案では事前評価が事後評価まで維持されにくかった」という前後差である。
この違いは、研究結果をどの粒度で表現するかに直結する。「人間の研究アイデアは AI より優れている」と書けば、実行後の平均値の方向を、統計的に確定した一般的な優位へ拡張することになる。確認された範囲にとどめるなら、「今回の 43 件では実行後の平均点は人間案が上回ったが、その差自体は有意ではなかった。一方、AI 案の評価低下幅は人間案より有意に大きかった」と分けて書く必要がある。
この読み方を採ると、第二研究の焦点も明確になる。焦点は、提案段階の評価と実行後の評価との関係が、生成主体によって異なった点にある。AI 案では、提案時に得ていた高い評価が、実行を経ると人間案より大きく失われた。
6.3 評価低下の原因を LLM の訓練方式へ直結させることもできない
AI 案の評価がなぜ大きく下がったのかについて、第二研究はいくつかの手掛かりを与えている。実行段階ではデータセット、モデル、評価指標、比較対象などの変更が行われ、人間評価を自動評価へ置き換えた例もあった。また、実行後のレビューでは、実験設計、比較対象との比較、追加分析、実測性能などが評価理由として前面に出ている[7]。提案段階では文章として成立していた計画が、実行によって具体的な制約へ分解されたことは確認できる。
しかし、これらの観測結果から、LLM の内部的な学習原因までは直接特定できない。第二研究は、学習時の報酬設計を変更して比較した実験でも、異なる強化学習手法を比較した実験でもない。提案者に実行責任を持たせた場合と持たせなかった場合を比較したわけでもない[7]。観測されたのは研究案の評価変化であり、その背後にある訓練上の因果機構そのものではない。
たとえば、「LLM は提案書の見栄えを高めるように学習されているため、実行可能性より魅力的な説明を優先した」という仮説は考えられる。この説明を支持するには、見栄えを重視する報酬と実行可能性を重視する報酬を分けて学習させ、その後の研究遂行結果まで比較する必要がある。今回の二つの研究には、そのような介入は含まれていない。
「実行責任を負わない提案者は過大な約束をしやすい」という説明も同様である。人間研究者と LLM で実行責任の条件を統制し、責任の有無によって提案内容や実行後評価がどう変わるかを測定しなければ、因果関係としては確定できない。今回の研究では、人間案と AI 案で生成主体そのものが異なるため、観測された差を責任構造だけへ分解することはできない。
| 研究から確認できること | 追加検証が必要なこと |
|---|---|
| AI 案の実行前後の評価低下幅は人間案より大きかった | その差が LLM のどの学習過程によって生じたかを特定すること。 |
| 実行時には実験条件や評価方法の変更が生じた | どの種類の変更が評価低下へどれだけ因果的に寄与したかを分解すること。 |
| 実行後には実験結果や比較内容が評価材料として増えた | 提案時の文章表現そのものが評価の過大推定を生んだかを特定すること。 |
| 人間案と AI 案で評価変化の大きさが異なった | その差が生成主体、モデル性能、検索能力、実行責任などのどの要因によるものかを分離すること。 |
研究結果を一段抽象化するときには、観測された差、考えられる説明、因果的に確認された原因を分けて扱う必要がある。今回確実に観測されたのは、特定条件の NLP 研究アイデアにおいて、AI 案の事前評価から事後評価への低下幅が人間案より大きかったことである。なぜその差が生じたのかについては、実行可能性の見積もり、実験設計、比較対象、評価方法、モデルの生成特性など複数の候補が残っている。
この限定によって、第二研究の結果の位置づけは明確になる。AI と人間の一般的な研究能力の順位はまだ決まっていない。一方、提案段階で高く評価された研究案が、実行後にも同じ評価を維持するとは限らず、その乖離が今回の AI 案では人間案より大きかった。この点は、研究が直接支えている結果として残る。
7. 未観測の部分を減らすには、計画を詳しくするだけでは足りない
7.1 人間の計画にも、事前予測と実績のずれはある
実行前の予測と実績がずれる現象は、人間の計画にも見られる。Roger Buehler、Dale Griffin、Michael Ross は、人が自分の課題完了時間を予測するとき、実際より短い時間で終えられると見積もりやすいことを複数の実験で示した[9]。参加者は、自分がこれからどのような手順で課題を進めるかという具体的な筋書きには注意を向ける一方、過去に類似した課題を実際に終えるまでどれだけ時間がかかったかという情報を十分に利用しない傾向を示した。
このずれは、計画が具体的に存在していても生じる。むしろ、計画が具体的であるほど、その計画内部の手順へ注意が集中しやすくなる。予定した順序で作業が進む、必要な資源が予定どおり得られる、中断や手戻りが起きないといった条件を暗黙に置けば、計画内部では短い所要時間を組み立てられる。しかし、実行時には、予定外の割り込み、追加作業、失敗、再試行、調整などが発生する。これらは、計画を作成した時点では個別に予測できない場合がある。
Buehler らの研究では、過去の関連経験を現在の予測へ明示的に結び付ける条件を与えると、楽観的な予測の偏りが弱まった[9]。過去に予定より時間がかかったという事実を現在の見積もりへ明示的に使わせることが重要だった。現在の計画だけを見る判断と、類似した過去の実績まで参照する判断では、将来予測に使われる情報が異なる。
この研究を、第 4 章までに見た LLM の研究アイデア評価と同じ原因で説明することはできない。課題完了時間の予測と研究アイデアの評価では、対象も評価軸も異なる。ただし、両者には一つの共通構造がある。実行前には、計画内部の情報は存在していても、実行中に生じるすべての条件までは観測できない。予測者は、その欠けた部分を既存知識や過去経験から補うしかない。
計画を詳細にすれば、この不確実性の一部は減らせる。工程を分解すれば必要な作業を見落としにくくなり、必要資源を書き出せば不足を事前に発見できる。詳細化できるのは主として計画内部の情報である。詳細な工程表を書いたからといって、将来発生する実験結果、比較対象との差、データ取得の失敗、評価手順の破綻まで現在の情報へ変わるわけではない。
| 方法 | 減らせる不確実性 | 残る不確実性 |
|---|---|---|
| 計画を詳細化する | 必要工程、資源、依存関係、論理上の欠落を発見しやすくなる。 | 実際の結果、予定外の制約、実行時の失敗はまだ観測できない。 |
| 過去の類似実績を参照する | 現在の計画だけから生じる楽観的な見積もりを補正できる。 | 今回固有の条件や、前例のない結果までは確定できない。 |
| 一部を実行する | 実装可能性、データ取得、性能、評価手順などの一部を実測できる。 | 本実行でのみ現れる規模依存の制約や長期的な結果は残る。 |
この区別によって、計画の精密さと予測の精度を分けて考えられる。計画内部の記述を改善することは必要だが、それだけでは未来の未観測部分は消えない。予測精度を上げるには、計画の外にある過去の実績か、現在行える小さな実行へ接続する必要がある。
7.2 外部の実績と小さな実行で、未観測部分を減らせる
事前予測の限界に対処する方法の一つは、類似する過去の実績を基準にすることである。Bent Flyvbjerg はプロジェクト予測について、個別計画の内容を詳しく積み上げて所要時間や費用を推定する見方に対し、類似したプロジェクト群の実績分布から今回の結果を見積もる参照クラス予測(reference class forecasting)を論じている[10]。
たとえば、新しいプロジェクトについて担当者が「この工程なら 12 か月で完了できる」と判断したとする。その計画内部では、設計、実装、試験、移行の期間を積み上げれば 12 か月になるかもしれない。同種のプロジェクトが過去には平均 18 か月かかり、予定どおり 12 か月以内に終わった事例が少ないのであれば、その実績分布は現在の計画には含まれていない情報を持っている。計画内部の論理と、類似事例の実績という二つの情報を比較することで、予測の前提を点検できる。
この方法でも未来を直接観測できるわけではない。過去の類似事例と今回の条件が完全に一致する保証はなく、技術、組織、規模、制度が変われば実績分布も変わる。それでも、現在の計画だけを見て判断する場合より、「同じような条件で実際には何が起きたか」という外部情報を追加できる。
もう一つの方法は、最終成果まで待たず、判断したい仮定に対応する部分だけを先に実行することである。ソフトウェアなら試作や概念実証(PoC)、機械学習なら小規模なベンチマーク、科学研究なら予備実験を行える。目的は、計画の中で予測になっている項目を、できるだけ早く観測可能な項目へ変えることである。
たとえば「この方法は実装可能である」という仮定なら、核心部分だけを実装することで技術的に成立するかを確認できる。「この手法は既存手法より性能が高い」という仮定なら、限定したデータセットと比較対象で予備的なベンチマークを行える。「必要なデータを取得できる」という仮定なら、本実験の前に少数のデータ取得を試せる。確認したい仮定と小さな実行を対応させれば、計画全体を完了させなくても未観測部分の一部を減らせる。
| 計画上の仮定 | 小さな実行 | 新たに観測できること |
|---|---|---|
| 核心となる方法を実装できる | 最小構成の試作を作る。 | 技術的な成立性、必要な依存関係、実装上の障害を確認できる。 |
| 既存手法より性能が高い | 限定条件でベンチマークを行う。 | 効果の方向、比較対象との差、評価指標の妥当性を確認できる。 |
| 必要なデータを取得できる | 小規模なデータ取得を試す。 | 取得率、欠損、品質、必要工数を確認できる。 |
| 評価手順を実施できる | 少人数または限定条件で予備評価を行う。 | 評価者確保、所要時間、基準の曖昧さ、評価値の安定性を確認できる。 |
この考え方は、第 5 章で見た AI 研究案の人間評価にも当てはまる。提案段階では「人間評価を行う」と記述できても、実行時には評価者の確保、費用、期間という制約が現れ、一部の研究では自動評価へ変更された[7]。もし提案段階で小規模な人間評価を試していれば、評価工程に必要な資源の一部は事前に観測できた可能性がある。小さな実行には、その計画を現実の制約へ接触させる役割がある。
既稿「この物量の文章を、一体誰が検証できるのか」では、生成された主張の検証には、文章内部の整合性と、外部資料、実行結果、反例などへの接続が必要であることを論じた[11]。そこでは、主張を支える証拠が外部世界にすでに存在する場合でも、その証拠を探し、照合する工程が必要だった。
研究計画では、その一段前の制約が加わる。未来の実験結果、実測性能、本番環境での挙動は、検索してもまだ存在しない。外部資料を増やしても、今回の研究を実際に実行したときの固有の結果までは取得できない。確認したい情報がまだ世界に存在していないなら、照合先そのものを実行によって作る必要がある。
この差によって、事前評価の限界も具体的に説明できる。評価者の専門性不足による予測誤差と、情報がまだ存在しないため原理的に観測できない領域は分けて考える必要がある。まだ実験していない性能、まだ取得していないデータ、まだ発生していない障害は、評価能力を高めるだけでは直接観測できない。
提案の文章を精密にすること、過去の実績を参照すること、小さく実行することには、それぞれ異なる役割がある。文章の精密化は計画内部の矛盾や欠落を減らす。過去の実績は、現在の計画だけから生じる予測の偏りを補正する。小さな実行は、今回固有の仮定の一部を実測結果へ変える。三者が減らしている不確実性の種類は異なる。
未観測部分を減らすには、計画を詳しくするだけでは足りない。計画の外にある過去の実績を参照するか、現在可能な範囲で一部を実行し、予測を観測へ変える必要がある。提案段階でどれほど高い評価を得ても、実行後の結果まで保証できないのは、この未観測部分が残っているためである。
8. 良い提案とは、事前評価が高い提案だけではない
研究提案には、成果が存在する前に候補を選ばなければならないという制約がある。研究費、人員、計算資源、実験設備には限りがあり、すべての案を最後まで実行してから最良のものを選ぶことはできない。そのため専門家は、問題の新規性、方法の妥当性、必要資源、実行可能性、期待される成果など、実行前に利用できる情報から研究案を評価し、どこへ資源を配分するかを決める。NIH の研究費を追跡した研究でも、事前評価が良い申請ほど、その後の論文数、引用数、高被引用論文、特許といった成果が高い傾向が報告されている[3]。事前評価には、将来成果を予測する情報が実際に含まれている。
ただし、事前評価値が表すのは、現在利用できる情報に基づく有望さまでである。実行前には、研究方法が成立しそうか、結果が得られそうかを既存知識から推定できても、実際の効果量、比較対象との差、必要工数、データ取得の成否までは観測できない。事前評価が高いという事実は、「現在利用できる情報の範囲では有望に見える」という判断を意味し、まだ存在しない実験結果の確認とは区別する必要がある。
LLM の研究アイデアを扱った二つの研究は、この違いを同じ研究案の前後比較として可視化した。第一研究では、実行前の専門家評価において、LLM 案は人間案より新規性を高く評価された[6]。しかし、その一部を実際に研究者が遂行した第二研究では、AI 案の新規性、研究としての魅力度、有効性、総合評価が実行後に低下し、その低下幅は四つの指標すべてで人間案より統計的に有意に大きかった[7]。
第一研究と NIH の追跡研究は、事前評価に将来成果を予測する情報が含まれることを示す。第二研究は、その評価が実行を経て変化し得ることを示す。両者を合わせると、事前評価と事後評価は異なる情報集合に基づく判断として位置付けられる。
| 判断 | 意味 |
|---|---|
| 事前評価が高い | 提案時点で利用できる情報から、実行する価値が高いと判断されたことを示す。 |
| 実行後も評価が高い | 実験結果、比較、実装上の制約などを加えても、提案時の期待が維持されたことを示す。 |
| 実行後に評価が下がる | 提案時には観測できなかった情報が加わり、当初の期待を支えられない部分が明らかになったことを示す。 |
| 実行後に評価が上がる | 提案時には十分に評価されなかった価値が、実測結果によって確認された可能性を示す。 |
第二研究でも、実行後の平均点では人間案が AI 案を上回ったが、その群間差そのものは研究案単位では統計的に有意ではなかった[7]。確実に示されたのは、人間が AI より優れた研究案を作るという一般的な順位ではなく、AI 案では実行前に得ていた評価が実行後まで維持されにくかったことである。この違いを保てば、研究結果を AI と人間の勝敗へ単純化せず、提案評価と成果評価の関係として読むことができる。
既稿「AI は思考設計格差を拡大する」では、生成コストが低下すると、何を作らせるかを決め、生成物を評価し、複数の候補から採用するものを選ぶ能力が相対的に重要になると論じた[12]。今回の二つの研究は、その評価能力にも限界があることを具体化している。評価者が十分な専門知識を持ち、提案を慎重に読んだとしても、まだ実験していない性能、まだ取得していないデータ、まだ発生していない実装上の障害を直接観測することはできない。
ここでは、評価者の能力不足と情報不足を分ける必要がある。評価者の能力不足なら、より詳しい専門家を集める、評価基準を改善する、追加資料を提出させるといった方法で改善できる。結果そのものがまだ存在しないという情報不足は、実行によって新しい証拠が生まれるまで残る。実行前の段階では、どれほど優れた評価者でも予測として扱うしかない領域がある。
第 7 章で見たように、この未観測部分を減らすには、計画を詳細化するだけでは足りない。類似する過去の実績を参照すれば、現在の計画だけに依存した予測を補正できる。試作、予備実験、小規模なベンチマーク、PoC を行えば、今回固有の仮定の一部を実測値へ変えられる。事前評価の精度を上げる方法と、評価対象そのものについて新しい情報を作る方法は別である。
良い提案を選ぶときには、提案時点の点数とともに、どの部分がすでに根拠によって確認され、どの部分がまだ予測なのか、その予測をどの段階で観測へ変えられるのかまで考える必要がある。事前評価は、実行する候補を選ぶための判断として必要であり続ける。ただし、その高評価は研究成果への保証ではなく、次の検証へ進める価値があるという判断である。
提案評価と実行結果評価では、扱う証拠が異なる。前者では、まだ存在しない成果を現在の情報から予測する。後者では、実行によって生じた結果を新しい証拠として利用できる。LLM の研究アイデアで観測された評価低下は、この時間差を具体的な数値として示した。良い提案では、事前評価の高さと、予測として残っている部分を認識し、実行を通じてその予測を検証可能な形へ変えていく設計の両方が重要になる。
参考文献
- Berg, J. M., When Silver is Gold: Forecasting the Potential Creativity of Initial Ideas, Organizational Behavior and Human Decision Processes, Vol. 154, pp. 96-117, 2019. https://www.gsb.stanford.edu/faculty-research/publications/when-silver-gold-forecasting-potential-creativity-initial-ideas
- National Institutes of Health, NIH Grants Policy Statement, 2.4 The Peer Review Process. https://grants.nih.gov/grants/policy/nihgps/HTML5/section_2/2.4_the_peer_review_process.htm
- Li, D., Agha, L., Big names or big ideas: Do peer-review panels select the best science proposals?, Science, Vol. 348, No. 6233, pp. 434-438, 2015. https://pubmed.ncbi.nlm.nih.gov/25908820/
- Fang, F. C., Bowen, A., Casadevall, A., NIH peer review percentile scores are poorly predictive of grant productivity, eLife, Vol. 5, e13323, 2016. https://elifesciences.org/articles/13323
- Pier, E. L. et al., Low agreement among reviewers evaluating the same NIH grant applications, Proceedings of the National Academy of Sciences, Vol. 115, No. 12, pp. 2952-2957, 2018. https://pmc.ncbi.nlm.nih.gov/articles/PMC5866547/
- Si, C., Yang, D., Hashimoto, T., Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers, International Conference on Learning Representations, 2025. https://proceedings.iclr.cc/paper_files/paper/2025/hash/ea94957d81b1c1caf87ef5319fa6b467-Abstract-Conference.html
- Si, C., Hashimoto, T., Yang, D., The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas, International Conference on Learning Representations, 2026. https://iclr.cc/virtual/2026/poster/10010564
- id774, 測ることは、考えることの代わりにならない(2026-07-02). https://blog.id774.net/entry/2026/07/02/4931/
- Buehler, R., Griffin, D., Ross, M., Exploring the “Planning Fallacy”: Why People Underestimate Their Task Completion Times, Journal of Personality and Social Psychology, Vol. 67, No. 3, pp. 366-381, 1994. https://doi.org/10.1037/0022-3514.67.3.366
- Flyvbjerg, B., From Nobel Prize to Project Management: Getting Risks Right, Project Management Journal, Vol. 37, No. 3, pp. 5-15, 2006. https://doi.org/10.1177/875697280603700302
- id774, この物量の文章を、一体誰が検証できるのか(2026-07-30). https://blog.id774.net/entry/2026/07/30/5160/
- id774, AI は思考設計格差を拡大する(2026-02-19). https://blog.id774.net/entry/2026/02/19/3698/