AI の科学的発見は証拠へ到達できるかで変わる

科学的発見という言葉からは、これまで知られていなかった対象を観測し、そこから新しい知識を得る場面が想像されやすい。しかし、研究で新しくなるものは観測対象そのものとは限らない。配列、観測値、既存論文がすでに公開されていても、それらの間にある関係が認識されていなければ、後から別の探索によって新しい構造が見つかることがある。

生物学では、この違いが特に現れやすい。ゲノム配列は一度決定されればデータベースへ蓄積されるが、その配列が何を意味するかは同時には確定しない。ある遺伝子は既知でも、その周辺にある非コード領域との関係が調べられていない場合がある。個々の構成要素について論文が存在していても、それらを一つの機構として扱う視点がなければ、系としての特徴は記述されないまま残る。

データ量が増えると、この未記述領域も増える。研究者が利用できる情報が不足しているからではなく、利用可能な情報のすべてを同じ密度で調べられないためである。候補が数十件なら周辺配列まで人間が確認できるが、候補が数百万、数億へ広がれば、何を詳しく読むかという選択が必要になる。科学的発見の制約は、測定できる情報量だけでなく、どの情報を観測対象として選び、どこまで追跡できるかにも置かれる。

この型の発見に AI を利用すると、少なくとも三つの能力を分けて考える必要がある。第一は、決定的な証拠を提示されたとき、その中にある異常や規則性を認識する能力である。第二は、巨大な探索空間から、認識に必要な証拠が存在する場所まで自力で到達する能力である。第三は、一度成功した探索を別の試行でも成立させ、同種の証拠へ一定の確率で再び到達する能力である。

この三つは順番に依存している。証拠へ到達しなければ認識能力は使われず、認識できても一度しか到達しないのであれば、発見方法としてどこまで利用できるかは確定しない。最終的な発見結果だけを見ると、この違いは消える。同じ「発見できた」という結果でも、最初から証拠を与えられた場合と、広い探索空間から自力で証拠を選び出した場合では、成立している能力が異なる。

2026 年 9 月、Anthropic は Claude を用いた大規模なゲノム探索から、array-associated reverse transcriptases、ART と名付けた逆転写酵素系を見つけたと発表した。ART を構成する要素の一部は、それ以前から配列データや既存研究の中に存在していた。Claude が探索したのは、その既知情報を含む巨大なデータ空間であり、その過程で従来一つの系として切り出されていなかった関係へ到達した。

この事例では、AI が未知の構造を認識したという結果と、その構造が置かれていた証拠までどのように到達したかを分けて観察できる。さらに、発見後には情報の与え方を変えた反復評価も行われているため、証拠を直接与えた場合の認識能力と、自ら証拠を取得する探索能力を比較できる。一件の科学的成果であると同時に、AI による発見をどの単位で評価すればよいかを検討できる事例になっている。


1. 発見には複数の能力が重なっている

ある DNA 配列を画面に表示し、「ここに特徴的な構造があるか」と尋ねる課題では、調べる対象がすでに決まっている。モデルに必要なのは、与えられた文字列を読み、反復や対応関係を抽出し、その特徴を既存知識と照合する処理である。対象を探す工程は終わっているため、結果は主として配列を認識する能力を反映する。

数十億規模の候補から特徴的な配列を発見する課題では、その前に別の工程が加わる。どの候補を詳しく調べるかを決め、その周辺領域を取得し、遺伝子注釈だけで十分か、生の塩基配列まで読む必要があるかを判断しなければならない。さらに、取得したファイルの中から読む範囲を選び、観測した特徴に追跡する価値があるかを決める。認識に到達するまでに、複数の選択が直列に置かれている。

この構造では、後段の能力が高くても前段で経路を外れれば発見は起きない。反復配列を高い精度で識別できるモデルでも、その配列を含むファイルを開かなければ反復は観測されない。ファイルを取得しても遺伝子一覧だけを確認して処理を終えれば、非コード領域にある特徴は入力へ入らない。必要な領域まで表示して初めて、配列認識能力を使える状態になる。

候補数が増えるほど、この前段の影響は大きくなる。候補が一つなら全体を読むという方針でも処理できるが、候補が一億あれば同じ方法では探索量が膨らむ。計算資源や実行時間に上限がある以上、何を読まないかを決める選択が不可避になる。その選択によって観測される証拠が変わり、観測される証拠が変われば、その後に形成できる仮説も変わる。

段階 成立させる処理 成功した場合 失敗した場合
候補選択 大きな情報空間から、追加調査する対象を絞り込む。 特徴を含む可能性がある対象が詳細調査へ送られる。 有望な対象が後続処理へ渡らず、その内部にある証拠も観測されない。
証拠取得 判断に必要な配列、文献、周辺情報を外部環境から取得する。 認識に必要な情報がモデルの利用可能な範囲へ入る。 対象を選べても、判断材料が不足した状態で探索が終わる。
認識 取得した情報から、反復、対応関係、異常な配置を読み取る。 単なるデータが、追跡可能な特徴や仮説へ変わる。 証拠を取得していても、その特徴を意味のある構造として抽出できない。
追跡 見つけた特徴が単発の例か、関連する対象にも現れるかを調べる。 個別の異常を、複数の事例に共通する系として整理できる。 特徴を認識しても、一例の観察として処理が止まり、一般的な関係へ発展しない。
反復 別の試行や条件でも、同種の証拠への到達と認識が成立するかを測る。 一度の成功から、方法としての成功率や条件依存性を評価できる。 発見事例は残るが、同じ探索方法をどこまで継続利用できるかは確定しない。

この分解によって、一件の成功が持つ意味も明確になる。成功した探索は、候補選択から証拠取得、認識、追跡までの経路が少なくとも一度成立したことを示す。これは、同じ経路が成立し得ることを示す実例になる。一方、その一件だけでは、各段階の成功率や条件依存性までは測れない。

反復試行を行うと、最終結果だけでは隠れていた差を観測できる。ある試行では候補まで到達したが配列を読まなかった、別の試行では配列まで取得したが特徴を認識しなかった、さらに別の試行では特徴を認識して関連例まで追跡した、というように成功経路を分解できる。失敗を一律に「モデルが理解できなかった」と扱う場合より、どの工程が全体の成功率を制約しているかを具体的に特定できる。

この違いは、科学的発見をモデルの知識量だけで評価すると見落とされる。巨大なデータ空間では、知識を適用する前に、その知識を適用すべき証拠を選び出す必要がある。さらに、その選択を一度の偶発的な経路から反復可能な方法へ変えられるかによって、AI が科学的探索の中で担える役割も変わる。認識、探索、反復を分けて測ることで、「発見した」という一つの結果を、その結果が成立した工程へ戻して評価できる。


2. 科学的発見は既存の情報から新しい関係を切り出すことでも起こる

科学的発見では、新しい対象を初めて観測する場合だけでなく、すでに観測されていた対象どうしの関係が後から明らかになる場合がある。ゲノム研究では、配列を取得した時点で、その配列が担う機能まで同時に確定するとは限らない。塩基配列はデータベースへ保存できても、どの領域が互いに関係し、どのような生物学的過程を構成しているかを調べるには、比較、仮説形成、追加観測、実験が必要になる。そのため、データの取得と、そのデータが意味する構造の発見には時間差が生じる。

CRISPR の成立過程には、この時間差が表れている。細菌や古細菌のゲノムに規則的な反復配列が存在すること自体は早くから観測されていたが、配列の規則性だけでは生物学的機能は決まらなかった。Mojica らは、反復配列の間に挟まれたスペーサーを既知配列と比較し、その一部がファージやプラスミドなどの外来遺伝因子に由来することを示した[1]。この対応関係によって、スペーサーは単なる反復配列間の可変領域から、過去に接触した外来遺伝因子と関係する配列として読めるようになった。

ただし、配列の由来が分かったことと、その配列が抗ファージ機能を担うことが確定したことは別の段階である。Barrangou らは Streptococcus thermophilus をファージへ曝露し、耐性を獲得した株では新しいスペーサーが CRISPR 領域へ追加されることを確認した。さらに、スペーサーの追加によって対応するファージへの耐性を付与でき、削除によって耐性を失わせられることを実験で示した[2]。既存配列と外来 DNA の対応という観察が、スペーサー獲得と耐性変化を結び付ける操作実験によって機能的な説明へ進んだ。

段階 新しく得られたもの 根拠となる観測 次に残る問い
配列の観測 規則的な反復配列と、その間に異なるスペーサーが存在することが分かる。 ゲノム配列そのものを比較し、反復と可変領域を記述する。 この配置が何を意味し、どのような機能と結び付くかを説明する必要がある。
関係の発見 スペーサーの一部がファージやプラスミドなどの外来遺伝因子に由来することが分かる。 スペーサー配列と既知の外来遺伝因子の配列を照合する。 その対応関係が実際の抗ファージ機能へ関与するかを確かめる必要がある。
機能の実証 スペーサーの獲得や除去が、対応するファージへの耐性変化と結び付くことが分かる。 ファージ曝露、スペーサー追加、スペーサー削除を伴う実験で耐性を比較する。 分子機構や構成要素ごとの役割をさらに説明できるようになる。

この経過では、同じ対象について異なる種類の新規性が順番に現れている。最初に存在するのは配列という観測事実であり、その後にスペーサーと外来遺伝因子の対応関係が見つかり、さらにその関係が抗ファージ防御へ作用することが実験で確かめられた。新規性は「その配列を最初に見たか」という一点には還元されない。すでに知られている構成要素を別の単位で比較し、従来記述されていなかった関係を取り出すことも、後続研究を可能にする発見になる。

微生物の抗ファージ防御系では、この関係探索を大規模なゲノム比較へ拡張した研究も進んできた。Doron らは、既知の防御遺伝子がゲノム上の特定領域に集まりやすいことを利用した。既知の防御系に近接する遺伝子を候補として抽出し、その候補を実験で検証することで、従来知られていなかった防御系を同定した[3]。ここでは、個々の遺伝子配列だけを独立に評価するのではなく、「既知の防御遺伝子と同じゲノム近傍に配置されている」という関係そのものが候補選択の手掛かりになっている。

Gao らも、微生物ゲノムから計算的に候補を選び、異種宿主で発現させてファージ感染への効果を測定する方法を用い、29 種類の広く分布する抗ウイルス遺伝子カセットを報告した[4]。計算探索だけでは候補の機能は確定しないため、配列上の配置や保存性から候補を抽出し、その後の感染実験で機能を確認するという二段階の経路が使われている。候補抽出の精度が上がれば実験対象を絞り込める一方、最終的な生物学的機能は独立した観測によって確定する。

この蓄積を見ると、大量の既存データから未記述の関係を抽出すること自体は、生成 AI によって初めて生まれた研究方法ではない。生物学では以前から、ゲノム上の近接関係、配列類似性、保存性、共起などを使って探索空間を狭め、その候補を実験へ渡す方法が使われてきた。

生成 AI が加わることで変化するのは、この探索経路の中で機械が担当できる範囲である。従来の計算探索では、あらかじめ定義した特徴量や類似度、ゲノム上の配置を使って候補を絞り込むことが中心だった。エージェント型 AI では、それに加えて周辺配列を読む、異常な配置へ気付く、追加で調べる対象を選ぶ、既存文献との関係を仮説として整理するといった判断まで同じ探索過程へ含められる。

担当範囲が広がるほど、発見結果だけでなく探索過程そのものを評価する必要も大きくなる。候補を抽出する規則が固定されている場合、その規則を確認すれば何が観測対象になるかを比較的追跡しやすい。AI エージェントが途中の判断によって調査対象を変える場合、同じデータベースを使っていても、どの配列まで到達するかが試行ごとに変わり得る。既存情報から新しい関係を切り出す能力は、認識能力だけでなく、その情報へ至る探索判断にも依存する。

この違いは、AI による発見の新規性を評価するときにも必要になる。問うべき対象は、元となる配列が既知だったかどうかだけではない。その配列間の関係が以前に記述されていたか、同じ関係へ従来の解析が到達していたか、AI がどの証拠を新しく結び付けたかを分ける必要がある。既存情報から新しい関係を切り出すという科学的発見の構造を先に置くことで、AI が何を新しく見つけ、何を既存研究から受け取ったのかを同じ基準で評価できる。


3. ART の構成要素の一部は以前から知られていた

Anthropic が報告した ART は、逆転写酵素、隣接するパートナー遺伝子、上流に並ぶ長い反復配列を組み合わせた系として整理されている。逆転写酵素は RNA を鋳型として DNA を合成する酵素であり、細菌では retron と呼ばれる系にも含まれる。Millman らは、retron が逆転写酵素、非コード RNA、エフェクターから構成され、抗ファージ防御系として機能することを実験的に示した[5]。したがって、逆転写酵素と非コード RNA が同じ生物学的系の中で機能するという発想自体には、ART 以前から研究上の前例がある。

ART を構成する逆転写酵素の一部も、Anthropic の探索によって初めて配列として見つかったものではない。Korn らは 2021 年、Staphylococcus aureus に感染するジャンボファージ MarsHill を解析し、gp206 を retron-like reverse transcriptase として報告した[6]。さらに、その上流には約 1,200 塩基の非コード領域が存在し、逆転写酵素と関係する RNA を含む可能性があることまで記載していた。

この段階で既知だったのは、逆転写酵素という遺伝子と、その上流に長い非コード領域が存在するという配置である。一方、後に ART として整理される長い反復配列の構造、その反復配列が関連する逆転写酵素群でも繰り返し現れること、さらに隣接するパートナー遺伝子まで含めて一つの系として捉える関係は、同じ単位では記述されていなかった。元になる配列が既知であることと、その配列群の間にある構造が既知であることは区別する必要がある。

対象 ART 発表以前に確認されていたこと ART の解析で追加された関係 現在も残る確認事項
逆転写酵素 MarsHill の gp206 など、retron-like reverse transcriptase として配列と遺伝子位置が記載されていた。 特定系統の逆転写酵素が、上流の反復配列や隣接遺伝子と共通した配置を取ることが整理された。 ART に含まれる逆転写酵素が実際にどの RNA を鋳型とし、どの DNA 産物を生成するかは実験的な確認が必要である。
非コード領域 逆転写酵素上流に長い非コード領域が存在することが既存研究で記録されていた。 その内部に複数の長い反復配列が規則的に並び、関連する ART 候補でも同型の構造が現れることが抽出された。 反復配列ごとの機能や、スペーサー部分が何に対応するかは確定していない。
RNA 発現 ジャンボファージ SA1 の感染過程について RNA-seq データが公開されていた。 既存の RNA-seq データを ART の座標から再解析し、反復配列を含む領域から RNA が発現することが確認された。 発現した RNA と ART の逆転写酵素との直接的な基質関係はまだ実証されていない。
系としての構造 逆転写酵素、非コード領域、周辺遺伝子は個別のゲノム要素として観測されていた。 逆転写酵素、反復配列、パートナー遺伝子の共起を一つの ART 系としてまとめる分類が導入された。 この配置がどのような生物学的機能を成立させるかは、今後の実験結果によって決まる。

別のジャンボファージ SA1 についても、感染後の転写産物を時間ごとに測定した RNA-seq データがすでに公開されていた[7]。Anthropic の技術報告は、この既存データを ART という新しい座標系から再解析し、反復配列を含む領域から RNA が発現していることを確認した。新しい実験データを最初から取得し直したのではなく、既存の観測結果に ART という構造を重ねることで、以前とは異なる情報を引き出している。

この再解析には二段階の意味がある。第一に、ゲノム上で見つかった反復配列が転写されているため、単なる DNA 上の規則的な模様だけでは説明しにくい対象になる。第二に、その RNA が逆転写酵素の近傍から生じることによって、両者が同じ生物学的機構へ関与する可能性を検討できるようになる。ただし、近接して存在し同じ領域から RNA が発現することは、逆転写酵素がその RNA を直接利用することの証明にはならない。酵素と RNA の直接的な対応には、独立した生化学的検証が必要になる。

巨大な配列データから未記述の系を抽出する方法にも先行研究がある。Altae-Tran らは、タンパク質配列を大規模にクラスタリングし、既知の CRISPR-Cas 系と遠縁にある候補を探索することで、188 の未報告 CRISPR 関連遺伝子モジュールを抽出し、その一部を実験的に特徴付けた[8]。ここでも、新規性は個々の配列がデータベースに存在しなかったことから生じたのではなく、大規模な比較によって従来の分類では拾われていなかった関係を抽出したことにある。

ART も同じ枠組みで読むと、新規性の位置が明確になる。逆転写酵素は既知であり、上流の非コード領域も既知であり、RNA-seq データも既存資料として利用できた。Claude の探索が追加したのは、これらを別々の観測として残すのではなく、反復配列の存在、関連する逆転写酵素群での再現、隣接するパートナー遺伝子という複数の特徴を結び付け、一つの候補系として整理する経路である。

この違いを区別すると、「既知の配列だったから発見ではない」という評価と、「AI が未知の酵素そのものを初めて見つけた」という評価の両方を避けられる。既知だったのは構成要素の一部であり、新しく切り出されたのは、それらの間に反復して現れる配置と関係である。そして、その関係が実際にどのような分子機構を成立させるかは、計算上の発見とは別の検証段階に残されている。

ART の事例では、科学的発見の新規性を「データが初めて生成されたか」という基準だけで測ると、実際に起きたことを捉えにくい。既存データの中に長く存在した要素を別の探索経路から読み直し、複数の証拠を新しい単位へまとめ、その単位から検証可能な仮説を作ることにも新規性がある。AI が科学へ加わるとき、その価値を判断するには、何を新しく生成したかだけでなく、既存の情報の間にどの関係を新しく認識したかを見る必要がある。


4. Claude は既知の配列を別の探索経路から読み直した

Anthropic の探索では、最初から ART という構造を検索していたわけではない。研究チームは約 19 億のタンパク質クラスターを対象に、Claude Code のエージェント群へ逆転写酵素とその周辺を調査させた。Anthropic の発表によると、約 950 のエージェントが 21 時間動作し、約 2 億 1,000 万トークンを消費した。探索によって 20 万を超える逆転写酵素が集められ、約 3,500 の候補系が抽出され、詳細な調査対象は約 20 件まで絞り込まれた[9]。

この規模では、すべての候補について周辺 DNA を同じ深さで読むと探索量が大きくなる。最初に必要になるのは、どの逆転写酵素を追加調査するかという候補選択である。候補を選んだ後にも、その近傍にある遺伝子だけを見るのか、非コード領域まで取得するのか、生の塩基配列をどこまで読むのかという分岐が続く。探索量を減らすための判断が、そのまま何を観測できるかを決める構造になっている。

ART につながった経路では、あるエージェントが候補となった逆転写酵素の近縁例を追跡し、その上流 DNA まで取得した。技術報告によると、エージェントは取得した生の塩基配列を直接読み、その中に規則的な反復構造があることを認識した[10]。最初から「反復配列を探す」という条件が設定されていたのではなく、逆転写酵素を追跡する途中で観測範囲を上流へ広げた結果、検索条件に含まれていなかった特徴が見つかった。

反復へ気付いた時点でも、ART という系はまだ成立していない。一つの配列に規則的な反復が存在するだけなら、局所的な特徴として終わる可能性がある。そこでエージェントは、反復の個数や間隔を調べ、同じ系統の逆転写酵素でも同様の配置が現れるかを追跡し、さらに隣接するパートナー遺伝子との関係を調べた[10]。単一の異常を認識した後に比較対象を増やしたことで、個別配列の特徴が複数のゲノムに現れる共通構造へ変わった。

探索段階 ART で行われた処理 その処理が必要だった理由 別の経路を選んだ場合
候補選択 多数の逆転写酵素から、追加調査する系統を選んだ。 20 万を超える候補すべてを同じ深さで解析すると探索量が大きくなるため、詳細調査の対象を絞る必要があった。 ART を含む系統が優先されなければ、その周辺 DNA を読む工程へ進まない。
周辺領域の取得 遺伝子注釈だけでなく、逆転写酵素の上流にある生 DNA を取得した。 ART の反復配列はタンパク質をコードする遺伝子ではなく、非コード領域に存在するためである。 タンパク質と遺伝子一覧だけを調べれば、反復配列は観測対象へ入らない。
塩基配列の読取り 取得した DNA を文字列として読み、規則的な反復を認識した。 ファイルの存在だけでは配列構造は判断材料にならず、実際の塩基列を観測する必要がある。 周辺 DNA を取得しても該当部分を読まなければ、反復構造は認識されない。
関連例の探索 近縁の逆転写酵素でも同様の反復配置があるかを調べた。 単一ゲノムの局所的な特徴と、複数系統に共通する構造を区別するためである。 最初の例だけで調査を終えれば、偶発的な反復と系統的な特徴を区別できない。
系としての統合 逆転写酵素、反復配列、パートナー遺伝子の共起を ART として整理した。 別々に観測された特徴を一つの検証可能な生物学的単位へまとめる必要があった。 各要素を独立した特徴として扱えば、それらの関係を対象とする仮説へ進まない。

この探索では、後段の発見が前段の判断に依存している。ART の反復配列を認識するには、その反復を含む逆転写酵素系統を候補として残し、上流の非コード領域を取得し、さらに生の配列まで読む必要があった。どこか一段階で別の選択をすれば、後段の認識能力が同じでも ART は探索結果へ現れない。発見の成否は、モデルが反復配列を理解できるかという一点だけでなく、理解可能な証拠を観測範囲へ運ぶまでの連続した判断に依存している。

この構造は、従来型の検索条件による探索とも異なる。検索条件が固定されていれば、どの特徴を持つ候補が選ばれるかは事前に定義される。今回の経路では、逆転写酵素を調べるという出発点から、上流 DNA の取得、反復の認識、関連例の追加検索へと調査対象が途中で変化した。最初の問いに答えるためだけの探索ではなく、観測した異常によって次の問いが生成され、その問いがさらに別の証拠を呼び込んでいる。

この点で、Claude の役割は大量の候補を順位付けする処理だけには収まらない。ある候補で予想外の特徴を認識し、その特徴を追跡対象として採用し、別の配列へ探索を広げるところまでが同じ実行経路に含まれている。人間の研究者が探索途中で「この配置は何か」と問い直す場合と同様に、当初の検索条件に含まれていなかった特徴が後続調査の条件へ変わっている。

ほぼ同時期には、専用のゲノム言語モデルを用いて、タンパク質中心の注釈では捉えにくい非コード要素を局所的な共進化関係から探索する Minerva も報告された[11]。ART の探索では、汎用モデルが外部ツールを使って候補を移動し、生の配列を読みながら探索方向を更新した。Minerva では、ゲノム向けに学習したモデルが配列間の関係そのものを予測する。両者は仕組みが異なるが、既存データの量が人間の詳細な読取り能力を超えた状況で、どの関係を追加調査へ送るかを計算機に担わせる点では共通している。

ART の発見で新しかったのは、既知の配列へアクセスできたことだけではない。多数の既知配列から一部を選び、通常の遺伝子注釈の外側まで観測範囲を広げ、そこにある規則性を認識し、その規則性を別のゲノムでも追跡した一連の探索が成立したことである。既存データを別の探索経路から読み直すとは、同じファイルをもう一度読むことではなく、何を候補として残し、どこまで周辺を見て、見つかった異常をどの方向へ追跡するかという観測経路を変えることである。


5. 証拠を見れば分かることと証拠まで到達することは違う

ART の技術報告では、最初の発見経路を記述するだけでなく、モデルへ与える情報の範囲を変えた固定入力評価も行っている。7 種類の Claude モデルについて、5 段階の情報条件で各 100 回の試行を実施し、ART に関する 10 個の主張が生成されたレポートへどこまで含まれるかを調べた[10]。この評価によって、同じ対象について、配列を直接見せた場合と、外部ファイルから必要な情報を自分で取得させた場合を分けて比較できる。

配列そのものをテキストとして直接与えた条件では、能力の高い 4 モデルが 90% 以上の試行で反復配列を認識した[10]。この条件では、調べる対象の選択やファイル取得を済ませた状態から処理が始まるため、主として「提示された配列から反復構造を認識できるか」が測られる。少なくとも対象配列が明示的に入力へ入った状態では、反復そのものを読み取る能力は高い頻度で成立していた。

一方、ファイルとツールを渡し、モデル自身に必要な情報を取得させる条件では、反復配列の認識率が最低 32% まで低下した[10]。さらに、ファイル条件の試行の 39% では、200 塩基以上の連続した配列を一度も読んでいなかった。情報源へアクセスする手段は与えられていても、その手段を使って判断に必要な配列を実際に観測するところまで進まない試行が存在したことになる。

ここでは二つの工程が直列につながっている。最初に、必要なファイルや領域を選び、配列を取得して読む必要がある。その工程が成立して初めて、後段の反復認識能力を使える。後段の能力だけを固定入力で測れば高い成功率が得られても、前段の探索が加われば、そこで失敗した試行が全体の認識率を押し下げる。エージェント全体の成績は、モデルが配列を理解できるかだけでなく、その配列を自分の観測対象へ入れられるかにも依存する。

状態 モデルが利用できる情報 主に測られる能力 ART の評価で観測されたこと
配列を直接提示 判断対象となる塩基配列が最初から入力へ含まれる。 配列中の反復構造を認識し、その特徴を説明する能力が中心になる。 能力の高い 4 モデルでは、90% 以上の試行で反復配列が認識された。
ファイルを提供 必要な情報は外部ファイルに存在するが、読む場所と範囲をモデル自身が選ぶ。 情報取得と配列認識の両方が必要になる。 39% の試行では、200 塩基以上の連続した配列を一度も読んでいなかった。
配列を実際に読んだ試行 少なくとも 200 塩基以上の連続した配列が観測対象へ入る。 取得した配列から反復構造を認識する段階へ進める。 能力の高い 4 モデルすべてで、読まなかった試行より認識率が 16~32 ポイント高かった。
配列を読まなかった試行 情報源は存在するが、判断に必要な生配列が推論材料へ入らない。 認識能力を評価する以前に、探索と情報取得の段階で処理が止まる。 反復構造を認識する機会そのものが失われるため、エージェント全体の成功率が低下する。

200 塩基以上を読んだ試行では、能力の高い 4 モデルすべてで反復配列の認識率が 16~32 ポイント高かったと報告されている[10]。ただし、この差だけから「200 塩基以上読むことが認識率上昇の原因である」と断定することはできない。配列を詳しく読む試行では、候補選択や周辺情報の取得も適切に行われていた可能性があり、読取り量は探索行動全体の一部として観測されているためである。

それでも、この比較には明確な意味がある。配列を直接与えた条件では高率に認識できるモデルが、ファイルとツールを使う条件では同じ頻度で特徴へ到達していない。認識に必要な能力が欠けている場合と、その能力を使うための証拠を取得していない場合を、同じ「発見失敗」として扱うことはできない。原因が異なれば、改善すべき場所も異なる。前者なら配列認識や推論能力が対象となり、後者なら検索方針、ファイル閲覧、読取り範囲、ツール設計が対象になる。

既稿では、テストを仕様全体そのものではなく有限の観測点として扱い、観測された条件の範囲によって「正しい」と判断できる範囲が決まることを整理した[12]。ART では、その観測点が形成される前の工程まで問題になる。必要な配列が外部ファイルとして存在することは、その配列がモデルの判断材料になったことを意味しない。アクセス可能な情報の集合と、実際に観測した情報の集合の間に、エージェント自身の選択が入る。

この差は三段階に整理できる。第一に、情報が外部環境へ存在する。第二に、エージェントがその情報へアクセスし、必要な部分を取得する。第三に、取得した情報を推論へ利用して特徴を認識する。各段階の成功条件が異なるため、「必要な情報は与えた」という事実だけでは後段の能力が評価されたことにならない。

長いコンテキストを扱う研究では、この連鎖のさらに後段でも情報利用の差が観測されている。Liu らは、質問への答えを含む文書の位置を変えるだけで言語モデルの成績が変化し、関連情報が長い入力の中間に置かれた場合に性能が低下しやすいことを示した[13]。この研究では、必要な情報そのものはすでに入力へ含まれている。それでも、その情報をどこまで利用できるかが配置によって変わった。

ART のエージェント条件では、その前にもう一つの選択がある。関連情報を利用できるかを問う前に、どのファイルを開き、どの範囲を読み、その内容をコンテキストへ持ち込むかを決めなければならない。情報が外部環境に存在し、アクセス権もあり、ツールも利用可能であっても、実際に取得されなければ後段の推論は始まらない。

この構造を踏まえると、「モデルが知っているか」という問いだけではエージェントの発見能力を説明しきれない。評価すべき対象は、必要な情報が存在するか、そこへアクセスできるか、実際に取得するか、取得した情報を利用できるか、その情報から追跡すべき仮説を形成できるかという連続した工程になる。ART の固定入力評価が示したのは、配列認識能力が高いことと、大規模探索の中でその能力を実際に発動できることの間に、情報取得という独立した制約が存在することである。


6. エージェントの能力はモデルと環境の接続によって変わる

AI エージェントでは、モデルが単独で最終回答を生成するのではなく、外部環境から情報を取得し、その結果を使って次の判断を行い、必要に応じて環境へ操作を加える。既稿では、この仕事遂行能力を、観測、判断、操作、検証が連続する閉ループとして整理した[14]。ART の探索では、この閉ループの中でも観測対象を選び、必要な配列を取得する工程が発見の成否へ直接つながっている。

同じモデルを使っていても、どの情報をどの形式で取得できるかによって、実際に成立する行動は変わる。ファイルの一覧だけを取得できる環境と、周辺 DNA を任意の範囲で表示できる環境では、モデルが観測できる証拠が異なる。検索結果の要約だけが返る場合と、生の配列を直接読める場合でも、後続の推論へ入る情報は変わる。モデルの推論能力が同じでも、環境との接続方法が異なれば、利用可能な探索経路も変化する。

ReAct は、この構造を推論と行動の反復として明示した。言語モデルが内部で推論を進めるだけでなく、外部環境へ行動し、その結果として得られた観測を次の推論へ戻す[15]。開始時点で必要な情報をすべてコンテキストへ入れておく必要はなく、途中で不足している情報を取りに行き、その結果に応じて方針を更新できる。

この方式では、行動の選択が後続の認識範囲を決める。ある候補について周辺 DNA を取得するという行動を選べば、その配列が次の推論材料になる。遺伝子注釈だけで処理を終えれば、非コード領域は観測されない。外部環境への行動は単なる補助操作ではなく、モデルが何を知覚できるかを決める前処理として働く。

構成要素 モデル単体で扱えること 環境との接続で追加されること ART での対応
観測 入力済みの文章や配列から特徴を読み取る。 外部ファイル、データベース、検索結果から必要な情報を取得する。 候補 RT の上流 DNA を取得し、生の配列を観測対象へ入れる。
判断 与えられた情報から分類、比較、仮説形成を行う。 追加で何を調べるか、どの候補を優先するかを決める。 反復構造を認識した後、関連する RT 群を追加調査する。
操作 テキスト出力だけでは外部状態を変更しない。 検索、ファイル読取り、コード実行、データ取得などを実行する。 周辺配列の取得や類似例の検索によって探索範囲を広げる。
検証 入力された根拠の範囲で整合性を判断する。 追加検索や実行結果を使い、仮説と外部事実を照合する。 複数の ART 候補で共通する配置を確認し、単一例か系統的特徴かを比較する。

ソフトウェア工学では、この接続層の影響を比較しやすい。SWE-bench は、実際の GitHub issue と対応するコードベースを用い、問題文を読むだけでは解けない修正課題を評価する[16]。対象となる不具合を直すには、リポジトリーを検索し、関連ファイルを読み、変更箇所を特定し、修正後にテストを実行する必要がある。最終的なコード生成能力だけでなく、どのファイルへ到達し、どの情報を集めるかという探索が課題の一部になる。

SWE-agent は、同じ種類の課題に対して、モデルと計算機環境の間に置くエージェントと計算機のインターフェイスを設計した[17]。ファイルの閲覧、検索、編集、テスト実行などを、モデルが扱いやすい操作として提供することで、エージェントがコードベース内を移動しやすくする。ここで変えているのはモデルの学習済みパラメーターではなく、モデルが外部環境をどう観測し、どう操作するかという接続方法である。

接続方法が変わると、同じ推論能力から到達できる状態も変わる。必要なファイルを検索しやすければ、修正対象へ早く到達できる。テスト結果が適切な粒度で返れば、修正が不十分だった理由を次の判断へ使える。反対に、検索結果が過剰で必要箇所が埋もれたり、実行結果が不足したりすれば、モデルが本来持つ推論能力を後段で使う前に探索が停滞する。

AgentBench は、データベース、ゲーム、ウェブ操作など複数の対話環境を使い、長い行動系列の中で推論と意思決定を続けられるかを評価した[18]。WebArena も、実際に操作可能なウェブ環境を用い、複数ページを移動し、情報を確認し、条件に合う操作を完了できるかを測定している[19]。どちらも、一回の応答だけでは終わらない課題では、途中の観測と行動が最終結果を左右することを評価対象へ含めている。

これらの研究と ART の対象分野は異なるが、能力が成立する構造には共通点がある。ソフトウェア開発ではコードベース、ウェブ操作ではページやフォーム、ART ではゲノム配列が外部環境に相当する。いずれも、必要な情報が環境中に存在するだけでは課題は解けず、エージェントが適切な場所へ移動し、その情報を観測し、後続の判断へ取り込む必要がある。

ART では、この接続層が特に分かりやすい。逆転写酵素の一覧を取得できること、周辺遺伝子を調べられること、上流 DNA を表示できること、配列を一定範囲で読み出せること、類似配列を検索できることは、それぞれ異なる観測手段である。どの手段を利用可能にし、どの情報を返すかによって、エージェントが到達できる証拠の範囲が決まる。

さらに、ツールが存在することと、そのツールが実際に使われることも分ける必要がある。第 5 章で見たように、ファイルへアクセスできる条件でも、必要な長さの配列を読まない試行が存在した。環境側に機能が用意されていても、エージェントがその機能を選択しなければ観測は成立しない。接続層は、ツールの有無だけでなく、モデルがそのツールをどの条件で選ぶかまで含めて評価する必要がある。

この構造から、エージェントの性能をモデル名だけで表すことの限界も見えてくる。同じ Claude を使っていても、利用できる検索、ファイル取得、配列表示、実行履歴、結果の返し方が異なれば、実際の探索能力は変わる。モデルの能力とシステムの能力は重なる部分を持つが、同一ではない。

科学的探索では、この差が発見対象そのものにも影響する。環境との接続が変われば、モデルが読む証拠が変わり、読む証拠が変われば形成される仮説も変わる。ART は、モデルが既知の配列から新しい関係を認識した事例であると同時に、その認識を成立させるために、候補選択、配列取得、読取り、追加検索という環境との往復が必要だった事例でもある。AI エージェントの科学的能力は、モデル内部の推論だけでなく、どの外部状態を観測可能にし、そこへどのような行動で到達できるようにするかによって具体的な形を取る。


7. 一度の成功と反復可能な発見能力は区別する必要がある

ART が生物学的な研究対象として成立するかという問いと、Claude を使った探索方法が同種の未知系へどの程度安定して到達できるかという問いでは、評価している対象が異なる。ART の存在や構造については、見つかった配列、関連する逆転写酵素群、反復配列、パートナー遺伝子、既存 RNA-seq データとの対応を調べればよい。一方、探索方法の能力を評価するには、同じような条件から探索を繰り返したとき、必要な候補を選び、周辺配列を取得し、特徴を認識する経路がどの程度反復するかを測る必要がある。

この二つを分ける理由は、一度の発見が持つ証拠としての意味が異なるためである。実際に ART へ到達した探索記録は、「この探索構成から未知の関係へ到達する経路が存在する」ことを示す。それだけでも、探索方法の可能性を示す事例になる。しかし、その一件から「同じ方法を繰り返せば未知系を安定して発見できる」という成功率までは決まらない。存在可能性を示す一件の成功と、方法として利用するときの再現性は、別の観測を必要とする。

ART の技術報告には、この差を直接考えられる結果が含まれている。最初の探索キャンペーンでは、あるエージェントが候補 RT の上流 DNA を読み、反復配列を認識し、関連例の追跡から ART へ到達した。一方、その後に同種の探索キャンペーンを 10 回実行した評価では、同じ反復配列の発見は再現されなかった[10]。最初の発見が消えるわけではないが、探索経路が高い確率で反復する段階には達していないことが分かる。

ここで、再発見できなかった原因を「モデルには ART を認識する能力がなかった」と解釈すると、第 5 章の固定入力評価と整合しない。ART の配列を直接与えた条件では、能力の高いモデルが 90% 以上の試行で反復構造を認識している[10]。認識対象が観測範囲へ入れば高率に特徴を読み取れる一方、大規模探索ではその対象へ安定して到達していない。この差によって、最初の発見後に何を改善すべきかも変わる。

固定入力評価では、7 種類の Claude モデルについて 5 段階の情報条件を設定し、それぞれ 100 回の試行を繰り返している[10]。この反復には、単一の成功例だけでは見えないばらつきを測る役割がある。配列を直接与えたときに何回反復構造を認識するか、ファイルやツールから必要な情報を取得させたときに何回認識まで到達するかを比較することで、認識能力と探索を含むシステム全体の成功率を分けられる。

評価対象 今回確認できたこと そこから導ける範囲 追加で必要な評価
ART の存在 複数の関連 RT で反復配列とパートナー遺伝子を伴う配置が抽出され、一部では既存データから RNA 発現も確認された。 ART としてまとめられる共通したゲノム構造が存在することを支持する。 酵素活性、RNA との直接的な対応、系全体の生物学的機能を実験で確認する必要がある。
配列認識能力 対象配列を直接提示した条件では、能力の高いモデルが 90% 以上の試行で反復構造を認識した。 必要な証拠が観測範囲へ入った状態では、ART の特徴を高い頻度で読み取れる。 別の配列群や未知系でも同程度の認識率が成立するかを調べる必要がある。
探索を含む認識能力 ファイルやツールから自力で情報を取得する条件では、直接提示より認識率が低下し、必要な長さの配列を読まない試行もあった。 認識能力に加えて、情報取得と読取りの成否が全体の成功率を制約する。 候補選択、ファイル取得、読取り範囲など、どの段階が成功率を最も制約するかを分解する必要がある。
探索キャンペーンの反復 最初のキャンペーンでは ART へ到達したが、その後の 10 回の同種探索では反復配列の発見が再現されなかった。 少なくとも現状では、一件の成功と安定した探索成功率を同一視できない。 試行数を増やし、候補への到達率、配列読取り率、認識率を段階別に測る必要がある。
一般的な科学的発見能力 既存データから未記述の関係へ到達した実例と、その能力を分解する評価結果が得られた。 AI エージェントが科学的探索の一部を担えることを示す具体例になる。 対象分野、データ量、ツール、モデル、探索方針を変えた複数の研究課題で同じ構造を評価する必要がある。

この表で扱っている「反復」は一種類ではない。固定入力を 100 回与える評価では、同じ情報条件に対してモデルの出力がどの程度安定するかを測っている。探索キャンペーンを繰り返す評価では、候補選択から証拠取得、認識までを含む長い行動系列が再び成立するかを測っている。前者が高く、後者が低い場合、認識能力よりも探索経路のどこかに大きな変動要因が存在する可能性が高くなる。

この違いは、改善方法を決めるうえでも重要になる。直接提示でも認識率が低ければ、モデルの配列認識や推論能力を改善する必要がある。直接提示では高率に認識できる一方、探索では対象配列を読まないのであれば、候補選択、ツール利用、周辺配列の取得方針、探索予算の配分が改善対象になる。最終的な「発見率」だけを測る場合より、失敗を具体的な工程へ割り当てられる。

既稿では、評価値が変化したことと、測りたい能力そのものが変化したことを区別した[20]。ART でも、配列を直接与える評価、ファイルから探索させる評価、探索キャンペーン全体の反復では、それぞれ測っている範囲が異なる。ある条件で高い成功率を得たとしても、その数値を別の条件の能力へそのまま移すことはできない。

また、既稿では、個々の数値が正しくても、その数値が何を測っているかを取り違えると結論を誤ることを整理した[21]。ART の発表にある「約 950 エージェント」「21 時間」「約 2 億 1,000 万トークン」という数字は、探索規模を表す。一度 ART へ到達したという事実は、成功事例の存在を表す。固定入力での 90% 以上という数字は、対象配列が直接与えられた条件での認識率を表す。これらはすべて異なる評価対象を持つ数値であり、組み合わせても未知系発見の一般的な成功率にはならない。

同様に、10 回の再探索で反復配列を再発見できなかったことから、最初の成果そのものを無効と判断することも適切ではない。すでに見つかった配列構造は、その後の解析や実験によって独立に検証できる。再探索の結果が示すのは、発見対象の実在性ではなく、その発見へ至るエージェント経路の反復可能性についての情報である。

一件の成功には、一件の成功として明確な価値がある。それまで人間が一つの系として記述していなかった関係へ AI エージェントが到達した事実は、探索空間の読み方を広げられる可能性を示す。方法として継続利用する段階では、そこへ別の評価軸が加わる。どの条件なら同種の証拠へ到達できるのか、何回に一回成功するのか、失敗は候補選択、情報取得、認識のどこで起きるのかを測る必要がある。

ART の事例が興味深いのは、成功と失敗の両方が同じ報告の中に存在する点にある。最初の探索は、AI エージェントが既存データから未記述の関係へ到達し得ることを示した。固定入力評価は、対象を見せればその特徴を高率に認識できることを示した。再探索は、その二つの間にある証拠への到達経路がまだ安定していないことを示した。三つを合わせることで、単なる成功事例よりも、AI の科学的発見能力が現在どこまで成立し、どこに改善余地が残るかを具体的に評価できる。


8. 再現性にも複数の意味がある

科学で使われる「再現性」は、一つの条件だけを指す言葉ではない。Goodman、Fanelli、Ioannidis は、研究結果をもう一度得られること、同じ方法を再実行できること、同じ証拠から同じ推論へ到達できることなど、再現性と呼ばれる対象が複数存在することを整理した[22]。どの再現性を問うているかを区別しないまま「再現できた」「再現できなかった」と述べると、研究対象そのものの信頼性と、研究方法の安定性が同じ評価へ混ざる。

ART では、この区別が特に必要になる。ART というゲノム上の配置が再確認できること、ART に関連する RNA 発現や酵素活性を独立した実験で確認できること、同じ配列を Claude へ与えたときに反復構造を再び認識すること、さらに大規模な探索を最初からやり直したときに同種の証拠へ再び到達することは、それぞれ異なる対象を測っている。

再現性の対象 何を再び成立させるか ART での確認方法 失敗した場合に分かること
解析結果 公開された配列と解析手順から、同じ反復配置や関連 RT 群を確認する。 配列データ、遺伝子位置、反復構造、パートナー遺伝子の対応を独立に再解析する。 配列処理、候補抽出、分類方法のどこかに依存した結果である可能性を検討する必要がある。
生物学的現象 RNA 発現、逆転写酵素活性、抗ファージ機能などの現象を独立した実験で確認する。 RNA-seq、酵素反応、感染実験などを別の条件や研究主体で実施する。 計算上の構造と実際の生物学的機能の間に追加条件が存在する可能性がある。
モデルの認識 同じ情報を与えたときに、反復配列や関連構造を再び認識する。 固定入力を複数回提示し、同じ特徴がどの頻度でレポートされるかを測る。 入力が同じでもモデル出力が変動し、認識能力に確率的なばらつきがあることが分かる。
探索経路 大規模な候補集合から、必要な配列を取得し、同種の発見まで再び到達する。 探索キャンペーンを独立に繰り返し、候補選択、配列取得、認識、追跡の成立率を測る。 認識能力があっても、証拠への到達を含む探索系全体が安定していない可能性が分かる。

解析結果の再現性では、ART の候補となる配列が実際に存在するかを問う。公開されたゲノムを別の研究者や別の解析環境で処理し、同じ逆転写酵素群、反復配列、パートナー遺伝子の配置を確認できれば、少なくとも計算上の対象は独立に検証できる。ここで確認しているのは、ART の配列構造が再び観測されるかであり、Claude が同じ探索経路を通れるかではない。

生物学的な再現では、計算上で見つかった構造が実際の分子機構へ対応するかを問う。既存 RNA-seq データから反復領域の転写が観測されても、逆転写酵素がその RNA を直接利用することや、ART 全体が特定の抗ファージ機能を担うことまでは確定しない。独立した実験で RNA、酵素活性、感染時の表現型を測ることで、ゲノム上の共起から生物学的機能へ進める。

モデル挙動の反復では、対象を固定したうえで出力のばらつきを測る。ART の技術報告が各情報条件を 100 回ずつ評価したのは、この種類の反復に当たる。同じ配列を与えても毎回同じ文章が生成される必要はないが、ART の中心的特徴である反復配列をどの程度の頻度で認識するかを測れば、対象が観測範囲へ入った後の認識能力を確率として評価できる。

探索経路の反復では、さらに前段まで含める。どの候補を選ぶか、周辺 DNA を取得するか、生配列を読むか、見つけた異常を追跡するかという一連の行動を再び成立させる必要がある。同じモデルが同じデータベースへアクセスしていても、途中の選択が変われば異なる候補へ進み、ART の証拠へ到達しないことがある。ここで測っているのはモデルの認識性能より広い、探索システム全体の反復可能性である。

この四つは直列に並ぶ部分を持つが、互いに代替しない。探索を再実行して ART へ到達しなかったとしても、すでに抽出された配列構造を独立に確認できれば、ART の存在そのものが否定されるわけではない。反対に、ART の配列構造や生物学的機能が独立に確認されても、それだけで Claude を使った探索方法が高い成功率で同種の未知系へ到達できることにはならない。

この違いは、失敗の解釈にも影響する。解析結果を再現できなければ、元のデータ処理や分類方法を調べる必要がある。生物学的現象を再現できなければ、培養条件、宿主、感染条件、分子機構の仮定を確認する必要がある。固定入力で認識が不安定なら、モデルの推論や出力変動が対象になる。探索だけが不安定なら、候補選択、ツール利用、観測範囲、探索予算が改善対象になる。

一つの「再現性」という言葉へまとめるより、何を再現しようとしているかを先に定義した方が、ART の成果と Claude の能力を同時に評価しやすい。研究成果については「ART という構造や機能を独立に確認できるか」を問い、AI システムについては「同種の証拠へどの程度安定して再到達できるか」を問う。この二つを分けることで、「研究成果はどこまで確立しているか」と「AI に同じ種類の探索を継続して任せられるか」を別々の根拠で判断できる。

ART の事例では、発見対象の再現性と発見方法の再現性を同時に観測できる点に意味がある。すでに見つかった ART は、配列解析や実験によって人間が独立に検証できる。一方、Claude の探索能力は、同じ種類の探索を反復し、どの工程で成功率が下がるかを測ることで評価できる。科学的成果の確からしさと、AI エージェントを研究方法として利用できる条件は、同じ「再現」という語の下に置かれていても、別の評価軸として扱う必要がある。


9. 探索経路を残すと発見と失敗を分解できる

最終レポートだけを保存すると、観測できるのは主として最終結果である。ある探索では ART に到達し、別の探索では到達しなかったとしても、その差が候補選択、配列取得、読取り、異常認識、関連例の追跡のどこで生じたかは、最終出力だけからは判別しにくい。探索経路を記録すれば、同じ「発見できなかった」という結果を、異なる失敗過程へ分解できる。

ART の探索では、この分解に具体的な意味がある。候補となる逆転写酵素へ到達していなければ、探索の入口で対象を外している。候補へ到達しても上流 DNA を取得していなければ、反復配列は観測範囲へ入らない。上流 DNA を取得しても生配列を十分に読まなければ、モデルの配列認識能力は使われない。反復を認識しても関連する逆転写酵素群を追跡しなければ、一例の特徴から ART という系へ進まない。それぞれ最終結果は「ART を発見しなかった」になるが、改善すべき工程は異なる。

記録対象 確認できること 失敗した場合の意味 改善へつながる問い
検索と候補選択 どの逆転写酵素系統、近傍遺伝子、特徴を追跡対象として残したかを確認できる。 ART に関連する候補が詳細調査へ送られていなければ、後続工程の性能とは無関係に発見へ到達しない。 有望な候補を早い段階で除外していないか、候補選択へ使った基準が適切だったかを調べられる。
取得した周辺情報 候補について遺伝子注釈だけを取得したのか、上流や下流の非コード領域まで取得したのかを確認できる。 必要な周辺 DNA が取得されていなければ、反復配列はモデルの利用可能な情報へ入らない。 候補ごとに取得する周辺領域の範囲や、非コード領域を調査する条件を見直せる。
読取り範囲 取得したファイルのうち、モデルが実際にどの塩基配列を読んだかを確認できる。 情報を取得していても該当領域を読まなければ、認識能力を使う前に探索が止まる。 ファイル取得と実際の情報利用の間に失敗がないか、表示範囲や読取り方を改善できるかを調べられる。
異常認識 読んだ配列の中から、どの反復、配置、共起を特徴として認識したかを確認できる。 必要な配列まで読んでいて特徴を抽出できなければ、探索より後段の認識能力が制約になっている。 同じ入力を固定して反復評価し、モデルごとの認識率や出力変動を測れる。
仮説と追加追跡 認識した特徴のうち何を重要と判断し、どの関連配列や文献を追加調査したかを確認できる。 異常を認識しても追跡しなければ、単発の特徴から系統的な関係へ発展しない。 どの種類の異常が追加調査へ送られ、どの判断で探索が終了したかを比較できる。
比較と検証 候補を複数例で比較し、既存研究や外部データとどのように照合したかを確認できる。 単一例の特徴を十分な比較なしに一般化すると、偶発的な配置を一つの系として扱う可能性が高まる。 候補を維持または棄却するために必要な比較数、外部証拠、実験条件が十分だったかを監査できる。

探索履歴があると、成功例と失敗例を同じ工程表の上で比較できる。成功した試行では、どの候補を選び、どの範囲の DNA を取得し、どこで反復へ気付き、その後どの関連例を追ったかを確認できる。失敗した試行についても、同じ地点まで進んでいたのか、その前で経路が分岐したのかを照合できる。最終的な発見率だけでは一つの数値に圧縮される差を、工程ごとの成功率として測定できるようになる。

この分解によって、改善対象も具体化する。候補選択の段階で ART 系統へ到達していないなら、モデルの配列認識能力を改善しても全体の成功率は上がりにくい。候補までは到達しているが上流 DNA を読んでいないなら、取得範囲やツール利用方針が対象になる。必要な配列まで読んでも反復を認識しない場合には、初めてモデルの認識能力が直接の改善対象になる。探索経路を記録することで、「モデルを強くする」という一つの対策ではなく、失敗した工程に対応した修正を選べる。

実行記録は、この意味で単なる障害解析用のログとは役割が異なる。デバッグでは、想定した処理がどこで壊れたかを調べることが中心になる。科学的探索では、そもそも唯一の正しい行動系列が事前に定義されていない。どの候補へ進み、どの異常を追跡したかという選択自体が研究過程の一部であるため、実行記録は発見能力を構成する中間変数を観測する資料になる。

これは成功例の説明にも影響する。ART を発見したという最終結果だけでは、Claude がどの能力を使って発見したのかを十分に説明できない。候補選択から生配列の読取りまでの経路が残っていれば、最初から ART を知識として再生したのではなく、逆転写酵素の探索から上流 DNA へ進み、そこで反復構造を認識し、その特徴を別の候補へ展開したことを区別できる。新規性の位置を判断するうえでも、中間経路が証拠になる。

失敗例については、さらに情報量が増える。ART を再発見しなかった試行が、ART に近い候補を一度も選ばなかったのか、候補までは到達したが上流 DNA を取得しなかったのか、配列まで読んだうえで反復を認識しなかったのかによって、探索方法について導ける結論が変わる。再現性を評価するには、成功回数だけでなく、この失敗分布を記録する必要がある。

科学的発見へ AI を使う場合、最終的な論文、候補一覧、生成された説明文だけを保存すると、発見結果は残っても発見能力を後から検証する材料が不足する。どのデータベースを検索し、どの候補を選択し、どのファイルを取得し、どの範囲を読み、どの特徴を根拠に追加調査へ進んだかまで保存すれば、同じ結果を別のモデルや別のツール構成で比較できる。

探索履歴には、再現性を高める役割だけでなく、能力の境界を記述する役割もある。あるモデルが特定の配列を認識できたという記録と、その配列へ自力で到達できたという記録を分離できれば、固定入力で成立する能力を大規模探索全体の能力へ拡張せずに済む。反対に、探索段階で安定して証拠へ到達できることが確認されれば、単発の成功から一段進んだシステム能力として評価できる。

発見の説明可能性も、この外部経路から具体化できる。モデル内部の計算過程を完全に説明することとは別に、外部環境で何を観測し、どの証拠を根拠として追加行動を選び、どの段階で仮説を形成したかを追跡可能にできる。科学では、後から第三者が根拠へ戻れること自体が検証可能性を支えるため、探索経路はシステム運用上の記録であると同時に、研究過程を監査するための記録にもなる。

ART の事例では、最終的な発見だけを保存するより、そこへ至った経路を残すことで得られる情報の方が多い。発見できた理由、再探索で発見できなかった理由、固定入力では高率に認識できた理由を同じ工程上に配置すると、AI の科学的能力を一つの成功率ではなく、候補選択、証拠取得、認識、追跡、検証という複数の能力へ分解できる。探索経路の記録は、発見を再現するためだけではなく、何を能力として評価しているのかを明確にするためにも必要になる。


10. AI による発見には異なる探索構造がある

AI が新しい結果を生み出す研究を一括して「AI による発見」と呼ぶと、どこで探索が行われ、何を基準に候補が残り、どの段階で人間の判断や実験が必要になるかという違いが見えにくくなる。探索対象が数理的な候補なのか、機械学習の研究工程なのか、巨大な生物学データの中にある未記述の関係なのかによって、AI が担う工程と評価方法は変わる。

FunSearch は、評価関数を比較的明確に定義できる問題でこの構造を作った。大規模言語モデルがプログラム候補を生成し、その候補を計算可能な評価関数で採点し、高い得点を得た候補を次の生成へ戻す[23]。候補の生成と評価を同じ計算環境の中で反復できるため、探索は自動化された閉ループとして進む。

この方式では、候補が良いかどうかを判断する基準が探索の外側にあらかじめ用意されている。数学や組合せ最適化では、ある解が目的関数をどれだけ改善したかを数値で比較できる場合がある。モデルが新しい候補を作っても、その候補を採用するかどうかをモデル自身の文章評価だけに頼る必要がなく、独立した計算によって選別できる。

The AI Scientist は別の構造を取る。研究アイデアの生成、コード実装、実験、結果の可視化、論文作成、模擬査読までを一つの自動化された研究工程へ接続した[24]。ここでは探索対象が個々の数理候補ではなく、研究計画とその実行結果である。実験対象が機械学習であるため、コードを実行し、同じ条件を再実行し、結果を数値化するところまで計算環境の中に置きやすい。

FunSearch と The AI Scientist には共通点がある。どちらも、候補を生成した後に評価結果を比較的短い経路で計算へ戻せる。FunSearch では評価関数が候補を順位付けし、The AI Scientist では実験結果や査読評価が研究案の評価材料になる。生成、評価、次の候補生成という循環を計算機上で繰り返せるため、探索経路全体を自動化しやすい。

ART の探索は、この二つより評価ループが開いている。巨大なゲノムデータから候補を探すこと自体は計算機上で進められるが、「この配置は研究する価値があるか」「この反復は偶然か」「この遺伝子との共起を一つの系として扱うべきか」といった判断を単一の数値へ落としにくい。さらに、計算上で特徴的な構造を見つけても、それが実際にどの分子機構を持つかは酵素実験や感染実験など別の観測によって確認する必要がある。

探索構造 主な探索対象 候補の評価方法 評価結果を探索へ戻す方法 探索の外側に残る工程 代表例
評価関数型 プログラム、数理的構成、組合せ最適化の候補を探索する。 目的関数や制約条件に基づいて候補を計算機上で採点する。 高得点の候補を保持し、その情報を次の生成へ戻す。 評価関数では表現できない価値判断や問題設定は人間側に残る。 FunSearch
研究工程型 研究アイデア、実装、実験結果、論文という一連の研究工程を探索する。 コード実行による実験結果、自動評価、模擬査読などを組み合わせる。 実験結果や評価を次の研究案、実装、論文修正へ反映する。 研究価値の最終判断、外部世界での妥当性、独立した追試は計算環境の外側に残る。 The AI Scientist
異常探索型 巨大な既存データから、未記述の配置、共起、反復、関係を探索する。 複数の計算上の証拠を集め、既存知識との整合性や異常性を判断する。 見つけた異常から追加検索や比較対象を選び、探索範囲を更新する。 生物学的機能、因果関係、実験的妥当性は人間レビューと実験による確認が必要になる。 ART の探索

ART の探索では、評価関数型のような単一の得点が存在しない。反復配列が多いこと、逆転写酵素と近接していること、関連する系統でも同じ配置が現れること、既存 RNA-seq データで転写されていることは、それぞれ候補を支持する別の証拠である。どれか一つだけで ART の生物学的意味が確定するわけではなく、複数の観測を重ねて研究対象としての価値を判断する必要がある。

この違いは探索の止め方にも現れる。FunSearch では評価値が改善しなくなった場合や計算予算を使い切った場合に探索を終了できる。機械学習実験でも、指定した評価指標や実験条件に基づいて次の試行を決められる。異常探索では、候補にどこまで追加調査する価値があるか自体が途中の判断対象になる。ある配列に反復を見つけた時点で止めるか、近縁系統を調べるか、既存文献を検索するか、RNA 発現まで確認するかによって、同じ候補から得られる結論が変わる。

このため、異常探索型では候補選択と追加追跡の経路が特に重要になる。正解候補が最初からラベルとして存在しないため、モデルは既知の答えを検索しているのではなく、どの特徴を研究対象として残すかを途中で判断する。ART では、上流 DNA の反復へ気付き、それを近縁 RT へ展開して比較したことで、一つの異常な配列が系として整理された。最初の認識と、その後の追跡の両方が成立して初めて発見へつながっている。

Anthropic も、計算探索と実験を同じ主体へ閉じてはいない。Claude は候補探索、配列の比較、文献照合、仮説形成を進める一方、実験室での検証は人間の科学者が担当している[9]。これは自動化の不足だけを意味するのではなく、生物学的な主張を確定するための観測装置が計算機の外側にあることを反映している。配列から構造を推定する処理と、実際の酵素活性や感染時の機能を測る処理では、必要な実験系が異なる。

この比較から、AI による科学的発見の能力は「どれだけ自律的か」という一軸だけでは整理しにくい。評価関数を計算機上で閉じられる問題では、生成から選別までを大量に反復できる。研究工程をコード化できる領域では、実験と評価を含む長いループを自動化できる。生物学的な異常探索では、計算上の探索を広く自動化できても、候補の意味付けと実験的検証には別の証拠が必要になる。

探索構造が違えば、再現性の測り方も変わる。FunSearch では同じ評価関数の下でどれだけ高い解へ到達できるかを反復できる。The AI Scientist では研究案、実験結果、評価の流れを再実行できる。ART では、候補選択から配列読取りまでの探索経路を再び成立させられるかと、すでに見つかった ART の生物学的機能を独立に再現できるかを分けて測る必要がある。

AI による発見を一括りにすると、この差が「AI が新しいものを見つけた」という共通結果の下に隠れる。実際には、候補の良し悪しを自動評価できる探索と、何が重要な異常かという判断そのものを探索中に形成する方法では、システム設計も検証方法も異なる。ART は後者の特徴を強く持つ。巨大な既存データから未知の関係を探す科学では、モデルが候補を生成できるかだけでなく、何を観測し、どの異常を残し、どこまで追跡し、その後どの実験へ渡すかという探索構造全体が発見能力を決める。


11. AI の科学的発見は既存知識、探索、認識、検証の連鎖として評価する

ART の発見を工程へ分解すると、AI が単独で未知の答えを生成したという一つの出来事では表せない構造が見える。出発点には、既存研究が記載していた逆転写酵素、公開済みのファージ配列、既存の RNA-seq データがある。その上で Claude のエージェントが多数の候補から調査対象を選び、周辺 DNA を取得し、生の塩基配列から反復構造を認識し、関連する逆転写酵素群へ探索を広げた。さらに、得られた候補を既存研究や転写データと照合し、人間の研究者によるレビューと実験へ渡している。

各工程では、確定できる主張の種類が異なる。ゲノム上に反復配列が存在することは配列解析から確認できる。複数の関連する逆転写酵素で同じ配置が現れることは比較解析から確認できる。反復配列を含む領域から RNA が発現することは RNA-seq データから確認できる。一方、その RNA が逆転写酵素の直接的な基質になることや、ART 全体が特定の生物学的機能を持つことには別の実験が必要になる。発見工程を分けることは、そのまま証拠が保証する範囲を分けることでもある。

既稿では、AI の生成物を受理する条件を、検証対象、検証単位、判定規則、保証範囲からなる検証契約として整理した[25]。科学的発見にも同じ分離が適用できる。ART の候補を計算上で抽出できたこと、反復配列が複数の系統に存在すること、その領域から RNA が発現すること、逆転写酵素が特定の反応を行うこと、生物学的に特定の機能を担うことは、それぞれ異なる検証対象である。前の段階が確認されたからといって、後ろの段階まで自動的に保証されるわけではない。

工程 今回使われた根拠 そこから確認できること その段階では確定しないこと
既存知識 既報の逆転写酵素、ファージゲノム、非コード領域、公開済み RNA-seq データを利用する。 ART の候補となった構成要素の一部が以前から観測されていたことを確認できる。 それらが一つの ART 系を構成することまでは既存資料だけでは確定しない。
探索 多数の逆転写酵素から候補を選び、周辺 DNA を取得し、関連例を追加検索する。 既存データの中から、詳細調査する価値がある候補へ到達できる。 候補へ到達しただけでは、その候補が生物学的に意味のある新規系であることは確定しない。
認識 生の塩基配列を読み、規則的な反復、逆転写酵素、パートナー遺伝子の配置を比較する。 従来一つの単位として記述されていなかった共通構造を ART として切り出せる。 配列上の共通構造だけでは、分子機構や生物学的機能は確定しない。
既存データとの照合 公開済み RNA-seq データを ART の座標から再解析する。 少なくとも一部の ART で反復配列を含む領域から RNA が発現することを確認できる。 その RNA が逆転写酵素の直接的な基質であることや、発現の機能的意味までは確定しない。
実験的検証 酵素反応、RNA との対応、感染時の表現型などを実験で測定する。 計算上で抽出された構造を、実際の分子機構や生物学的機能へ接続できる。 個別の実験条件を超えて、ART 全体へどこまで一般化できるかには追加の検証が必要になる。
探索能力の評価 固定入力の反復試行と、探索キャンペーンの再実行を比較する。 認識能力、証拠への到達能力、探索経路の反復可能性を別々に評価できる。 今回の成功率だけから、別分野や別データでも同じ発見能力が成立するとは確定しない。

Anthropic の報告から現在確認できる範囲も、この工程に沿って整理できる。ART としてまとめられる反復配列、逆転写酵素、パートナー遺伝子の配置が複数のジャンボファージ系統で見つかり、少なくとも一部では反復領域から RNA が発現している[9][10]。さらに、Claude のエージェントが大規模探索中に候補の上流 DNA を読み、反復へ気付き、関連例を追跡した経路も記録されている[10]。

ここまでの証拠からは、ART というゲノム構造の候補が存在することと、その構造へ Claude の探索から到達したことを支持できる。一方、ART に含まれる逆転写酵素がどの RNA を直接利用し、どのような DNA 産物を作るか、パートナー遺伝子が何を担うか、系全体がファージ感染の中でどのような機能を果たすかは別の検証段階にある。計算探索の成果を保ったまま、生物学的な主張の確定範囲を限定できる。

AI 側の評価にも同じ分解が必要になる。対象配列を直接入力した場合には、能力の高いモデルが高い頻度で反復構造を認識した[10]。この結果は、証拠が観測範囲へ入った後の認識能力を支える。一方、ファイルやツールから必要な配列を取得する条件では認識率が下がり、必要な長さの配列を読まない試行も生じた。ここでは、認識能力の前に情報取得という別の工程が加わっている。

さらに、実際の探索で一度 ART へ到達したことと、その経路が反復可能な探索方法として成立することも分けられる。最初の成功は、候補選択、周辺 DNA の取得、反復認識、関連例の追跡という経路が少なくとも一度成立した証拠になる。再探索で同じ発見へ安定して到達しなければ、改善対象は最終的な配列認識だけではなく、その前にある候補選択や情報取得まで含まれる。

このため、AI による科学的発見を評価するときには、最終レポートだけでは情報が足りない。何を検索したか、どの候補を残したか、どの周辺配列を取得したか、実際にどの範囲を読んだか、何を異常として認識したか、その異常から何を追加調査したかという探索履歴が必要になる。探索履歴があれば、発見に成功した理由と失敗した理由を同じ工程上で比較できる。

ここまでの構造をまとめると、AI による科学的発見には三つの異なる評価軸がある。第一は、既存知識や既存データの中から従来記述されていなかった関係を認識できるかである。第二は、その関係を含む証拠へ巨大な探索空間から自力で到達できるかである。第三は、その到達を一度の成功にとどめず、条件を変えた試行でも一定の確率で成立させられるかである。この三つは互いに置き換えられず、それぞれ別の証拠を必要とする。

ART は、この三つを同じ事例の中で観察できる。構成要素の一部は以前から知られていたが、その配置は ART という系として整理されていなかった。Claude は大規模探索の中で生の配列へ到達し、その関係を認識した。固定入力では高率に特徴を読み取れる一方、探索全体では証拠への到達がより不安定だった。この差によって、「モデルが分かるか」と「エージェントが見つけられるか」と「方法として繰り返せるか」を別々に議論できる。

AI が科学へ加わることで変わるのは、人間が蓄積してきた知識やデータが不要になることではない。むしろ、蓄積されたデータ量が人間の詳細な観察能力を超えたとき、その中からどの証拠を読むかという探索を機械へ広げられる可能性が生まれる。既知のデータを別の経路から読み、新しい関係を候補として切り出し、それを人間や独立した実験が検証するという役割分担になる。

ART が示す科学的発見の姿は、AI が科学者から答えを受け取る役割を奪ったという構図より具体的である。既存の配列、過去の研究、公開データを出発点として、AI が人間とは異なる規模と経路で証拠を探索し、未記述の関係を候補として提示する。その候補を実験で確かめ、どこまで一般化できるかを検証する工程は続く。

この連鎖まで含めて評価すると、AI の科学的発見能力を一度の成果や一つの性能値へ圧縮せずに済む。何を既存知識から受け取り、どの証拠へ到達し、何を新しく認識し、どの主張を独立した検証へ渡したのかを分けられる。そして、その探索経路がどの程度反復するかまで測ることで、一件の興味深い成功を、継続して利用できる科学的方法へ近づけるための条件も見える。


参考文献

  1. Mojica FJM, Díez-Villaseñor C, García-Martínez J, Soria E, Intervening sequences of regularly spaced prokaryotic repeats derive from foreign genetic elements, Journal of Molecular Evolution, 2005. https://pubmed.ncbi.nlm.nih.gov/15791728/
  2. Barrangou R et al., CRISPR provides acquired resistance against viruses in prokaryotes, Science, 2007. https://pubmed.ncbi.nlm.nih.gov/17379808/
  3. Doron S et al., Systematic discovery of antiphage defense systems in the microbial pangenome, Science, 2018. https://pubmed.ncbi.nlm.nih.gov/29371424/
  4. Gao L et al., Diverse enzymatic activities mediate antiviral immunity in prokaryotes, Science, 2020. https://pubmed.ncbi.nlm.nih.gov/32855333/
  5. Millman A et al., Bacterial Retrons Function In Anti-Phage Defense, Cell, 2020. https://pubmed.ncbi.nlm.nih.gov/33157039/
  6. Korn A et al., Comparative Genomics of Three Novel Jumbo Bacteriophages Infecting Staphylococcus aureus, Journal of Virology, 2021. https://pmc.ncbi.nlm.nih.gov/articles/PMC8428398/
  7. Zhang B et al., Interactions between Jumbo Phage SA1 and Staphylococcus: A Global Transcriptomic Analysis, Microorganisms, 2022. https://www.mdpi.com/2076-2607/10/8/1590
  8. Altae-Tran H et al., Uncovering the functional diversity of rare CRISPR-Cas systems with deep terascale clustering, Science, 2023. https://pmc.ncbi.nlm.nih.gov/articles/PMC10910872/
  9. Anthropic, Claude discovers a novel enzyme system with CRISPR-like repeats, 2026-09-23. https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
  10. Yoon PH, Athukoralage JS, Ameisen E, Kauderer-Abrams E, Perry NT, Durrant MG, Autonomous AI Agents Discover Reverse Transcriptases with Tandem Repeat Arrays, 2026. https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf
  11. Li DB et al., Coevolutionary mining of prokaryotic non-coding elements with a genome language model, bioRxiv, 2026. https://www.biorxiv.org/content/10.64898/2026.09.22.753630v1
  12. id774, AI がテストを通しても、「正しい」とは限らない(2026-09-01). https://blog.id774.net/entry/2026/09/01/5534/
  13. Liu NF et al., Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics, 2024. https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00638/119630/Lost-in-the-Middle-How-Language-Models-Use-Long
  14. id774, AI に仕事を任せるには、モデルの外側を設計する(2026-08-21). https://blog.id774.net/entry/2026/08/21/5544/
  15. Yao S et al., ReAct: Synergizing Reasoning and Acting in Language Models, 2022. https://arxiv.org/abs/2210.03629
  16. Jimenez CE et al., SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, 2023. https://arxiv.org/abs/2310.06770
  17. Yang J et al., SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering, 2024. https://arxiv.org/abs/2405.15793
  18. Liu X et al., AgentBench: Evaluating LLMs as Agents, 2023. https://arxiv.org/abs/2308.03688
  19. Zhou S et al., WebArena: A Realistic Web Environment for Building Autonomous Agents, 2023. https://arxiv.org/abs/2307.13854
  20. id774, AI は正しさではなく、評価の通り方を学ぶことがある(2026-09-05). https://blog.id774.net/entry/2026/09/05/5490/
  21. id774, 正しい数字から間違った結論は作れる(2026-09-23). https://blog.id774.net/entry/2026/09/23/5721/
  22. Goodman SN, Fanelli D, Ioannidis JPA, What does research reproducibility mean?, Science Translational Medicine, 2016. https://pubmed.ncbi.nlm.nih.gov/27252173/
  23. Romera-Paredes B et al., Mathematical discoveries from program search with large language models, Nature, 2023. https://www.nature.com/articles/s41586-023-06924-6
  24. Lu C et al., The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery, 2024. https://arxiv.org/abs/2408.06292
  25. id774, AI の「正しい」を決める検証契約(2026-09-24). https://blog.id774.net/entry/2026/09/24/5642/