医療 AI で欠けた情報を補うには別の根拠が必要になる

医療データは、患者の状態そのものではなく、測定装置、検査方法、撮影時点、記録項目によって切り取られた観測結果である。X 線は三次元の身体を二次元へ投影するため、奥行き方向の位置関係を直接保持しない。MRI や臨床検査は患者ごとに実施状況が異なるため、同じ診療記録の中でも利用できる情報の組み合わせが変わる。定期検診では、連続して進行する病態を数か月から数年ごとの離散的な時点で記録する。医療 AI が受け取るデータには、測定が成立した時点ですでに、空間、検査項目、時間という複数の方向で情報の欠落が含まれている。

この条件では、データ量を増やすことと、失われた情報を回復することを分けて考える必要がある。二次元 X 線を大量に集めても、投影によって失われた奥行きが画像枚数に比例して戻るわけではない。検査記録を大量に集めても、個々の患者で実施されなかった MRI や認知機能検査の値は残らない。年次検診の症例数が増えても、一人の患者について撮影されていない期間の変化は直接観測できない。観測数の増加は標本数を増やすが、測定過程そのものが落とした情報には別の根拠が必要になる。

そこで焦点になるのが、観測されなかった部分を何によって拘束できるかである。X 線なら、同じ身体を三次元で記録した CT と投影物理を使えば、二次元画像だけからは分離しにくい解剖構造へ外部から制約を与えられる。ある検査が欠けている患者でも、同じ患者について存在する別の検査があれば、両者の関係から利用可能な表現を作れる場合がある。単一時点では弱い変化でも、同一患者の過去画像を並べれば、時間方向の移動として捉えられる場合がある。推定の候補を狭める情報が別経路から存在すると、単なる補完ではなく、根拠を持った推定として検証できる。

2026 年 9 月に公開された三つの医療 AI 研究は、それぞれ異なる欠落を扱っている。FleXray は X 線で失われる三次元解剖と密な正解ラベルを CT と物理シミュレーションから補い、MMAP は MRI または臨床表データが欠ける状態そのものを学習条件へ組み込み、乳房 X 線の研究は複数年の画像を基盤モデルの表現空間で追跡して診断前の変化を測っている。対象疾患もモデル構成も異なるが、共通しているのは、観測されたデータだけを増やすのではなく、観測の外側に残っている構造を使って推定範囲を狭めている点である。


1. 医療データは患者の状態そのものではない

医療画像や検査値を AI へ入力すると、計算上は画素値や数値の集合として完全な入力が与えられる。しかし、その入力が患者の状態をどのように測定した結果なのかまで遡ると、観測できた情報と観測過程で失われた情報を分けられる。胸部 X 線では、肺、肋骨、心臓、脊椎など奥行きの異なる構造が一枚の平面へ重なって投影される。画像の各画素には複数の組織から届いた X 線減衰の結果が重なるため、二次元画像だけから元の三次元配置を一意に戻すことは難しい。画像自体が高解像度でも、投影時に統合された奥行き情報は別の情報源なしには復元できない。

MRI や臨床検査では、失われ方そのものが異なる。ある患者には MRI があり、別の患者には認知機能検査だけがあり、両方が揃う患者もいる。欠測値を含む表形式データであれば一部の項目だけが空欄になることもある。ここで生じているのは、画像内部の情報圧縮ではなく、観測経路そのものの欠落である。AI が完全な入力を前提として設計されている場合、検査が一つ欠けただけで、その患者を学習や推論から除外する必要が生じる。欠損は一項目の空欄にとどまらず、利用できる症例数や対象患者の分布まで変える。

時間方向では、さらに別の制約が生じる。乳房組織や腫瘍は連続的に変化するが、マンモグラムは検診時点でしか撮影されない。年 1 回の撮影なら、一年間の変化は開始点と終了点に近い二枚の画像として残り、その間の過程は直接記録されない。各画像を独立した症例として扱えば、同一患者の前年画像と今年画像の関係も入力から外れる。画像そのものは存在していても、患者内の時間的な変化を使わなければ、観測済みデータの一部を解析上捨てることになる。

この三つを同じ「データ不足」として扱うと、対策の選択を誤りやすい。X 線で不足しているのは主に三次元構造と密な教師ラベルであり、検査欠損では入力経路そのものが存在せず、縦断画像では観測済み時点同士の関係が利用されていない。それぞれ必要なのは、画像枚数の単純な追加、欠損値の一律な埋め合わせ、単一時点の分類精度向上ではなく、失われた情報の種類に対応する別の構造である。

観測のどこで情報が失われたかを特定すると、利用できる拘束条件も定まる。投影で失われた空間情報には三次元解剖と投影物理を使える。検査そのものが欠けている場合には、同一患者について存在する別モダリティーとの関係を利用できる。時間方向の情報には、同一患者の過去画像という実測履歴がある。観測の欠落を一種類として扱わず、欠落が生じた過程まで分解することで、何を根拠に補えるかという設計へ進める。


2. 欠けている情報が違えば補い方も違う

観測から情報が失われる位置が違えば、補完に使える根拠も変わる。X 線では、三次元構造を二次元へ投影する過程で奥行きと構造間の分離が失われる。検査欠損では、MRI や臨床検査そのものが患者ごとに存在しない。縦断画像では各時点の観測は残っていても、画像を独立に扱うことで時間方向の関係が解析対象から外れる。三つはすべて不完全な観測だが、情報が失われた原因が異なるため、同じ補完方法を適用しても必要な情報は戻らない。

FleXray が扱うのは、X 線画像に対して全身の密な解剖ラベルを大量に作る難しさである。X 線では複数の組織が同じ画素へ重なって投影されるため、二次元画像だけを見て個々の解剖構造の境界を確定するには曖昧さが残る。FleXray は、この曖昧さを人手による二次元ラベル付けだけで解消する代わりに、すでに三次元構造が分かっている CT を利用する。CT 上の解剖ラベルを X 線撮影の物理条件に従って投影すれば、二次元画像と対応する教師ラベルを同時に生成できる。論文では 60 種類の解剖構造を対象に学習し、学習に使っていない X 線データセットや実臨床に近い画像で一般化性能を評価している[1]。

この場合、補完の根拠はモデル内部だけにあるわけではない。元となる CT には三次元の解剖構造があり、X 線投影には撮影方向や減衰という物理的な制約がある。その二つを組み合わせることで、二次元 X 線だけからは直接確定しにくい解剖ラベルの候補を狭められる。FleXray が作っているのは単なる大量の合成画像ではなく、三次元解剖と投影条件によって正解の由来を追跡できる教師データである。

MMAP では、情報が失われる場所が画像内部から患者単位の検査構成へ移る。MRI と認知・臨床検査がすべての患者で揃うとは限らず、画像だけが存在する症例、表形式データだけが存在する症例、両方が存在する症例が混在する。完全な入力だけを前提にすると、欠損のある患者を除外するか、入力条件ごとに別の処理経路を用意する必要が生じる。患者の除外が増えれば学習に利用できる症例数が減り、欠損の発生条件に偏りがあれば、残った患者集団の構成も変わる。

MMAP は欠損状態そのものを学習条件へ組み込み、両方揃った入力、MRI のみ、表形式データのみという三つの状態を一つのモデルで扱う。MRI が存在しない場合には表形式データから MRI 側に対応する潜在表現を生成し、表形式データが存在しない場合には MRI から反対側の潜在表現を生成する[2]。ここで補っているのは欠けた MRI 画像や検査値そのものではなく、将来予測に必要な表現である。存在するモダリティーと欠けたモダリティーの関係を学習することで、入力経路の欠落を潜在空間で吸収している。

乳房 X 線の研究では、データ自体は存在していても、時間方向の関係を使わなければ情報が失われる。研究では 1,773 人の生検対象者と、それぞれに対応させた 1,773 人の対照について、複数年にわたるマンモグラムを基盤モデルの埋め込みへ変換している。診断時の悪性例と対照例から表現空間上の「がん方向」を定義し、各患者の過去画像がその方向へどの速度で移動したかを測定した[3]。

単一時点の画像だけを入力すれば、その時点の形態は利用できる。一方、同一患者の前年画像と当年画像を結ぶと、静止画像には表れにくい変化量と変化方向を追加の情報として扱える。時間方向の拘束条件として使われるのは、モデルが生成した仮想的な過去ではなく、その患者について実際に撮影された過去画像である。観測済みの時点同士を関係付けることで、個々の画像だけでは利用しにくい診断前変化を解析対象へ戻している。

欠けているもの 情報が失われる過程 拘束に使う情報 推定対象 研究
空間 三次元構造が二次元へ重なって投影され、奥行きと構造間の分離が失われる。 CT の三次元解剖と X 線投影物理を利用する。 二次元 X 線上の解剖構造と対応する教師ラベルを得る。 FleXray
モダリティー 患者ごとに MRI や臨床検査の実施状況が異なり、入力経路そのものが欠ける。 同一患者について存在する別モダリティーを利用する。 欠けた側に対応する潜在表現を生成し、将来予測へ利用する。 MMAP
時間 病態は連続して変化する一方、撮影は離散的で、各画像を独立に扱うと患者内変化が失われる。 同一患者について実際に撮影された過去のマンモグラムを利用する。 基盤モデルの表現空間における診断前の移動速度を測る。 乳房 X 線の埋め込み速度解析

三つを並べると、「欠けた情報を補う」という同じ表現の中に異なる処理が含まれていることが分かる。FleXray は別の撮像方式で得た三次元構造を二次元へ変換し、MMAP は別モダリティーとの対応関係から潜在表現を作り、乳房 X 線の研究は過去の実測値との時間的な関係を利用する。いずれも、存在しない情報を無条件に生成するのではなく、観測とは別に利用できる構造によって推定可能な範囲を狭めている。

この違いは、補完結果を評価するときにも効いてくる。空間情報を補うなら、未使用の実 X 線上で解剖構造が正しく分離できるかを測れる。モダリティー欠損を補うなら、完全入力時と欠損入力時を分けて将来予測性能を比較できる。時間方向の情報を使うなら、悪性例と対照例で表現の移動速度がどの時点から異なるかを検証できる。補完の方法だけでなく、何を根拠として補い、その結果をどの実測データへ戻して確かめるかまでが一つの設計になる。


3. 三次元の解剖から二次元 X 線の正解を作る

X 線のセグメンテーションで最も不足しやすいのは、画像そのものより、画素ごとの正解ラベルである。胸部や骨盤の X 線では、肋骨、椎骨、肩甲骨、肺、心陰影など奥行きの異なる構造が同じ二次元平面へ重なって写る。人が見れば全体像として解剖を理解できても、各画素がどの構造に属するかを一貫して確定するには、奥行き方向に重なった情報をほどく必要がある。ここで難しいのは、単に手間が大きいことではない。二次元画像そのものに、三次元配置を一意に分離する情報が十分に含まれていないため、人手で大量の密ラベルを作ろうとしても、構造境界の確定に曖昧さが残る。

FleXray は、この曖昧さを二次元画像上の熟練者判断だけで解決する代わりに、三次元で既知の解剖構造を持つ CT を出発点にした。研究では 6 個の CT データセットから 2,159 人分を集め、各データセットが持つ解剖ラベルを 60 構造の共通語彙へ統合している[1]。ここで必要になるのは、単に複数データセットを束ねることではない。データセットごとにラベルの範囲や粒度が異なるため、そのままでは同じ名称でも示す領域が一致しない。共通語彙への統合は、後段で作る合成 X 線教師データの意味を揃え、学習時に構造ごとの定義が揺れないようにする役割を持つ。

CT から X 線相当画像を作る過程でも、画像だけを変換して終わらせていない。研究では撮影方向、視野、倍率、投影幾何を変えながら X 線相当の投影画像を生成し、そのとき使ったのと同じ条件で三次元ラベルも二次元へ投影する[1]。この処理により、画像と正解ラベルの対応関係が生成時点から保たれる。二次元 X 線だけから解剖ラベルを作る場合には、重なった骨や臓器の境界をあとから推定し直す必要がある。FleXray では、三次元で既知の構造を先に持ち、その構造がどのように二次元へ見えるかを物理条件付きで計算するため、教師ラベルの由来を追跡できる。

構成要素 FleXray での役割 補っている情報 単独では残る制約
CT の三次元解剖 臓器や骨の位置と境界を三次元で既知の情報として与える。 二次元 X 線だけでは分離しにくい奥行きと構造間の対応を補う。 CT の撮影範囲や患者集団に含まれない部位や条件は十分に表現できない。
X 線投影物理 三次元解剖を撮影方向、視野、倍率などの条件に従って二次元へ変換する。 三次元ラベルと二次元画像の対応関係を同じ撮影条件の下で維持する。 散乱や装置固有の外観など、実 X 線のすべての変動を物理モデルだけで再現できるわけではない。
投影された教師ラベル 生成した X 線相当画像に対して、60 構造の画素単位の正解を提供する。 人手では大量作成が難しい密な解剖ラベルを補う。 元となる三次元ラベルの定義や品質に依存する。
実 X 線 CT 由来データだけでは覆いにくい末梢部位や実際の撮影分布を補完する。 現実の撮影条件、視野、被写体配置、装置由来の変動を学習へ加える。 764 枚に限られるため、実臨床で生じるすべての条件を網羅するわけではない。

この設計で補っているのは、正解ラベルの量だけではない。三次元構造から二次元投影へ下ろすことで、X 線一枚だけでは分離しにくい解剖の対応関係を外部から拘束している。二次元画像上で肋骨と肺野の境界が曖昧に見えても、元の CT 側でどの領域がどの構造に属するかが定義されていれば、投影後のラベル候補を任意に広げずに済む。教師データの生成が成立するのは、解剖学的な既知情報と投影物理が、推定結果とは独立した制約として機能しているからである。

一方、CT だけでは X 線の撮影領域を十分に覆えない部分もある。特に末梢部位では、利用可能な CT の範囲と実際の X 線撮影対象にずれがあるため、研究では 764 枚の実 X 線を追加し、CT 由来データだけでは埋めにくい部位を補っている[1]。この追加は、合成データだけで閉じた学習系を作らないという意味を持つ。CT 由来の投影画像が理論上整合していても、実際の撮影条件、視野、被写体配置、装置由来の特徴とはずれが残る。実 X 線を組み合わせることで、三次元解剖と投影物理から作った教師データを、現実の観測分布へ接続している。

この学習分布がどこまで一般化したかは、未使用の 8 データセットで評価されている。FleXray の等重み平均 Dice は 0.875 で、各評価データセット専用に教師あり学習した nnU-Net の平均 0.914 に対して差は 0.039 だった[1]。この差は、完全にそのデータセットへ合わせて学習した専用モデルと比べれば小さくはないが、汎用モデルとして複数の身体部位と撮影条件を一つにまとめて学習した結果として読む必要がある。比較相手の nnU-Net は各データセットごとに最適化されているのに対し、FleXray は単一の学習枠組みで広い条件を覆っている。ここで示されているのは、個別最適化に届くかどうかだけでなく、条件の異なる X 線へどこまで共通の解剖表現を持ち込めるかである。

DeepFluoro では FleXray が 0.915、同データセット専用 nnU-Net が 0.866 だった[1]。この比較では FleXray が専用 nnU-Net を上回ったが、この差だけから性能差の原因までは特定できない。

FleXray の中心は、CT から X 線相当画像を大量に生成したことだけでは捉えきれない。三次元で既知の解剖構造、二次元への投影物理、現実の X 線観測を一つの学習過程へ接続し、教師ラベルの由来と誤差評価の基準を残したことに意味がある。正解ラベルが不足する問題に対して、単に枚数を増やすのではなく、正解をどの構造から導けるかを再設計したことが、FleXray の一般化性能を支える基盤になっている。


4. 写実性と実世界の変動範囲は別の評価軸になる

合成画像を実データへ近づけるとき、見た目の自然さは分かりやすい評価対象になる。X 線では、骨や臓器の形だけでなく、散乱による濃淡、装置固有の画像特性、文字やマーカー、撮影姿勢による重なり方などが実画像の外観を構成する。物理シミュレーションだけでこれらを完全に再現するには、人体モデル、撮影装置、散乱、画像処理まで含む多数の条件をモデル化する必要がある。FleXray は、この物理モデルだけでは残る外観差を縮めるため、生成モデルによる画像編集を組み合わせている[1]。

ただし、外観が実画像へ近づいたことと、セグメンテーション性能が全体として改善したことは一致しなかった。生成補正を使った場合と使わない場合を比較すると、未使用の 8 データセットに対する平均 Dice はどちらも 0.870 だった[1]。生成補正によって合成画像と実画像の見た目の隔たりを縮めても、全解剖構造をまとめた平均性能には差が現れなかった。この結果から、合成データの価値を写実性だけで評価すると、学習に必要な変動を捉え損なうことが分かる。

一方、改善が局所的に現れた構造もある。腹部臓器との重なりが大きく、単純な投影モデルでは実 X 線の外観を再現しにくい下位肋骨では、生成補正による改善が確認された。肋骨 5~10 をまとめた Dice は 3.9 ポイント上昇した[1]。全体平均が変わらなくても、物理モデルと実画像の差が大きい領域では生成補正が不足部分を埋めている。生成モデルの効果は画像全体へ均等に現れるのではなく、元のシミュレーションが十分に表現できなかった条件へ集中している。

FleXray が別に導入した減衰率のランダム化は、さらに異なる変動を対象にしている。肺炎などの病変が存在すると、正常例とは組織密度や X 線の透過特性が変わり、肺野の濃度分布も変化する。正常な CT を一定の減衰条件で投影するだけでは、この病変に伴う画像変化が学習分布へ十分に入らない。そこで臓器ごとの減衰率を変化させることで、同じ解剖構造でも異なる X 線濃度を持つ画像を生成している[1]。

この操作では、肺炎症例に対する肺セグメンテーションの Dice が 0.894 から 0.914 へ上昇し、Dice 0.85 未満となる肺炎画像は 122 枚から 50 枚へ減少した[1]。改善の因果関係は二段階に分けられる。まず、減衰率を固定した合成データだけでは、病変によって変化する実 X 線の濃度分布が学習範囲から外れやすい。次に、その変動を学習時から加えることで、モデルが特定の正常濃度へ過度に依存する必要が減り、病変が存在する画像でも解剖構造を追跡しやすくなる。ここで改善しているのは画像の写実性そのものより、実際に遭遇する入力変動に対する頑健性である。

操作 変化させる対象 狙い 観測された結果 評価上の意味
生成画像補正 散乱、文字、装置由来の外観など、物理投影だけでは再現しにくい画像表現を変化させる。 合成 X 線と実 X 線の外観差を縮める。 8 データセットの平均 Dice は 0.870 のままだったが、肋骨 5~10 の Dice は 3.9 ポイント改善した。 写実性の改善は全体性能へ一様に反映されず、物理モデルの不足が大きい領域へ局所的に寄与した。
減衰率のランダム化 同じ解剖構造に対する X 線の透過率や画像濃度を変化させる。 病変による濃度変化を学習分布へ含める。 肺炎症例の肺 Dice が 0.894 から 0.914 へ上昇し、Dice 0.85 未満の画像が 122 枚から 50 枚へ減少した。 実画像の見た目を一点へ近づけるより、実診療で発生する変動範囲を覆うことで頑健性が改善した。

二つの操作を比較すると、写実性と分布被覆を別の評価軸として扱う理由が明確になる。写実性は、生成された一枚の画像が実 X 線らしく見えるかを評価する。一方の分布被覆は、学習時に与えた画像群が、撮影方向、視野、倍率、画像濃度、病変など、推論時に現れる条件の幅をどこまで含んでいるかを評価する。写実的な画像を一種類だけ精密に作っても、その条件から外れた患者に対する性能は保証されない。多少人工的な変動を含んでいても、実際に発生する条件を広く覆えば、モデルが特定条件へ依存する度合いを下げられる。

この考え方は、シミュレーションから実世界へモデルを移す研究で使われてきた Domain Randomization と共通する。Domain Randomization では、シミュレーターの画像を現実と完全に一致させることより、物体の外観、照明、位置、カメラ条件などを意図的に広く変化させる。現実の観測条件がその変動範囲へ入れば、モデルはシミュレーション固有の一条件へ依存せず、実世界でも利用できる特徴を学びやすくなる[4]。

FleXray は、この考え方を医療画像へそのまま移したものではないが、学習分布を構成する原理には共通点がある。撮影方向や投影幾何を変え、臓器の減衰率を変え、生成モデルで物理シミュレーションが不得意な外観を補い、さらに実 X 線を加える。それぞれの処理は同じ画像を少しずつリアルにするためだけに存在するのではなく、異なる種類の分布差を埋めている。撮影幾何の差、病変による濃度差、物理モデルで表現しにくい外観差、CT の対象範囲と実 X 線の撮影部位との差を、別々の方法で補っている。

既稿「生成 AI が書き換えた世界を、次の AI が学ぶ」では、モデルが生成したデータだけで学習系が循環する場合と、外部世界から独立した観測が継続して入る場合を分けて考えた[5]。FleXray の構成にも同じ区別を適用できる。生成モデルによる画像補正だけを繰り返す構成ではなく、CT の三次元解剖、X 線投影物理、764 枚の実 X 線、未使用データセットでの外部評価という複数の参照点が残っている。生成結果の妥当性を、生成モデル自身とは別の情報源へ戻って確認できる。

合成データの設計では、実画像と同じ見た目を作れたかという問いだけでは十分ではない。どの実世界の変動が学習分布から漏れているか、その漏れをどの情報源で補ったか、補完によってどの条件の失敗が減ったかまで追う必要がある。FleXray では、生成補正の平均 Dice が変わらなかった一方で下位肋骨に局所的な改善が現れ、減衰率のランダム化では肺炎症例の失敗数が大きく減った。この差は、合成データの品質を一つの「リアルさ」で評価するより、実世界のどの変動を覆えるようになったかで評価する方が、モデルの一般化性能との関係を具体的に捉えられることを示している。


5. 欠けた検査を学習条件として扱う

MMAP が扱う欠落は、画像内部の見えにくさではなく、患者ごとに検査そのものが存在したり存在しなかったりすることで生じる。研究では Alzheimer’s Disease Neuroimaging Initiative の 1,258 人から、5,548 件の T1 強調 MRI と認知・臨床検査の表形式データを利用し、現在時点の情報から 1~3 年後の MCI からアルツハイマー病への移行と、将来のアミロイド状態を予測している[2]。同じ患者集団でも、MRI と表形式データが常に同時に揃うとは限らないため、欠損は例外的な異常ではなく、学習対象そのものの構成条件になる。

この種のデータで完全な入力だけを採用すると、二つの影響が生じる。第一に、どちらか一方の検査が欠けた患者を学習や推論から外す必要があり、利用できる症例数が減る。第二に、検査の欠損が無作為でなければ、除外後の患者集団そのものが変わる。高齢者や病状の重い患者ほど一部検査を受けにくい、施設ごとに利用できる検査が違うといった条件があれば、完全データだけを集めた集合は元の患者集団と同じ分布を保たない可能性がある。入力欠損への対応は、単なる前処理ではなく、どの患者をモデルが扱えるかという適用範囲にも関わる。

従来のマルチモーダル学習では、MRI と表形式データが揃った状態で両者を融合する設計が基本になりやすい。MMAP はこの前提を変え、学習段階から三つの入力条件を扱う。MRI と表形式データの両方が存在する場合、MRI だけが存在する場合、表形式データだけが存在する場合である。欠損を推論時だけの例外処理として後付けするのではなく、どの入力が欠けても処理を続けることを事前学習の条件へ含めている[2]。

入力条件 存在する情報 MMAP の処理 補っている対象
MRI と表形式データ 画像と認知・臨床検査の双方を利用できる。 二つのモダリティーをそれぞれ符号化し、対応する表現を統合する。 欠損補完を必要とせず、完全入力時の共同表現を学習する。
MRI のみ 三次元画像は存在するが、表形式データが欠けている。 MRI の表現から、表形式側に対応する潜在トークンを生成する。 存在しない検査値そのものではなく、下流予測に必要な表形式側の潜在表現を補う。
表形式データのみ 認知・臨床検査は存在するが、MRI が欠けている。 表形式データの表現から、MRI 側に対応する潜在トークンを生成する。 存在しない MRI 画像そのものではなく、下流予測に必要な画像側の潜在表現を補う。

この設計で重要なのは、欠けた検査そのものを復元しているわけではないことである。MRI が存在しない患者について、MMAP は新しい MRI 画像を生成して医師が読影できる状態に戻すわけではない。同様に、未実施の認知機能検査について具体的な数値を補完しているわけでもない。生成するのは、存在するモダリティーから導いた潜在トークンであり、そのトークンは下流の予測器が二つの入力経路を維持するために使われる[2]。

この違いは、推定結果の意味を限定する。たとえば MRI が欠けた患者について高い予測性能が得られても、それは MRI の解剖学的所見を正確に再構成できたことを意味しない。表形式データに含まれる年齢、認知機能、臨床指標などと MRI 表現の間に学習された関係を使い、将来予測に必要な情報を潜在空間で補ったことを意味する。補完の評価対象は、生成された画像の見た目や欠測値の誤差ではなく、その表現を使った将来予測がどこまで成立するかになる。

MMAP は、この潜在表現を単に生成するだけでなく、両モダリティーが揃っている症例を使って表現の位置関係を学習する。完全入力時には MRI と表形式データの双方から得た表現を対応付け、片方が欠けた場合には、存在する側から生成した潜在表現が完全入力時の表現空間から大きく外れないように学習する。欠損時の推定経路は、完全データを持つ患者から学んだモダリティー間関係によって拘束される。

この構造には二段階の因果がある。まず、同じ患者について MRI と表形式データが揃った症例から、二つのモダリティーがどのような患者状態を共有して表現しているかを学ぶ。次に、一方だけが存在する症例では、その共有関係を使って欠けた側の潜在表現を生成し、完全入力時と同じ予測経路へ接続する。欠損をゼロ値や固定トークンで埋める場合と比べ、患者ごとに存在する情報に応じて欠損側の表現を変えられる点が MMAP の設計上の差になる。

両モダリティーが揃った条件では、MMAP はアミロイド予測で balanced accuracy 0.911、AUC 0.940、F1 0.929、MCI からアルツハイマー病への移行予測で balanced accuracy 0.786、AUC 0.850、F1 0.669 を報告している[2]。この数値を読むときは、単に一つの予測モデルが高い性能を示したという点より、完全入力と欠損入力を同じ表現空間で扱えるよう学習したうえで、完全入力時の性能も維持していることに注目する必要がある。

一方で、欠損を扱えることと、あらゆる入力条件で専用モデルを上回ることは別の評価になる。MMAP の目的は、MRI、表形式データ、両方という異なる入力状態を一つのモデルで扱いながら、予測可能な患者範囲を広げることにある。完全入力だけを前提に最高性能を追う設計とは、最適化している条件が異なる。欠損のある患者を除外せずに扱えることによって得られる運用上の利点と、各条件での予測精度は分けて評価する必要がある。

MMAP が示しているのは、欠けた検査を一律の空欄として扱うより、どの情報が残っているかを条件として学習へ組み込む方法である。患者ごとに観測されたモダリティーを起点として欠損側の潜在表現を作り、その表現を完全データから学んだ関係で拘束する。欠損を除去対象として扱うのではなく、実際の診療データに含まれる入力状態の一つとしてモデル化することで、利用できる患者を広げながら、推定の根拠を存在する検査へ残している。


6. 欠損への耐性と最高精度は同じ指標ではない

MMAP の評価では、「既存法より高性能」という一文だけでは結果を正確に読めない。入力条件と評価指標を分けると、MMAP が優位な場面と既存法が優位な場面が異なるからである。両モダリティーが揃った MCI からアルツハイマー病への移行予測では、MMAP の balanced accuracy は 0.786、AUC は 0.850 で比較手法を上回った。一方、F1 は 0.669 で、HyperFusion の 0.703 より低かった[2]。同じ予測結果でも、どの指標を見るかによって評価が変わる。

balanced accuracy は、陽性群と陰性群それぞれの再現率を平均するため、クラス数が偏っている場合でも少数側を含めて性能を評価しやすい。AUC は、判定しきい値を固定せず、陽性例を陰性例より高く順位付けできる能力を測る。F1 は適合率と再現率の調和平均であり、実際に陽性と判定した結果の精度と取りこぼしの両方を反映する。同じモデルでも、この三つが同じ方向へ動くとは限らない。MMAP が balanced accuracy と AUC で高く、F1 で HyperFusion を下回る結果は、順位付け能力やクラス間の均衡と、特定の判定条件で得られる陽性予測の質が別の性質であることを示している。

表形式データだけを使う条件では、評価軸の違いがさらに明確になる。MMAP の balanced accuracy は 0.760 で、TabPFNv2 の 0.755 をわずかに上回った。一方、AUC は MMAP の 0.820 に対して TabPFNv2 が 0.844、F1 は 0.666 に対して 0.746 だった[2]。balanced accuracy だけを見れば MMAP が上だが、AUC と F1 では TabPFNv2 が上になる。どちらが「高性能か」は、評価したい運用条件を決めないまま一つにまとめられない。

TabPFNv2 は、小規模から中規模の表形式データを対象に、多数の合成データセット上で事前学習された表形式基盤モデルである[6]。表形式データだけが存在する条件では、その入力形式に特化したモデルが高い性能を示すのは不自然ではない。MMAP は単独の表形式入力だけへ最適化しているわけではなく、MRI と表形式データの双方、MRI のみ、表形式データのみという複数条件を一つの表現空間で扱う。そのため、単独モダリティー専用モデルとの比較では、最高値だけでなく、複数入力条件を一つのモデルで維持できることを別の評価軸として見る必要がある。

評価軸 確認する内容 MMAP で見える結果 評価時の注意点
完全入力時性能 MRI と表形式データが両方揃った状態で、どこまで高い予測性能を得られるかを測る。 MCI 移行予測では balanced accuracy 0.786、AUC 0.850 で比較手法を上回る。 完全入力で高くても、欠損時に同じ性能が維持されるとは限らない。
欠損耐性 一部モダリティーが欠けても同じモデルで推論を継続できるかを測る。 MRI のみ、表形式のみの双方を学習・推論条件として持つ。 欠損を扱えること自体は、各条件で専用モデルを上回ることを意味しない。
単独モダリティー性能 一つの情報源だけを使ったとき、専用モデルと比べてどの指標を維持できるかを測る。 表形式のみでは balanced accuracy は MMAP が高く、AUC と F1 は TabPFNv2 が高い。 一つの指標だけで優劣を決めると、他の性能差を見落とす。
評価指標 balanced accuracy、AUC、F1 がそれぞれ何を測っているかを分けて確認する。 両モダリティー条件でも、MMAP は balanced accuracy と AUC で上回る一方、F1 では HyperFusion を下回る。 同じ予測結果でも、評価したい性質によって値の解釈が変わる。

この表で分かるのは、MMAP の評価には少なくとも二つの層があることだ。第一は、個々の入力条件でどの程度正確に予測できるかという性能評価である。第二は、患者ごとに利用可能なモダリティーが変わっても、同じモデルで処理を継続できるかという適用範囲の評価である。完全入力だけを対象にするモデルなら前者へ集中できるが、MMAP は後者も同時に扱うため、単独条件での最高値だけを目的にしたモデルとは設計目標が異なる。

この違いは、臨床データで特に意味を持つ。研究用データセットでは、必要な検査が揃った症例だけを選んで評価できる。一方、実際の患者集団では、MRI を受けていない患者、認知検査が欠けた患者、途中の時点だけ一部検査が存在する患者が混在する。その条件で完全入力だけを前提とすると、予測性能の高いモデルでも適用できる患者が限定される。欠損耐性は、分類器単体の精度とは別に、どれだけ多くの患者を同じ推論系で扱えるかという運用上の性質になる。

その一方で、欠損耐性を持つことだけでモデルの優位性を結論付けることもできない。表形式データだけが利用できる患者に対して、TabPFNv2 の AUC と F1 が MMAP を上回るなら、その条件で順位付けや陽性予測の精度を重視する用途では TabPFNv2 の値を無視できない。MMAP が複数入力条件へ対応できる利点と、専用モデルが特定条件で高い性能を出す利点は、同じ尺度上の勝敗ではなく、異なる設計上の交換条件として比較する必要がある。

既稿「AI を一つの物語に閉じ込めない」では、モデル評価を単一の物語へ圧縮すると、条件や指標ごとの差が消えることを扱った[7]。MMAP の結果はその具体例になる。「既存法より高性能」「欠損に強い」「表形式でも使える」という三つの説明は、それぞれ別の条件と指標を指している。どの入力が存在するか、どの指標を重視するか、どの患者まで適用したいかを分けると、結果の意味が具体化する。

MMAP の評価から得られる帰結は、欠損に対応するモデルを最高精度だけで順位付けすると設計上の目的を取り落とすということである。完全入力時の性能、欠損時の継続性、単独モダリティーでの性能、評価指標ごとの差を分けることで、初めてそのモデルがどの条件で価値を持つかを判断できる。医療データの欠損を扱う場合、性能とは一つの数字ではなく、入力条件と運用範囲を含む複数の評価軸の組み合わせになる。


7. 一枚の画像にない情報が時間方向には残る

乳房 X 線の研究が扱う欠落は、X 線の奥行きや未実施検査とは性質が異なる。画像そのものは各検診時点で存在している。しかし、一枚ずつを独立した入力として扱うと、同じ患者の前年画像と今年画像の関係が解析から外れる。病態が時間とともに変化する対象では、この関係にも情報が含まれる。静止画像としては大きな差が見えなくても、複数時点を結んだときに、変化の方向や速度として差が現れる可能性がある。

研究対象の女性には、診断時より前に少なくとも 2 回の年次検診がある。研究者は各マンモグラムを基盤モデルへ入力し、画像を高次元の数値表現である埋め込みへ変換した[3]。埋め込みは画像そのものではなく、モデルが画像から抽出した特徴の位置を表す。各時点をこの空間上の点として置けば、同一患者について前年から翌年へどの方向へ移動したかを計算できる。ここで追加されるのは新しい検査値ではなく、すでに存在する複数時点の観測間にある関係である。

この研究では、診断時の悪性例と対応する対照例の埋め込みから、表現空間上の「がん方向」を定義した[3]。概念的には、悪性例が多く分布する側と対照例が多く分布する側を結ぶ方向を設定し、過去の各画像が時間とともにその方向へどれだけ移動したかを測る。単に「現在の画像が悪性例に似ているか」を見るのではなく、「前年から今年にかけて悪性例側へどの程度移動したか」を対象にする。

この区別によって、位置と変化を別々に扱える。ある患者の埋め込みがある年には悪性例側から遠くても、その後に一貫して悪性例側へ移動していれば、単一時点の距離だけでは表れにくい情報が時間差分には含まれる。逆に、ある時点で悪性例側に比較的近くても、その位置が患者固有の解剖や撮影条件によって安定しているだけなら、時間方向の移動は小さい場合がある。研究はこの違いを利用し、絶対位置だけではなく患者内の変化量を解析対象にした。

分析方法 利用する情報 捉えられる対象 残る制約
単一時点の画像分類 一回の検診で撮影されたマンモグラムを利用する。 その時点の画像に含まれる形態や濃度などの特徴を捉える。 同一患者が過去からどのように変化したかは入力に含まれない。
将来リスク予測 現在のマンモグラムなどから将来の発症確率を直接推定する。 一定期間内に乳がんと診断されるリスクを予測する。 予測値が高くなった背景として、表現空間でどのような時間変化が起きているかを直接測る設計とは異なる。
埋め込み速度解析 同一患者の複数時点のマンモグラムを埋め込み空間上で比較する。 診断へ近づく過程で、表現が特定方向へ移動する速度を捉える。 観測された速度差だけでは、前向きスクリーニングでの診断性能や臨床利益までは確定しない。

患者自身の診断時データが「がん方向」の定義へ入り、その同じ患者について過去の移動を評価すれば、評価対象の情報が基準側へ混入する。研究ではこの影響を抑えるため、評価する患者を方向の計算から外す leave-one-out を用いている[3]。一人を評価するときには、その一人を除いた他の症例から方向を定義し、その方向に対して評価対象者の過去の移動を測る。方向の定義と評価対象を分離することで、本人の診断情報を使って本人の過去変化を有利に評価する循環を避けている。

ここで従来の乳がんリスク予測との違いも明確になる。Mirai はマンモグラムを入力として、複数年先の乳がんリスクを直接予測するモデルとして開発され、米国、スウェーデン、台湾のデータで外部評価されている[8]。最終的に必要なのは患者ごとの将来リスクであり、モデルはその予測に適した特徴を学習する。

今回の研究では、既存の基盤モデルを乳がんリスク予測用に追加学習していない[3]。目的は、すでに学習済みの表現空間に、診断前の変化を追跡できる情報が含まれているかを調べることにある。この違いによって、問いも変わる。Mirai のようなモデルでは「将来の発症をどこまで予測できるか」が中心になる。埋め込み速度解析では、「基盤モデルが作った表現の中で、診断前から悪性例と対照例の時間変化に違いが現れるか」が中心になる。

MedImageInsight では、その違いが診断に近い時期ほど明確になった。悪性群と対照群の速度差は診断直前の二つの区間に集中し、撮影方式を揃えた解析でも、診断直前区間の順位二系列相関は +0.63 から +0.61 へほぼ維持された[3]。撮影方式を揃えても差が大きく失われなかったことは、少なくともこのモデルでは、観測された群間差の大部分を撮影方式の違いだけでは説明しにくいことを示している。

ここには二段階の情報抽出がある。最初に基盤モデルが各マンモグラムを埋め込みへ変換し、画像内の特徴を高次元空間へ配置する。次に、一人の患者について複数時点の位置を結び、診断時に定義した方向への移動量を時間で割ることで、静止した位置から変化速度へ分析単位を移す。元画像へ新しい情報を追加したわけではなく、複数の既存観測を関係付けることで、単一時点では使われなかった情報を取り出している。

この結果から直ちに「乳がんを診断前に発見できる」と結論することはできない。研究は単一データ源を用いた後ろ向き解析であり、すでにその後の診断結果が分かっている症例を悪性群と対照群に分けて比較している[3]。臨床スクリーニングでは、診断結果が未知の時点で患者を評価し、その後に実際の発症や生検結果を追跡する必要がある。後ろ向きに群間差を確認することと、未知患者に対して有用な判断を行うことの間には、外部データでの再現と前向き評価が残る。

著者も、早い時点で高い埋め込み速度を示した患者を抽出し、その後の生検結果を追跡する前向き研究を必要としている[3]。前向き評価では、速度差が統計的に存在するかだけでなく、どのしきい値なら追加検査を行う価値があるのか、偽陽性がどの程度増えるのか、従来のリスク予測や読影へ追加したときに判断が改善するのかまで確認する必要がある。埋め込み速度という信号の存在と、その信号を診療判断へ使えることは異なる段階にある。

この研究が示す範囲で確実に言えるのは、画像一枚の中にある情報だけが医療画像の利用可能な情報ではないということである。同一患者について複数時点の観測が残っていれば、その順序と移動量にも分析対象となる情報がある。空間情報を CT で補った FleXray や、欠けたモダリティーを別検査から補った MMAP と同様に、ここでも推定の根拠はモデルの自由な生成ではなく、すでに観測された別の情報に置かれている。乳房 X 線の場合、その外部の拘束条件に相当するものが、同一患者自身の過去という時間方向の実測履歴である。


8. 対象への特化度と必要な変化の保持は一致しない

四つの基盤モデルを同じ時間方向の解析へ適用すると、「乳房 X 線に特化したモデルほど診断前変化をよく捉える」という単純な順序にはならなかった。MedImageInsight は X 線、CT、MRI、超音波、病理、マンモグラフィーなど複数の臨床画像領域で学習された汎用医療画像埋め込みモデルであり、乳房 X 線専用に最適化されたモデルではない[9]。それにもかかわらず、今回の解析では悪性群と対照群の時間方向の差が最も明瞭に現れた。

この結果は、学習対象への近さと、下流解析で必要な情報を保持することを分けて考える必要があることを示している。乳房 X 線だけを大量に学習したモデルは、乳房 X 線に固有の形態、撮影条件、装置特性、位置合わせの癖まで詳しく表現できる可能性がある。一方、今回の解析で必要なのは、単一時点の画像を精密に表現することだけではなく、同一患者が診断へ近づく過程で変化する成分を時間方向に追跡できることである。表現が詳細であることと、変化の検出に適していることは同じ条件ではない。

HOPPR の結果は、この違いを考える材料になる。HOPPR は今回の対象に近い乳房 X 線分布で学習されたモデルだが、撮影方式を揃えた解析では悪性群と対照群の区間差が弱くなった[3]。元の解析で見えていた差の一部が、病態の進行だけでなく、撮影方式の違いと結び付いていた可能性がある。モデルが学習対象へ強く適合すると、その対象に固有の撮影条件も表現空間へ取り込みやすくなる。下流解析が患者内の病態変化を読みたい場合、その詳細さが必ずしも有利に働くとは限らない。

BiomedCLIP では、撮影方式を揃えた後に有意な時間差が消えた[3]。BiomedCLIP は医学画像とテキストの大規模事前学習を行った基盤モデルだが、今回のような乳房 X 線の縦断変化を直接目的として学習されたモデルではない。ここでも、医療領域で広く学習していることと、特定の時間信号を保持していることは別の性質として現れる。

モデル 事前学習の特徴 今回の時間解析で見えた傾向 読み取れること
MedImageInsight 複数の臨床画像領域を横断して学習した汎用医療画像埋め込みモデルである。 悪性群と対照群の診断前の速度差が最も明瞭に現れ、撮影方式を揃えた後も差が大きく維持された。 対象への専用化が弱くても、時間方向の病態変化に関係する特徴を保持できる場合がある。
HOPPR 今回の対象に近い乳房 X 線分布で学習されたモデルである。 撮影方式を揃えると悪性群と対照群の区間差が弱くなった。 対象分布への適合と同時に、撮影条件に依存する特徴も表現へ取り込んでいた可能性がある。
BiomedCLIP 医学画像とテキストの大規模な対応関係を学習した医療基盤モデルである。 撮影方式を揃えた後には有意な時間差が確認されなかった。 広い医療知識を持つことだけでは、乳房 X 線の縦断変化を安定して保持する条件にはならない。
Mammo-CLIP 乳房 X 線に特化して事前学習されたモデルである。 一部の診断前区間では群間差が見られたが、MedImageInsight ほど一貫して明瞭ではなかった。 領域特化によって静止画像の識別に有用な特徴を学んでも、時間方向の変化が最も強く残るとは限らない。

この比較では、対象への特化度そのものを性能指標として扱うことはできない。モデルが何を保持するかは、事前学習で与えられたデータ、学習目的、撮影条件の多様性、画像とラベルの対応関係によって変わる。乳房 X 線だけを学習したモデルでも、病態の進行より撮影装置や患者位置の違いを強く表現していれば、時間解析ではその変動が雑音になる。逆に、複数領域を横断して学習したモデルが、撮影条件に依存しにくい形態変化を保持していれば、縦断解析では有利になる場合がある。

撮影方式を揃えた解析は、この違いを切り分けるために使われている。通常の比較で群間差が見えても、悪性群と対照群で撮影装置や取得条件の分布が異なれば、モデルは病態と撮影方式の両方を利用できる。撮影方式を一致させた後にも差が残れば、その信号を撮影条件だけで説明する余地は小さくなる。MedImageInsight で診断直前区間の順位二系列相関が +0.63 から +0.61 へほぼ維持されたのに対し、他モデルでは差が弱まったことは、モデルごとに保持している情報の構成が異なることを示している[3]。

ただし、HOPPR の差が撮影方式を揃えると弱くなった理由を、「過学習」や「撮影条件だけを学習した」と断定することはできない。論文が示しているのは統計的な変化であり、その内部機序を直接測定したわけではない。学習分布への近さによって患者固有の撮影条件まで表現へ取り込んだ可能性は著者も論じているが、これは結果を説明する仮説の一つとして扱う必要がある[3]。

ここからモデル選択の基準も変わる。画像分類なら、その時点の病変や形態を最もよく分離できる表現が有利になる。患者識別なら、個人固有の解剖や撮影位置を安定して保持する表現が有利になる。装置差を補正したい場合には、撮影条件に対して不変な表現が求められる。縦断解析では、時間とともに変わる病態成分を残しながら、装置や撮影姿勢の変動には影響されにくい表現が望ましい。必要な情報が変われば、同じ埋め込みモデルでも評価軸が変わる。

対象領域への特化は、入力分布への適合度を高める有力な方法である。しかし、適合度が高いほど下流解析に必要な変化だけが選択的に残るわけではない。今回の四モデルの差は、基盤モデルを選ぶときに「どれだけ専門的か」より、「その表現が何を変化として残し、何を安定した特徴として固定するか」を確認する必要があることを示している。縦断解析では、モデルの専門性そのものより、時間方向に読みたい信号と不要な撮影変動をどの程度分離できるかが、より直接的な評価軸になる。


9. 補完を成立させるのは推定とは別の拘束条件である

三つの研究を同じ枠で見ると、「欠けた情報を AI が補う」という説明だけでは、推定がどこまで根拠を持つのかを区別できない。FleXray、MMAP、乳房 X 線研究はいずれも観測されなかった情報を扱うが、推定対象とは別の経路から得られる情報を使って候補を狭めている。FleXray では CT 上の三次元解剖と X 線投影物理、MMAP では同一患者について存在する別モダリティーとの対応関係、乳房 X 線研究では同一患者について実際に撮影された複数時点の画像が、その役割を担う。

この違いは、生成された結果がもっともらしいかという評価と、推定がどの情報から導かれたかという評価を分ける。たとえば FleXray が二次元 X 線上の肋骨境界を出力したとき、その境界はモデルが画像だけから自由に作った正解ではない。元の CT で三次元位置が既知の肋骨を、撮影条件に従って二次元へ投影した教師ラベルから学習している。推定結果の外側に、解剖構造と投影条件という参照点が残るため、結果が誤った場合にも、どこで対応が崩れたかを調べられる。

MMAP では拘束の形が異なる。MRI が欠けている患者について、表形式データから生成される潜在トークンは、MRI 画像そのものの正解を直接参照して作られるわけではない。一方、学習時には MRI と表形式データが両方存在する症例があり、その症例から二つのモダリティーの表現関係を学習する。完全データで学んだ対応関係があるため、欠損時の潜在表現を患者ごとに任意の位置へ置くのではなく、存在するモダリティーから推定できる範囲へ制約できる[2]。ここで外部の拘束条件になるのは、欠けたデータそのものではなく、完全症例から観測されたモダリティー間の対応である。

乳房 X 線研究では、さらに直接的な実測値が拘束条件になる。診断前の表現変化を調べるとき、モデルが仮想的な過去画像を生成しているわけではない。同じ患者について過去に実際に撮影されたマンモグラムを埋め込みへ変換し、その位置の変化を測っている[3]。患者内の時間変化という推定対象に対して、各時点の画像自体は独立に取得された観測である。複数時点を結ぶことで、単一画像には明示されていなかった速度という量を計算できる。

研究 観測から欠けているもの 推定に使う拘束条件 推定する対象 検証方法
FleXray X 線投影で失われた奥行きと、大量作成が難しい密な解剖ラベルが不足する。 CT の三次元解剖、X 線投影物理、実 X 線を組み合わせる。 二次元 X 線上の解剖構造を推定する。 学習に使っていない 8 データセットや実臨床に近い画像でセグメンテーション性能を測る。
MMAP 患者によって MRI または表形式の臨床データが存在しない。 完全症例から学習したモダリティー間の対応と、同一患者について存在する側のモダリティーを利用する。 欠けた側に対応する潜在表現を推定する。 完全入力、MRI のみ、表形式のみを分け、将来の MCI 移行やアミロイド状態の予測性能を比較する。
乳房 X 線研究 単一時点の画像では患者内の時間方向の変化が利用されない。 同一患者について実際に撮影された複数時点のマンモグラムを利用する。 診断前に基盤モデルの表現がどの方向へどの速度で移動したかを測る。 対応対照、撮影方式を揃えた解析、leave-one-out による方向定義を用いて群間差の残り方を調べる。

三つに共通する因果関係は二段階で整理できる。最初に、観測されなかった情報を直接推定する前に、別経路から得られた構造によって候補の範囲を狭める。FleXray なら三次元解剖から二次元投影へ可能な対応が制限され、MMAP なら完全症例で学んだモダリティー間関係によって欠損側の潜在表現が制約され、乳房 X 線なら実測された過去画像によって時間方向の軌跡が決まる。そのうえで、制約された候補から得た推定を、未使用データ、将来予測、対照群との比較など別の評価条件へ持ち込み、どこまで成立するかを測っている。

この構造がない補完では、出力の自然さと正しさを分けにくくなる。もっともらしい X 線画像を生成できても、実際の解剖構造と対応している保証がなければ教師ラベルとして使えない。欠けた MRI に似た潜在表現を作れても、完全症例から学んだモダリティー間関係と整合しなければ、予測に使える根拠は弱い。診断前変化らしい軌跡を作れても、実際の過去画像から計算されたものでなければ、患者内の時間変化を測ったことにはならない。補完結果の外側に参照点が残ることで、推定の妥当性をモデル自身の出力だけに依存せず評価できる。

ただし、拘束条件を持てば自動的に正しい推定になるわけではない。拘束条件そのものが観測範囲の制約を持つためである。FleXray が利用する CT は成人、標準的な姿勢、体幹部を中心とするデータに偏っており、その外側の患者や撮影条件では、三次元解剖から作った学習分布が十分に対応しない可能性がある[1]。MMAP は ADNI の 1,258 人を用いた検証であり、異なる施設、疾患、検査運用でも同じモダリティー間関係が成立するかは別途確認が必要になる[2]。乳房 X 線研究も単一データ源の後ろ向き解析であり、別の患者集団や前向き運用で同じ時間信号が再現されるかが残っている[3]。

拘束条件にも二つの境界がある。第一は、その条件が観測された集団や撮影環境の範囲である。第二は、拘束条件と推定対象の関係が別の環境でも維持されるかという一般化可能性である。CT から X 線への投影物理自体は変わらなくても、患者姿勢や医療機器が変われば画像分布は変化する。MRI と臨床指標の関係も、対象疾患や施設運用が変われば同じとは限らない。診断前の埋め込み速度も、使用する基盤モデルや撮影条件によって信号の残り方が変わる。拘束条件は推定を可能にする一方、その拘束が成立する範囲まで推定の射程を限定する。

三つの研究から得られる共通した判断基準は、AI が何を生成したかより、推定の外側にどの参照点を残しているかを見ることである。三次元解剖、別モダリティー、過去の実測画像のような情報があれば、推定結果をそこへ戻して整合性や失敗条件を調べられる。さらに未使用データや別条件で評価すれば、その拘束関係が学習時だけ成立していたのか、対象範囲の外側まで維持されたのかを分けられる。観測されなかった情報を扱うとき、補完の根拠、補完結果、外部での検証を分離して残せることが、もっともらしい生成と検証可能な推定を分ける基準になる。


10. もっともらしさより検証可能性で補完を評価する

医療 AI が扱う「欠け」は一種類ではない。FleXray では三次元構造が二次元投影の過程で失われ、さらに画素単位の解剖ラベルを大量に作ることが難しい。MMAP では患者ごとに MRI や臨床検査の実施状況が異なり、入力モダリティーそのものが欠ける。乳房 X 線の縦断解析では各時点の画像は存在していても、画像を独立に扱えば同一患者の時間方向の変化が利用されない。三つはすべて不完全な観測を扱うが、情報が失われる過程が異なるため、推定を成立させる根拠も異なる。

この違いを無視して「AI が不足情報を補完する」と一括すると、生成能力と推定の妥当性を混同しやすい。出力を作れること自体は、その出力が正しいことの根拠にはならない。二次元 X 線から自然な臓器境界を描けても、三次元解剖との対応がなければ正解ラベルとしての妥当性を確認しにくい。欠けたモダリティーに対応する表現を生成できても、完全症例で観測されたモダリティー間関係と整合しなければ、その表現が将来予測に必要な情報を保持している保証は弱い。時間変化らしい軌跡が見えても、実際の過去画像と結び付いていなければ患者内変化の証拠にはならない。

三つの研究では、推定対象とは別の経路から得られる情報を使って、この問題を解いている。FleXray は CT の三次元解剖と X 線投影物理を使い、MMAP は完全症例から学んだモダリティー間関係と現在利用できる検査を使い、乳房 X 線研究は同一患者について実際に撮影された過去画像を使う。最初に別経路の情報で推定可能な範囲を狭め、その後に未使用データ、将来予測、対照群比較などを使って推定結果を評価する。補完と検証が別の情報源へ接続されているため、モデルの出力だけで正しさを循環的に説明せずに済む。

FleXray の結果は、もっともらしさと実世界での性能を分けて評価する必要性を具体的に示している。生成モデルによる画像補正を加えても、8 データセットの平均 Dice は 0.870 のままだった。一方、物理シミュレーションだけでは表現しにくい下位肋骨では改善が見られ、病変による濃度変化を想定した減衰率のランダム化では、肺炎症例の肺 Dice が 0.894 から 0.914 へ上がった[1]。画像全体の外観を実画像へ近づけることと、推論時に遭遇する条件を学習分布へ含めることは異なる。検証対象を平均値だけに置かず、どの条件の失敗が減ったかまで見ることで、補完が実際に何を改善したかを判定できる。

MMAP では、別の意味で「補完できること」と「最高性能であること」が分かれる。MRI または表形式データが欠けても同じモデルで予測を続けられる一方、表形式データだけの条件では、balanced accuracy は MMAP がわずかに高くても、AUC と F1 は TabPFNv2 が上回った[2]。欠損側の潜在表現を作れることは、すべての入力条件で専用モデルを超えることを意味しない。補完の価値を判断するには、扱える患者の範囲が広がったことと、各入力条件で得られる予測性能を分けて見る必要がある。

乳房 X 線研究でも、基盤モデルが埋め込みを生成できること自体より、診断前の時間信号がどの条件で残るかが評価対象になる。MedImageInsight では撮影方式を揃えた後も診断直前区間の群間差が大きく維持された一方、HOPPR や BiomedCLIP では信号の残り方が異なった[3]。同じマンモグラムから埋め込みを作れるモデルでも、撮影条件、患者固有特徴、病態変化をどのように表現へ保持するかが違う。埋め込みそのものの存在ではなく、交絡条件を除いた後にも目的の信号が再現されるかを見ることで、解析に利用できる情報と偶然の相関を切り分けられる。

三つの研究を通して共通する評価手順は、補完の根拠、補完結果、外部検証を分けることである。まず、何が観測から欠けたのかを特定する。次に、その欠落を拘束できる独立した情報源を決める。その情報から得た推定を、学習時とは別のデータや条件へ持ち込み、誤差や失敗条件を測る。この三段階が分かれていれば、結果が良かった理由と、結果が崩れる条件を追跡できる。

ここで検証可能性は、単に評価用データセットを一つ用意することを意味しない。推定の根拠と評価条件が同じ情報へ閉じていれば、モデルが学習時に利用した癖を再確認しているだけになる可能性がある。FleXray では未使用データセットへ持ち出し、MMAP では入力欠損条件を分け、乳房 X 線研究では対応対照や撮影方式を揃えた解析を行っている。推定時とは異なる条件を意図的に置くことで、モデルが本来利用してほしい情報を使っているかを調べている。

同時に、検証で良い結果が出ても適用範囲は残る。FleXray の CT データには患者集団や撮影姿勢の偏りがあり、MMAP は ADNI の患者集団で評価され、乳房 X 線研究も単一データ源の後ろ向き解析である[1][2][3]。外部検証は一般化可能性を広げるが、一度の検証ですべての環境を保証するものではない。どの条件まで確認済みで、どの条件から先は未検証かを残すことも、検証可能性の一部になる。

医療 AI における補完の価値は、見えなかった情報を自然に埋められることだけでは決まらない。三次元解剖、別モダリティー、過去の実測画像のように、推定とは別の情報源へ根拠を置き、その根拠からどこまで推定できるかを限定し、さらに別条件のデータで誤差を測れることが必要になる。もっともらしい出力は観察できる結果の一つに過ぎず、実際の評価対象は、その結果がどの観測条件と拘束条件の組み合わせで成立したかである。

観測の欠落をこのように分解すると、AI が推定できる範囲と、追加の測定や検証が必要な範囲を同じ枠組みで判断できる。FleXray では未使用の解剖や撮影条件が境界になり、MMAP では学習したモダリティー間関係が通用する患者集団が境界になり、乳房 X 線研究では外部コホートと前向き評価が境界になる。補完を評価するときの中心は、出力が自然かどうかより、どの根拠から導かれ、どの条件で再現され、どこから先で未検証になるかを追跡できることである。


参考文献

  1. Victor Ion Butoi, Vivek Gopalakrishnan, John V. Guttag, Adrian V. Dalca, Neel Dey, FleXray: Universal Clinical X-ray Segmentation(2026-09-22). https://arxiv.org/abs/2609.26756v1
  2. Fiona Kekwick, Matthew Baugh, Bernhard Kainz, Paul M. Matthews, Wenjia Bai, MMAP: Multimodal Missing-Aware Pretraining for Longitudinal Alzheimer’s Prediction(2026-09-22). https://arxiv.org/abs/2609.26617v1
  3. Kalina P. Slavkova et al., Foundation model embeddings capture pre-diagnostic changes on screening mammograms(2026-09-22). https://arxiv.org/abs/2609.26605v1
  4. Josh Tobin, Rachel Fong, Alex Ray, Jonas Schneider, Wojciech Zaremba, Pieter Abbeel, Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World(2017). https://arxiv.org/abs/1703.06907
  5. id774, 生成 AI が書き換えた世界を、次の AI が学ぶ(2026-08-18). https://blog.id774.net/entry/2026/08/18/5505/
  6. Noah Hollmann et al., Accurate predictions on small data with a tabular foundation model(2025-01-08). https://www.nature.com/articles/s41586-024-08328-6
  7. id774, AI を一つの物語に閉じ込めない(2026-08-09). https://blog.id774.net/entry/2026/08/09/4974/
  8. Adam Yala et al., Toward robust mammography-based models for breast cancer risk(2021-01-27). https://pubmed.ncbi.nlm.nih.gov/33504648/
  9. Noel C. F. Codella et al., MedImageInsight: An Open-Source Embedding Model for General Domain Medical Imaging(2024-10-09). https://arxiv.org/abs/2410.06542