scRNA-seq から細胞の現在と履歴を別々に読む

細胞を詳しく調べれば、その細胞が現在どのような状態にあるかはかなり分かるようになった。どの遺伝子が働いているかを 1 細胞ごとに測定すれば、細胞型の違いや分化の途中にある状態まで区別できる。現在の状態を知ることと、その細胞がどの祖先から分かれ、どのような経路を通って現在に至ったかを知ることは、別の情報を必要とする。

近年は、同じ単一細胞 RNA シーケンスのデータから、遺伝子発現だけでなく、細胞分裂の過程で生じて受け継がれた体細胞変異を読み取り、細胞の系譜を推定する研究が進んでいる。ここでは、細胞の「現在の状態」と「そこに至った履歴」がなぜ別の情報なのか、現在の細胞に残った変異からどこまで過去を復元できるのかを見ていく。


1. 現在の状態と過去の履歴は別の情報である

ある時点で二つのものがよく似ていても、そこに至る道筋は異なる場合がある。現在観測できる性質は、それまでに起きた変化の結果ではあるが、一つの結果に複数の経路が対応し得るからである。異なる出発点から異なる変化を経た対象が、最終的に似た状態へ到達することがある。同じ起点から分かれた対象が、その後に異なる条件へ置かれることで、現在は大きく異なる状態になることもある。

細胞を例にすると、この違いを具体的に考えやすい。ある二つの細胞が現在ほぼ同じ遺伝子を発現していても、祖先細胞は異なる場合がある。異なる系譜に属する細胞が、同じ環境から刺激を受けたり、似た機能を担ったりすることで、近い発現状態を示す場合がある。同じ祖先細胞から生じた二つの細胞でも、分化後に異なる役割を獲得すれば、働く遺伝子の組み合わせは変わる。現在の類似性と過去の近さは、対応することもあれば、対応しないこともある。

この関係は、現在から過去を推定するときに一つの制約を生む。現在の状態をどれだけ細かく測定しても、複数の履歴が同じ状態へ到達できるなら、その測定値に対して過去の経路は複数の候補が残る。測定精度を上げることで詳しく分かるのは現在の違いであり、過去の分岐には別の情報が必要になる。現在を詳しく知ることと、履歴を詳しく知ることは、必要とする情報が異なる。

観点 現在の状態 過去の履歴
問うこと いまどのような性質を持ち、どのような働きをしているかを問う。 どの起点から、どの分岐や変化を経て現在に至ったかを問う。
直接利用する情報 現在時点で測定できる発現量、形態、機能などを利用する。 過去の出来事によって生じ、その後も残った差異を利用する。
同じ結果が生じる条件 異なる履歴を持つ対象でも、同じ条件に置かれれば似た状態へ近づくことがある。 現在の状態が異なっていても、過去には共通の祖先や分岐を持つことがある。
現在だけを見た場合の限界 観測時点での違いは詳しく区別できる。 現在の特徴だけを使うと、過去の経路には複数の候補が残る場合がある。

過去を区別するには、現在の状態とは別に、過去の出来事によって生じた差異が現在まで保存されている必要がある。たとえば、ある分岐の後に一方の系統だけで変化が生じ、その変化が子孫へ受け継がれていれば、現在の対象を比較したときに、その差異を分岐の手掛かりとして使える。出来事の前後で生じた差異が現在まで残っていれば、その痕跡から履歴を逆向きに推定できる。

このとき、痕跡には二つの条件が必要になる。第一に、過去のある時点で生じた変化が、後の世代まで一定程度保存されることである。第二に、その変化を複数の現在の対象から比較できることである。一つの対象に差異があるだけでは、それがいつ生じたのかを決めにくい。複数の対象が同じ差異を共有し、別の対象群では共有していないという関係が得られると、その分布から過去の分岐を推定できるようになる。

生命科学では、この構造が細胞系譜の解析に現れる。現在の細胞でどの遺伝子が働いているかを測れば、その細胞が現在どのような状態にあるかを詳しく調べられる。系譜を知るには、細胞分裂の過程で生じ、その後の子孫へ受け継がれた痕跡を読む必要がある。現在の状態を測る情報と、過去の履歴を復元する情報を分けることが、細胞の「現在」と「来歴」を同時に理解するための出発点になる。


2. scRNA-seq が捉えるのは細胞の現在である

細胞の現在の状態を調べる代表的な方法が、1 細胞 RNA シーケンス、略して scRNA-seq である。細胞の中では、DNA に保存された遺伝情報のうち、その時点で必要な遺伝子が RNA へ転写される。scRNA-seq は、この RNA を細胞ごとに測定することで、どの遺伝子がどの程度発現しているかを調べる。多数の細胞をまとめて測定すると、個々の細胞の違いは平均値の中に埋もれるが、1 細胞単位で測定すれば、少数しか存在しない細胞集団や、同じ組織内に共存する異なる細胞状態を区別できる[1]。

この測定値が直接表しているのは、観測した時点における細胞の転写状態である。ある遺伝子群が活発に発現していれば、その細胞が担っている機能や分化状態を推定する材料になる。複数の細胞について発現量を比較すれば、似た発現パターンを持つ細胞をまとめたり、状態が連続的に変化している集団を見つけたりできる。scRNA-seq によって細胞の「種類」だけでなく、同じ種類の内部にある状態差まで調べられるのは、この転写状態を細胞ごとに分離して観測できるためである。

発生や分化の研究では、この現在の状態の違いから時間方向を推定する方法も使われる。発生途中の組織を一度採取すると、通常は一つの細胞をそのまま保存して数時間後、数日後まで追跡することはできない。測定のために細胞を回収して RNA を読み取る時点で、その細胞についての観測は一回で終わる。その代わり、同じ組織に分化段階の異なる多数の細胞が同時に存在していれば、それらを状態の近さに基づいて並べることで、変化の順序を推定できる。

代表例である Monocle は、単一時点で取得した細胞群を遺伝子発現の違いに基づいて配置し、分化に伴う状態変化を擬似時間として表現した[1]。ここでいう「時間」は、各細胞について実際に経過時間を測定した値ではない。発現状態の連続性から、ある細胞は分化の前段階にあり、別の細胞はその先にあると解釈して並べた順序である。その後、多数の軌跡推定法が開発され、直線的な変化だけでなく分岐を含む状態遷移も扱われるようになった一方、データの構造や想定する分岐形状によって各手法の性能が異なることも比較研究で示されている[2]。

発現状態から細胞を分類するクラスタリングにも同じ性質がある。発現パターンが近い細胞を同じ集団としてまとめれば、組織を構成する細胞型や状態の違いを整理できる。実際の細胞集団には、明確に分離した種類のほか、分化途中の連続的な状態も存在する。また、測定時の技術的変動も観測された差に影響する。このため、クラスタリング結果は細胞型そのものの判定と分けて扱い、発現差が生じた背景まで含めて解釈する必要がある。

解析 観測または推定する対象 基礎となる情報 直接は分からないこと
scRNA-seq 各細胞の観測時点での転写状態を測定する。 細胞内に存在する RNA の量を遺伝子ごとに測定する。 その細胞が過去にどの細胞から分かれてきたかは直接観測しない。
クラスタリング 転写状態が似た細胞の集団を推定する。 細胞間の発現パターンの類似性や差異を利用する。 同じ集団に属する細胞が系譜上も近いとは限らない。
擬似時間・軌跡推定 観測された状態間に想定される変化の順序を推定する。 発現状態の連続性や分岐構造を利用する。 実際に起きた個々の細胞分裂の親子関係を直接復元するものではない。

ここで、第 1 章で分けた「現在の状態」と「過去の履歴」の違いが具体的になる。擬似時間による細胞 A と細胞 B の位置関係が表すのは、発現状態から推定した前後関係である。測定された A と B は同じ時点に存在する別々の細胞であり、その発現状態を比較した結果として前後関係が推定されているからである。状態の並びから分化過程を推定することと、実際の細胞分裂によって形成された系譜を復元することでは、推定対象が異なる。

この違いは、発現状態が細胞の履歴だけで決まらないことから生じる。同じ祖先から分かれた細胞でも、異なる分化経路へ進めば発現する遺伝子は変わる。系譜上は離れた細胞でも、似た機能を担う状態へ到達すれば発現パターンの一部が近づく可能性がある。発現状態は過去の影響を受けて形成されるが、同時に現在の細胞型、環境、分化段階などにも依存する。そのため、現在の転写状態を詳しく測定するだけでは、過去の分岐を一意に取り出せない。

細胞の現在を測る技術が精密になっても、系譜という別の問いには別の手掛かりが必要になる。系譜を知る手掛かりになるのは、過去の細胞分裂で生じ、その後の子孫へ受け継がれてきた差異である。次に見る体細胞変異は、その条件を満たし得る痕跡として、現在の細胞から過去の分岐を復元するために利用されている。


3. 履歴を知るには、過去が残した痕跡が必要になる

細胞の系譜を調べる方法には、時間の向きが異なる二つの考え方がある。一つは、観測を始める時点で細胞に標識を付け、その標識を受け継いだ子孫を未来方向へ追跡する方法である。もう一つは、現在存在する細胞を調べ、そこに残っている差異から過去の分岐を遡って復元する方法である。前者では追跡開始時に対象へ介入できることが必要になるが、後者では発生初期のヒト組織のように、実際の分裂が起きた時点では観測できなかった対象についても系譜を推定できる。

方法 出発点 利用する情報 時間の向き
標識による追跡 観測開始時の細胞から出発する。 人工的に付与した標識がどの子孫へ受け継がれたかを利用する。 現在から未来へ細胞の分岐を追う。
内在的な痕跡による復元 現在存在する細胞から出発する。 過去の分裂や変化によって自然に生じ、現在まで残った差異を利用する。 現在から過去へ分岐を推定する。

過去方向の復元に利用できる代表的な痕跡が、体細胞変異である。受精卵から個体が形成されるまでには膨大な回数の細胞分裂が起こり、そのたびに DNA が複製される。複製時の誤りや DNA 損傷などによって、ある細胞の DNA に受精後の新たな変化が生じることがある。個体の一部の細胞で後から生じるこの変化が体細胞変異であり、生殖細胞を通じて個体間に受け継がれる変異とは区別される。

系譜解析に利用できるのは、変異が生じることだけでなく、その後の細胞分裂で変異が子孫へ受け継がれるためである。ある祖先細胞 A で変異 X が生じれば、A から生じた子孫は原則として X を共有する。その子孫の一つ B でさらに変異 Y が生じれば、B より後の系統では X と Y の両方が見つかる一方、B が分岐する前に別れた細胞には X だけが残る。このような共有関係を多数の細胞について比較すると、どの変異が先に生じ、どの変異がその後の一部の系統だけで生じたのかを推定できる。

たとえば現在の四つの細胞を調べ、すべてが変異 X を持ち、そのうち二つだけが変異 Y を共有し、さらにその一つだけが変異 Z を持っていたとする。この分布は、X が比較的古い祖先で生じ、その後に分岐した一方の系統で Y が生じ、さらにその子孫で Z が生じたという系譜と整合する。個々の変異だけでは単なる塩基配列の違いだが、複数の変異について「どの細胞が何を共有しているか」を重ねることで、差異の集合が分岐順序を推定する情報へ変わる。

この考え方は、実際の正常ヒト組織でも利用されてきた。正常細胞の全ゲノム配列を比較した研究では、細胞ごとに蓄積した体細胞変異の共有関係から、発生初期の細胞分裂を遡って推定できることが示された[3]。推定の起点は、現在の組織に残る変異である。成人や出生後の組織に残っている変異を比較し、その分布から過去の分岐を再構成している。

ヒト脳でも同じ原理が使われている。単一ニューロンのゲノムに存在する体細胞変異を比較することで、現在は別々に存在する神経細胞が発生過程のどの分岐を共有していたかを推定できることが示された[4]。系譜の標識として読んでいるのは、発生途中で生じてその後も DNA に残った変異である。

成人の組織に残る体細胞変異から、受精後のごく初期に起きた細胞分裂の非対称性を推定した研究もある[5]。正常な造血幹細胞については、各細胞に蓄積した体細胞変異から系統樹を構築し、その枝分かれの構造から、血液細胞を生み出す幹細胞集団が生涯を通じてどのように維持されてきたかが解析されている[6]。現在採取した細胞の DNA に、数十年前の細胞分裂を推定するための情報が残っていることになる。

体細胞変異が履歴の痕跡として機能する理由は、ある時点で生じた塩基配列の変化が DNA 複製によって子孫へ伝わり、その系統だけに残ることにある。変異の発生、子孫への継承、複数細胞間での共有関係という三つの段階がつながることで、現在の差異から過去の分岐を逆向きに推定できる。

系譜の復元には、変異の存在に加えて、どの細胞がどの変異を持つかを十分な精度で観測し、共有関係を比較できることが必要になる。全ゲノム解析なら DNA 全体から変異を探索できるが、次に扱う scRNA-seq は RNA を測定する技術であり、観測できる変異の範囲が限られる。それでも同じデータから体細胞変異を取り出せるなら、細胞の現在の発現状態と、そこへ至った系譜を一つの測定系から別々に読む可能性が生まれる。


4. 同じ scRNA-seq から状態と履歴を別々に読む

細胞系譜を体細胞変異から復元するなら、DNA 全体を読む全ゲノム解析は直接的な方法である。変異を探索できる範囲が広く、発現している遺伝子だけに観測対象が限定されない。ただし、系譜解析のために全ゲノムを別途取得する場合、既存の scRNA-seq データだけの再利用では済まず、同じ細胞について発現状態と DNA 変異を対応付けるための追加測定も必要になる。既に取得された scRNA-seq の中から系譜情報まで取り出せれば、一つの測定結果を二つの異なる目的に利用できる。

scRNA-seq では、RNA の量と塩基配列の両方がデータに含まれる。どの遺伝子に由来する RNA かを判別するために、その塩基配列も読み取っている。RNA は DNA の配列をもとに転写されるため、読み取った領域にゲノム上の変異があれば、その塩基の違いが RNA 配列にも現れる場合がある。発現量として集計すれば細胞の現在の状態を示す情報になり、配列中の塩基差として調べれば過去の系譜を推定する候補になる。同じシーケンスデータの中に、由来と役割の異なる二種類の信号が含まれている。

この発想を早くから実用化した対象の一つが、ミトコンドリア DNA の体細胞変異である。Ludwig らは、細胞内に多数存在するミトコンドリアの変異を自然に生じた遺伝的標識として利用し、単一細胞の系譜と遺伝子発現状態を対応付けられることを示した[7]。人工的なバーコードの事前導入を必要としないため、ヒト試料のように発生時点へ遡った標識が難しい対象にも適用できる。

LINEAGE は、この考え方を通常の scRNA-seq データへ接続した。scRNA-seq に含まれるミトコンドリア RNA の塩基差のうち、細胞系譜を区別する情報として利用できるものを選び出し、外部から標識を導入せずに系譜解析を行う方法を提案した[8]。ここでは、同じ RNA 配列データの一方の側面を発現量として読み、もう一方の側面を継承された塩基差として読むことになる。

対象は核ゲノム由来の変異にも広がる。核ゲノムに由来する遺伝子が転写されれば、その RNA 配列にも核 DNA の塩基配列が反映される。そのため、scRNA-seq のリードから一塩基変異を抽出し、それらが細胞間の系統関係を示す情報を含むかを調べることができる。Moravec らは、scRNA-seq から得た変異に系統学的な信号が存在するかを検証し、発現量とは別に、配列差から細胞間の歴史的関係を読み取れる可能性を評価した[9]。

PhylinSic は、この核由来の変異情報から実際に系統樹を構築する処理へ踏み込んだ。scRNA-seq で観測された塩基情報から各細胞の遺伝型を推定し、その遺伝型の違いをもとに細胞間の系統関係を推定する[10]。第 3 章で見た「どの細胞がどの変異を共有しているか」という考え方を、RNA シーケンスから得られる不完全な変異情報に適用した方法と位置付けられる。

同じ scRNA-seq から取得できる発現情報と変異情報は、異なる生物学的関係を表している。遺伝子発現は、細胞型、分化段階、周囲から受ける刺激、細胞周期などによって変化する。これに対して、ある祖先細胞で生じて子孫へ継承された体細胞変異は、その後に細胞の機能状態が変わっても DNA 配列に残り得る。前者は現在の機能に応じて変化しやすく、後者は過去の分岐を越えて保存されやすいという違いがある。

この違いは実際の単一細胞データでも観察されている。2026 年に 5 人のがん患者から得た 381 細胞を解析した研究では、一塩基変異の一部には細胞系統を区別する系統学的信号が認められた一方、遺伝子発現から捉えた転写状態の変動の多くは可塑的で、推定された細胞系統とは相関しなかった[11]。この研究の対象はがん細胞であり、正常組織の発生過程について同じ関係が成立するとまでは言えない。それでも、転写状態の近さと系譜上の近さを別の指標として扱う必要性を示す具体例にはなる。

情報 データ上の由来 主に答える問い 変化する条件
遺伝子発現 各遺伝子に由来する RNA の観測量から得られる。 その細胞が観測時点でどのような状態や機能にあるかを調べる。 分化段階、環境、刺激、細胞周期などによって変化し得る。
継承された体細胞変異 RNA の塩基配列に現れた、ゲノム由来の配列差から推定する。 どの細胞が過去の分岐を共有しているかを調べる。 変異が生じた時点と、その後どの子孫へ継承されたかによって分布が決まる。

scRNA-seq から変異を読む方法には、全ゲノム解析と異なる制約がある。RNA から確認できるのは、観測時に発現して読み取られた領域の変異に限られる。発現している領域でも、読み取り量が少ないと変異塩基の観測率が下がる。また、RNA 編集やシーケンス誤差など、DNA の体細胞変異とは異なる原因でも塩基差は生じ得る。scRNA-seq に系譜情報が含まれることと、そこから各細胞の変異を完全に取得できることは別の条件である。

この制約によって、核由来の体細胞変異を使った系譜推定では、観測できる変異が少なく、細胞ごとに欠ける情報も多くなる。特に正常組織では、強いクローン増殖を伴う腫瘍と比べて利用できる変異が限られる。この条件で、個々の細胞の遺伝型をどこまで確定してから系統樹を構築するべきかが、解析方法そのものの性能に関わってくる。

同じ scRNA-seq から状態と履歴を読むという考え方は、RNA の量と RNA 配列中の継承された塩基差という、異なる物理的情報を同じデータから取り出すことである。発現量からは「いま何をしている細胞か」を調べ、体細胞変異からは「どの分岐を経てきた細胞か」を推定する。この二つを同じ細胞について対応付けることで、現在の状態だけを並べた解析に、生成履歴という別の座標軸を加えられる。


5. 少ない変異から細胞系譜を再構築できるか

核由来の体細胞変異を scRNA-seq から読む方法には、前章で見た二つの制約が同時にある。第一に、正常組織で利用できる変異は、がん細胞のように多数の変異を蓄積したクローンより限られる。第二に、scRNA-seq が観測するのは、DNA 全体のうち各細胞で発現して RNA になった領域の一部である。同じ変異を持つ二つの細胞でも、一方でその遺伝子が十分に発現していなければ、変異は一方からしか観測されないことがある。変異そのものが少ないことと、存在する変異も細胞ごとに欠けて見えることが重なり、正常組織の系譜推定を難しくする。

2026 年 8 月、太田聡史らは、この条件を対象とする real-time course analysis、RTCA を報告した[12]。RTCA は、正常組織の scRNA-seq に含まれる核由来の体細胞変異を利用し、細胞間の系統関係を推定する方法である。

RTCA と、それ以前の核由来変異を使う方法との差は、欠けた変異情報をどの段階で処理するかにある。比較対象となった PhylinSic では、scRNA-seq から観測された塩基情報をもとに各細胞の遺伝型を推定し、その遺伝型から系統樹を構築する[12]。この場合、変異サイトの観測結果から「この細胞はどの遺伝型を持つか」を一度推定し、その結果を次の系統推定へ渡す。RNA の読み取りが不足しているほど、最初の遺伝型推定そのものが不確実になり、その誤りや欠測が後段の系統推定にも影響する。

RTCA は、この中間段階を置かず、各変異サイトで観測された塩基の組み合わせから細胞間の遺伝距離を求め、その距離関係から系統樹を推定する[12]。個々の細胞について完全な遺伝型の確定を前提条件とせず、複数の変異サイトに分散して残っている細胞間の違いを距離として集約する。欠測を「変異なし」とみなす単純化を避け、得られた情報の範囲から細胞同士がどの程度異なるかを評価し、その全体構造を系統推定へ使う。

解析上の条件 系譜推定への影響 RTCA の考え方
正常組織では変異が少ない 系統を区別する標識となる変異サイトの数が限られる。 得られた複数サイトの差異を細胞間距離として集約する。
RNA になった領域しか読めない DNA 上には存在する変異でも、細胞によって観測できない場合がある。 すべてのサイトをすべての細胞で観測できることを前提にせず、利用可能な塩基情報から関係を求める。
細胞ごとの遺伝型が不確実になる 遺伝型推定を先に行う方法では、その誤差が系統樹の推定へ引き継がれる。 完全な遺伝型の復元を中間目標にせず、観測された変異パターンから系統学的な関係を推定する。

この違いの要点は、各細胞の全変異を完全に知ることよりも、細胞間の分岐を区別できる関係がデータに残っていることを重視する点にある。たとえば、ある変異サイトが半数の細胞でしか読めなくても、別のサイトでは別の組み合わせの細胞が観測されていれば、複数サイトを合わせたときに細胞間の距離を区別できる可能性がある。個々の観測が不完全でも、それぞれが持つ部分的な関係を集積すれば、系統樹を決める信号が残る場合がある。

この設計でも情報不足は制約として残る。変異サイトが少なすぎれば異なる系統を区別できず、欠測が増えれば細胞間距離の推定も不確実になる。また、観測された塩基差には体細胞変異以外の要因も入り得るため、入力された差異には系譜標識としての不確実性も残る。RTCA が問うているのは、正常組織で現実に得られる限られた変異情報の中に、どこまで系譜を再構築できる信号が残っているかである。

この問いには、推定精度の条件別評価が必要になる。利用可能な変異が減ったとき、細胞数が増えたとき、RNA の読み取りが欠けたときに、推定した系統樹がどの程度正解を保てるかを測る必要がある。正解の系統樹をあらかじめ設定できるシミュレーションではその精度を直接評価できるが、実際のヒト組織には比較できる正解樹が存在しない。次章では、この二種類の検証を分け、RTCA がどの条件でどこまで再構築できたのかを確認する。


6. ヒト胎盤では何が確認されたのか

RTCA が少ない変異と欠測を含むデータから系譜をどこまで復元できるかを評価するには、推定された系統樹を正解と比較する必要がある。実際のヒト組織には、現在採取した細胞について受精卵から現在までの全分裂を記録した正解樹が存在しない。そこで研究では、正解をあらかじめ設定できるシミュレーションによる定量評価と、既知の細胞分類を持つヒト胎盤データへの適用を分けて行っている[12]。この二つは同じ方法を評価しているが、確認している内容は異なる。

シミュレーションでは、既知の系統樹に沿って変異が蓄積したデータを生成し、そこから RTCA が再構築した系統樹を元の正解樹と比較する。この条件では、「設定した正解をどの程度再現できたか」が直接の評価対象になる。研究では、再構築精度(correctness)が 0.90 に到達するために必要な変異サイト数を調べた結果、50 細胞相当では約 250、100 細胞相当では約 270、1,000 細胞相当でも約 380 から 400 だった[12]。

この結果では、細胞数の増加に対する必要変異サイト数の増加は緩やかである。50 細胞から 1,000 細胞へ増えると細胞数は 20 倍になるが、再構築精度 0.90 に必要とされた変異サイト数は約 250 から約 380〜400 への増加にとどまる。研究では、樹が大きくなるほどトポロジーが複雑になるため必要な変異サイト数は増えるものの、このシミュレーション条件では細胞数と同じ倍率では増加しなかったと評価できる[12]。

この数値の適用範囲はシミュレーション条件内である。シミュレーションの結果は、設定した変異率、系統樹の枝長、利用可能な変異サイト数、欠測の程度などの条件に依存する。とくに scRNA-seq では、ヘテロ接合変異を持っていても一方の対立遺伝子しか観測されないアレリックドロップアウトが起こる。研究でも、その割合を増やすと系統樹の推定精度が低下し、利用可能な変異サイトを増やすことで低下をある程度補えることが確認されている[12]。必要なのは、欠測を含めても系統間の違いを識別できるだけの情報が残っていることである。

実際の組織への適用には、Pavličev らが 2017 年に報告した健康な満期胎盤の scRNA-seq データが使われた[13]。このデータは GEO の GSE87720 として公開されており、2 件の健康な妊娠から採取された胎盤由来の計 87 細胞で構成される。二つのデータ群には、それぞれ 54 細胞と 33 細胞が含まれている[14]。既存の scRNA-seq データを別の情報軸から再解析した点も、この研究の特徴である。

54 細胞からなる Batch1 では最終的に 1,335 変異サイト、33 細胞からなる Batch2 では 574 変異サイトが系統推定に使われた[12]。各サイトについて欠測を最大 20% まで許容する条件を設け、多くの細胞で比較できるサイトへ対象を絞っている。これは scRNA-seq の制約をそのまま反映している。ある変異が DNA 上に存在していても、多数の細胞でその位置を観測できなければ、細胞間の共有関係を判定する材料には使いにくい。

得られた系統樹は、元研究で遺伝子発現に基づいて分類されていた胎盤細胞の種類と概ね対応した。Batch1 では、前駆的な性質を持つ CYT1 細胞の多くが、CYT2、CYT3、EVT へ向かう分岐より前の位置に配置された[12]。RTCA は体細胞変異から独立に系統関係を推定し、その結果を既知の細胞型や分化関係と比較している。異なる種類の情報から得た二つの構造が対応したことが、実データに系譜信号が含まれていることを支持する。

評価 比較する対象 確認できること 確認できないこと
シミュレーション あらかじめ設定した正解樹と RTCA が再構築した系統樹を比較する。 設定した変異率、欠測、細胞数などの条件下で再構築精度を定量評価できる。 同じ精度が実際の正常ヒト組織でも成立することまでは示さない。
ヒト胎盤 体細胞変異から推定した系統樹と、既知の細胞型分類や分化関係を比較する。 実際の scRNA-seq に含まれる変異から、生物学的知見と整合する系統構造を得られるかを確認できる。 受精後の全細胞分裂を記録した正解樹がないため、真の細胞系譜に対する正解率は測定できない。

二つの評価を区別すると、RTCA について確認された範囲も明確になる。シミュレーションでは、正解樹が既知なので、数百程度の変異サイトから一定条件下で高い再構築精度に到達できることが定量的に示された。ヒト胎盤では、現実の scRNA-seq に含まれる変異から系統樹を構築でき、その構造が既知の細胞型や分化関係と概ね整合することが確認された。実際の胎盤で推定された親子関係の何割が真の系譜と一致しているかという精度は、このデータからは測れない。

定量的な精度として読めるのは正解樹を持つシミュレーションの結果であり、胎盤解析が加えているのは、実データでも生物学的に整合する構造が得られたという別種の根拠である。この二段階を分けることで、RTCA が実データでも生物学的に整合する構造を得たことと、実組織における真の系譜への定量的な正解率が未測定であることを同時に捉えられる。

推定樹と既知の細胞型との整合性は、個々の変異が同じ系譜を支持する度合いとは別の評価である。実際の scRNA-seq には欠測や誤差が含まれ、異なる変異サイトは一つの系統樹と完全には一致しない。次章では、胎盤データに含まれる変異が推定樹とどの程度整合したのかを確認し、「履歴に由来する痕跡を読むこと」と「過去の分岐を直接観測すること」の間に残る距離を扱う。


7. 痕跡を読むことと、過去を直接見ることは違う

体細胞変異は過去の細胞分裂に由来するため、遺伝子発現よりも系譜へ直接結び付いた情報になり得る。しかし、scRNA-seq から観測される変異は、細胞の DNA に存在する変異の一部である。scRNA-seq が読むのは転写された RNA なので、観測対象は発現した遺伝子領域に限られる。発現している領域でも、塩基位置の確認精度は読み取り量に左右される。DNA 上に存在する変異と、解析データ上で確認できる変異の間には、この段階ですでに情報の欠落が生じる。

観測された塩基差には DNA の体細胞変異以外も含まれ得る。ヘテロ接合変異を持つ細胞で一方の対立遺伝子だけが観測されるアレリックドロップアウト、DNA 配列とは異なる塩基として RNA が記録される RNA 編集、シーケンス時の読み取り誤差、変異検出処理で生じる誤判定などが加わるためである[12]。実際の DNA 配列から RNA が転写され、その RNA がシーケンスされ、さらに変異候補として判定されるまでには複数の処理段階があり、それぞれで情報の欠落や変形が起こり得る。

段階 起こり得ること 系譜推定への影響
DNA から RNA への転写 発現していない領域の変異は scRNA-seq では観測できない。 実際には共有されている変異が、比較に利用できない場合がある。
RNA の観測 発現量や読み取り深度が不足すると、一部の塩基情報が欠ける。 細胞間で同じ変異を共有しているかを判定しにくくなる。
塩基差の生成 RNA 編集によって DNA 変異とは異なる塩基差が現れることがある。 系譜とは無関係な差異が体細胞変異候補に混入し得る。
シーケンスと変異検出 読み取り誤差や変異検出の誤判定が生じることがある。 存在しない差異を追加したり、存在する差異を取りこぼしたりする可能性がある。

この制約が実データでどの程度現れるかを見るため、RTCA 論文では胎盤の Batch1 について、推定した系統樹と各変異サイトの分布が整合するかを調べている。欠測の多いサイトを除いた 1,335 サイトを対象に評価した結果、採用した判定条件の下で推定樹と整合したサイトは 60.7% だった[12]。残る 39.3% は、一本の推定系統樹に沿った継承パターンとは整合しなかった。

残る 39.3% には複数の原因が考えられる。観測された塩基差自体に誤りが含まれている場合もあれば、実際の変異過程が解析で仮定した単純な継承モデルから外れる場合もある。同じ塩基変化が独立した系統で生じれば、共有変異を共通祖先の印として読む前提が崩れる。また、推定された系統樹自体が真の分岐を完全に再現していなければ、正しく観測された変異であってもその樹とは整合しない。変異サイト整合率(site compatibility)の不一致は、測定、変異推定、進化過程、系統樹推定という複数の段階をまとめて反映し得る値である。

この 60.7% を、前章で示したシミュレーションの再構築精度 0.90 と並べて「実データでは精度が 60.7% に下がった」と読むのは誤りである。二つは測定対象が異なる。シミュレーションの再構築精度は、正解として設定した系統樹と再構築した系統樹がどの程度一致したかを評価する。一方、胎盤データの変異サイト整合率は、推定された一本の系統樹に対して、個々の変異サイトの分布が想定した継承関係と整合するかを評価している[12]。

評価指標 比較しているもの 値から読めること
再構築精度 シミュレーションで設定した正解樹と、RTCA が再構築した系統樹を比較する。 既知の正解に対して系統樹そのものをどの程度再現できたかを示す。
変異サイト整合率 実データの各変異サイトと、推定された系統樹上の継承パターンを比較する。 個々の変異サイトが、その推定樹とどの程度整合しているかを示す。

実組織には受精後の全細胞分裂を記録した正解樹がないため、真の系譜に対する正解率は別途評価が必要になる。推定樹と多くの変異サイトが整合することは、その樹を支持する根拠になる。整合率は系統樹の正解率とは異なる指標である。第 6 章でシミュレーションと胎盤解析を分けたのと同じ理由で、ここでも評価指標が何を測っているかを分離する必要がある。

手法の再現可能性についても、現時点では一つ制約が残る。解析に使用された元の胎盤データは GSE87720 として公開されているが、2026 年 8 月 28 日時点で RTCA 論文の Program availability 欄には、ソースコードの GitHub 公開先が「[TBA]」と記載されている[12]。データを取得して独自に類似解析を行うことは可能でも、論文著者が実際に使用した実装を取得し、同じ処理系で結果を再実行する経路は、論文ページ上ではまだ提示されていない。

この点は研究結果そのものの妥当性とは別に、結果の検証可能性を評価する条件として記録する必要がある。論文には手法、シミュレーション条件、実データ解析の結果が記述されている。公開された実装を用いて第三者が処理を再実行できるかという再現手順には、別の条件が必要になる。研究内容の妥当性と、同一実装による計算再現性は異なる評価軸である。

それでも、RTCA が利用する体細胞変異には、発現状態とは異なる情報上の性質がある。発現量は細胞の現在の機能や環境によって変化し得るのに対し、ある祖先細胞で生じて子孫へ継承された変異は、その後に細胞の機能が変わっても配列上に残り得る。この保存性があるため、RTCA は現在の状態の類似性とは別の軸から細胞間の関係を推定できる。

ただし、履歴に由来する情報を使うことと、履歴そのものを観測することの間には一段の推論が残る。観測できるのは現在の細胞に残った RNA 配列であり、そこから体細胞変異を推定し、変異の共有関係から細胞間距離を求め、その距離から過去の分岐を再構築している。観測対象は現在に保存された不完全な痕跡であり、その分布がどの履歴と整合するかをモデルによって推定している。

この区別を置くことで、RTCA の意義と限界を同じ枠組みで理解できる。発現状態からは得にくい履歴情報を、体細胞変異という別の痕跡から取り出せる。その痕跡には欠測と誤差があり、推定にはモデルが介在する。現在の状態と履歴を分けて読むという本稿の中心命題は、異なる種類の不完全な観測から、現在と過去をそれぞれ別の問いとして推定できる点にある。


8. 状態と履歴を分けると、見えるものが増える

ここまで見てきたように、細胞について「いま何をしているか」と「どこから来たか」は、同じ測定対象に対する別々の問いである。scRNA-seq の発現量からは、観測時点でどの遺伝子が働き、どの細胞型や分化状態に近いかを調べられる。細胞分裂を通じて継承された体細胞変異からは、どの細胞が過去の分岐を共有しているかを推定できる。同じ細胞について両方を対応付ければ、現在の状態だけを並べる解析から、状態がどの系譜上で生じたのかを比較する解析へ進める。

この区別が必要になるのは、発現状態と系譜が一対一に対応しないからである。同じ祖先から分かれた細胞でも、異なる分化経路や環境へ進めば発現状態は離れる。系譜上は離れた細胞が似た機能を担えば、転写状態の一部が近づくこともある。現在の状態だけを見れば、この二つは同じ「似ている」という関係に見える場合があるが、体細胞変異を加えると、その類似性が共通の来歴を伴うのか、異なる履歴の上に成立したのかを別に検討できる。

組み合わせ 現在の状態 系譜上の関係 読み取れること
状態も系譜も近い 発現状態が似ている。 共有する分岐が近い。 近い来歴を持つ細胞が、現在も似た機能状態を保っている可能性を検討できる。
状態は近く系譜は遠い 発現状態が似ている。 異なる分岐に属する。 異なる履歴を持つ細胞が、似た機能状態へ収束した可能性を検討できる。
状態は遠く系譜は近い 発現状態が異なる。 共有する分岐が近い。 共通の祖先から分かれた細胞が、その後の分化によって異なる状態へ進んだ可能性を検討できる。

この二軸化によって、発生や分化の解釈も変わる。発現状態だけを並べれば、細胞がどの方向へ変化しているように見えるかを推定できる。系譜情報を加えれば、その状態変化が実際に近い祖先関係を持つ細胞の間で起きているのか、それとも別の系譜から似た状態が生じているのかを区別する材料が増える。RTCA の意義は、同じ scRNA-seq の中で「状態の近さ」と「履歴の近さ」を別の変数として扱える点にある。

既稿「意味は差異の読み取りから生まれる」では、物理的な差異が保存され、その差異を比較できる読み取り系に接続されることで、記録や情報として機能する構造を扱った[15]。体細胞変異は、この構造を細胞系譜の中で具体的に確認できる例である。塩基配列の差異だけで発生時点や意味が決まるのではなく、ある変異が細胞分裂によって子孫へ継承され、複数の現在の細胞について共有関係を比較できるとき、その差異は過去の分岐順序を推定する材料になる。

既稿「生命はどのように維持されるのか」では、DNA の複製と細胞分裂を、生命の構造が時間方向へ受け渡される過程として扱った[16]。その観点から見ると、体細胞変異には二つの側面がある。複製の正確さという観点では、元の配列から生じた差異である。一方、履歴解析の観点では、その差異が後の細胞へ継承されることで、どのコピーがどのコピーから生じたかを逆向きに推定する標識になる。複製過程で生じた不一致が、後から複製経路そのものを読むための情報へ変わる。

ここには、状態を測る情報と履歴を測る情報の違いが明確に現れている。遺伝子発現は細胞が現在置かれている条件に応じて変化するため、現在の機能を捉えるには適している。体細胞変異は、いったん生じて子孫へ継承されれば、後に発現状態が変わっても配列上に残り得るため、過去の分岐を捉える材料になる。両者が保持する時間情報は異なる。

この違いを一般化すると、履歴を持つシステムでは、現在の状態を精密に測定することと、生成過程を復元することは別の観測問題になる。異なる履歴が同じ状態へ到達できる場合、現在の特徴量に対して複数の過去が対応する。過去を区別するには、その過程の途中で生じ、後まで保存された差異が必要になる。細胞では体細胞変異がその役割を担い得る。

保存された痕跡にも観測条件と推定上の制約が残る。RTCA の胎盤データでは、推定樹と整合した変異サイトは 60.7% だった[12]。

このため、細胞系譜を扱うときには三つの段階を分ける必要がある。第一に、現在の発現状態を測ること。第二に、過去の分岐によって残った変異を観測すること。第三に、その変異の共有関係から系譜を推定することである。発現量も変異も現在の細胞から取得するが、前者は現在の機能状態を、後者は過去の分岐を推定する材料になる。そして系譜樹は、観測された変異から再構築された結果である。

現在の状態と履歴を分けることで、情報量に加えて分析の軸が増える。同じ細胞集団について、状態の類似と系譜の近さが一致する場合と一致しない場合を区別できるようになる。scRNA-seq に残った体細胞変異を使う研究が示しているのは、現在の細胞の分類に加えて「どの経路を通って現在に至ったか」という第二の構造を、同じデータの中から取り出せる可能性である。細胞が何であるかと、どのようにその細胞になったかを別の問いとして測ることが、現在の状態に履歴を重ねた理解につながる。


参考文献

  1. Trapnell C, Cacchiarelli D, Grimsby J, et al. The dynamics and regulators of cell fate decisions are revealed by pseudotemporal ordering of single cells. Nature Biotechnology 32, 381-386 (2014). https://doi.org/10.1038/nbt.2859
  2. Saelens W, Cannoodt R, Todorov H, Saeys Y. A comparison of single-cell trajectory inference methods. Nature Biotechnology 37, 547-554 (2019). https://doi.org/10.1038/s41587-019-0071-9
  3. Behjati S, Huch M, van Boxtel R, et al. Genome sequencing of normal cells reveals developmental lineages and mutational processes. Nature 513, 422-425 (2014). https://doi.org/10.1038/nature13448
  4. Lodato MA, Woodworth MB, Lee S, et al. Somatic mutation in single human neurons tracks developmental and transcriptional history. Science 350, 94-98 (2015). https://doi.org/10.1126/science.aab1785
  5. Ju YS, Martincorena I, Gerstung M, et al. Somatic mutations reveal asymmetric cellular dynamics in the early human embryo. Nature 543, 714-718 (2017). https://doi.org/10.1038/nature21703
  6. Lee-Six H, Øbro NF, Shepherd MS, et al. Population dynamics of normal human blood inferred from somatic mutations. Nature 561, 473-478 (2018). https://doi.org/10.1038/s41586-018-0497-0
  7. Ludwig LS, Lareau CA, Ulirsch JC, et al. Lineage Tracing in Humans Enabled by Mitochondrial Mutations and Single-Cell Genomics. Cell 176, 1325-1339.e22 (2019). https://doi.org/10.1016/j.cell.2019.01.022
  8. Lin L, Zhang Y, Qian W, et al. LINEAGE: Label-free identification of endogenous informative single-cell mitochondrial RNA mutation for lineage analysis. Proceedings of the National Academy of Sciences 119, e2119767119 (2022). https://doi.org/10.1073/pnas.2119767119
  9. Moravec JC, Lanfear R, Spector DL, Diermeier SD. Testing for Phylogenetic Signal in Single-Cell RNA-Seq Data. Journal of Computational Biology 30, 518-537 (2023). https://doi.org/10.1089/cmb.2022.0357
  10. Liu X, Griffiths JI, Bishara I, et al. Phylogenetic inference from single-cell RNA-seq data. Scientific Reports 13, 12854 (2023). https://doi.org/10.1038/s41598-023-39995-6
  11. Alves JM, Tomás L, Posada D. Unraveling the Phylogenetic Signal of Gene Expression from Single-cell RNA-seq Data. Genomics, Proteomics & Bioinformatics, qzag017 (2026). https://doi.org/10.1093/gpbjnl/qzag017
  12. Oota S, Abe K, Pan CT, et al. Reconstruction of cell diversity and cell lineages from somatic mutations in single-cell transcriptomic data. DNA Research 33, dsag007 (2026). https://doi.org/10.1093/dnares/dsag007
  13. Pavličev M, Wagner GP, Chavan AR, et al. Single-cell transcriptomics of the human placenta: inferring the cell communication network of the maternal-fetal interface. Genome Research 27, 349-361 (2017). https://doi.org/10.1101/gr.207597.116
  14. NCBI Gene Expression Omnibus, GSE87720: Term placenta single cell transcriptome. https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE87720
  15. id774, 意味は差異の読み取りから生まれる(2026-05-09). https://blog.id774.net/entry/2026/05/09/4740/
  16. id774, 生命はどのように維持されるのか(2026-04-15). https://blog.id774.net/entry/2026/04/15/4451/