未来に起きた結果は、なぜ過去の行為を変えられるのか。
行為の直後に結果が返る場合、原因候補は比較的絞りやすい。ボタンを押した瞬間に報酬が出れば、その報酬を直前のボタン押しへ結び付けても大きな矛盾は生じない。ところが結果が数秒後、数分後、あるいは数日後に現れると、その間に別の状態、判断、行為が入り込む。結果が到来した時点では、原因候補となった行為はすでに過去へ移り、現在の入力だけを見ても更新対象を特定できなくなる。
この時間差は、単に学習を遅くするのではなく、学習すべき対象を曖昧にする。ある結果が望ましいと評価できても、その結果を生んだ行為を別の行為と取り違えれば、次回に強化される選択も変わる。望ましくない結果を本来とは無関係な行為へ帰属すれば、有効だった行為を抑制する可能性もある。結果の価値を正しく評価することと、その価値を正しい過去へ返すことは別の計算になる。
遅延した結果から学習するには、行為が終わった後も、その行為に関係する情報の一部を結果到来まで利用可能にしておく必要がある。さらに、保持された過去の候補と実際の結果を照合し、どの候補へ更新を適用するかを決めなければならない。過去を保持する処理、結果を評価する処理、両者を結び付ける処理がそろって初めて、未来の結果を次の行為選択へ反映できる。
この観点から見ると、学習とは結果の価値を更新する過程であると同時に、どの過去とどの未来を因果的に結び付けるかという時間構造を更新する過程でもある。学習によって変わるのは、「この結果は良かった」という評価だけではない。「この行為の後には、この程度の時間を経て、この結果が起こる」という対応関係も変わる。未来の結果は、過去の一部が内部状態として残り、結果到来時に再び参照されることで、過去の行為へ影響を返すことができる。
1. 未来の結果は過去のどの行為へ返るのか
学習を最小限に表すと、ある状態で行為を選び、その後に得られた結果を使って次の選択を変える過程になる。このとき更新対象を決める手掛かりの一つが、行為と結果の時間的な近さである。結果が行為の直後に現れれば、その行為を原因候補として選びやすい。結果までの時間が延びると、その間に複数の状態や行為が入り込み、時間的近接だけでは原因候補を絞れなくなる。
たとえば、あるハンドル操作の 1 秒後に報酬が来たとする。その 1 秒の間にも、手を戻す、姿勢を変える、視線を移す、次の操作を準備するといった変化が生じる。神経系の内部でも、感覚入力、身体状態、注意、行為準備、結果予測が連続して変化する。報酬が届いた瞬間に存在する状態だけを見れば、報酬を最初のハンドル操作へ返すべきか、その後の運動へ返すべきかは決まらない。
遅延がさらに長くなれば、候補は時間方向だけでなく階層的にも増える。ある成果が数分後に判明した場合、最後に実行した操作、その直前の判断、さらに前の方針選択、一連の手順全体が原因候補になり得る。同じ結果でも、最後の操作だけを強化する場合と、途中の判断を強化する場合では、次回に再現される行動系列が異なる。学習内容は結果そのものではなく、結果をどこへ帰属させたかによって決まる。
| 結果までの条件 | 原因候補の状態 | 単純な時間近接で扱える範囲 | 学習に追加で必要になる情報 |
|---|---|---|---|
| 行為の直後に結果が返る | 直前の行為が主要な候補になる。 | 結果と行為が近接しているため、直前の状態を更新対象として選びやすい。 | 現在の状態と直前の行為を保持すれば対応付けやすい。 |
| 数秒後に結果が返る | 行為後の運動、姿勢、感覚入力、次の行為準備など複数の候補が入り込む。 | 結果直前の状態を選ぶだけでは、最初の行為との対応を失う可能性がある。 | 原因候補となる行為と結果までの時間関係を内部状態として保持する必要がある。 |
| さらに長い遅延の後に結果が返る | 個々の操作、途中の判断、方針、一連の行動系列まで候補が階層化する。 | 時間的近接だけでは、どの粒度の過去を更新すべきか決めにくい。 | 履歴を圧縮して保持し、結果到来時に更新対象を選別する仕組みが必要になる。 |
この表で変化しているのは、経過時間そのものより原因候補の数と粒度である。遅延が長くなると、その間に生じた出来事が増え、結果を返せる候補も増える。さらに、候補は単独の行為だけでなく、判断や行動系列へ広がる。そのため、学習系には「何秒前か」を記録するだけでなく、「どの過去がまだこの結果の候補として有効か」を管理する仕組みが必要になる。
原因候補を保持できなければ、結果到来時に利用できるのは直前の状態だけになる。この場合、遅れて届いた報酬を本来の行為ではなく、その直前に偶然起きていた運動や感覚状態へ帰属させる可能性がある。結果の評価が正確でも、帰属先を誤れば誤った行為が強化されるため、学習系全体としては失敗する。
反対に、過去のすべてを同じ強さで保持し続ければ、今度は候補を絞れない。1 秒前の行為と 10 秒前の無関係な状態が同じ更新対象として残れば、結果の影響が広く拡散し、本来の原因と周辺状態を区別しにくくなる。必要なのは完全な履歴保存ではなく、結果との対応可能性を保ちながら原因候補を限定できる内部表現である。
この構造は報酬学習だけに現れるものではない。試行錯誤によって改善する系では、結果が判明した時点から過去へさかのぼり、更新対象を選ぶ必要がある。ある手順の成果が良かった場合、最後の操作を残すのか、その前の判断を残すのか、一連の方針を残すのかによって、次回の行動は変わる。結果の評価が同じでも、帰属先が異なれば学習される規則も異なる。
ここから、学習には「結果がどの程度望ましかったか」を評価する処理と、「その結果を何が生んだか」を選ぶ処理が必要になる。前者は更新の方向と大きさに関係し、後者は更新対象を決める。
時間差が大きくなるほど、後者の処理が占める役割は増える。結果の直前だけを見ればよい状況から、複数の過去を候補として保持し、その中から結果との関係がある状態を選ぶ状況へ変わるためである。遅延学習は、結果を記録する問題から、時間上に散らばった因果候補を管理する問題へ変わる。
未来の結果を過去の行為へ返すには、結果が来るまで過去の一部を利用可能な状態として残しておく必要がある。ただし、残すべきものは過去の完全な複製ではない。結果が到来したときに「この結果はどの行為へ返るのか」を判別できる情報が残っていればよい。次に問うべきなのは、その情報がどのような内部状態として保持され、結果到来までの時間をどのように橋渡しするかである。
2. 結果が届くまで過去を利用可能にしておく必要がある
結果が遅れて届く場合、原因候補となる過去を結果到来まで何らかの形で利用可能にしておく必要がある。過去の状態が完全に失われれば、後から得られた結果をその状態へ帰属させる手掛かりも失われる。第 1 章で見たように、遅延が長くなるほど結果までに介在する状態や行為は増えるため、学習系には過去の候補を一定期間保持し、結果が届いた時点で参照できる仕組みが必要になる。
既稿「時間はどこにあり、『いま』はどこで生まれるのか」では、現在を数学的な一点としてではなく、入力、記憶、予測、行為が一定の時間幅の中で統合されながら更新される過程として整理した[1]。この見方を学習へ適用すると、現在には「いま起きていること」だけでなく、結果がまだ確定していない直前の履歴も含まれる。過去の出来事そのものを現在へ再現する必要はなく、後から届く結果と対応付けられる情報が残っていればよい。
概念的には、行為と結果の間に「結果待ちの内部状態」を置ける。ある行為が起きると、その行為に関連する情報の一部が内部状態として残る。時間が経過する間に身体状態や感覚入力が変化しても、その内部状態が維持されていれば、結果到来時に過去の行為を更新候補として参照できる。結果が得られた時点で、その状態は「報酬につながった」「予測と異なった」「結果との対応が弱かった」といった形で更新される。
ここで保持されるものは、過去の完全な複製である必要はない。学習に必要なのは、後から届いた結果をどの過去へ返すか判断できる情報である。行為の種類、直前の状態、結果までの時間、予測される結果など、更新対象を識別するために必要な要素が圧縮された内部状態として残れば、未来の結果を過去へ結び付けられる。
| 内部状態に残す情報 | 何を識別するか | 結果到来時の役割 | 失われた場合の帰結 |
|---|---|---|---|
| 行為の種類 | どの操作や選択が実行されたかを識別する。 | 後から得られた結果を、候補となる行為へ対応付ける。 | 異なる行為を区別できず、結果の帰属先が曖昧になる。 |
| 直前の状態 | どの状況でその行為が選ばれたかを識別する。 | 同じ行為でも、状態によって異なる結果を学習できるようにする。 | 状況の違いを無視して、同じ行為へ一律に結果を返しやすくなる。 |
| 結果までの時間 | 行為から結果までの時間関係を識別する。 | どの過去がまだ結果待ちの候補として有効かを絞り込む。 | 時間的に近い無関係な出来事と、本来の原因候補を区別しにくくなる。 |
| 予測される結果 | その状態や行為から何が起こると期待されていたかを識別する。 | 実際の結果と予測を比較し、更新すべき内容を決める。 | 結果が期待通りだったか、予想外だったかを区別しにくくなる。 |
このとき現在は、過去と未来を切り離す境界というより、評価がまだ確定していない過去を未来の結果へ接続する処理領域として捉えられる。遅延学習で必要になる時間表現も、単に何秒経過したかを記録する時計とは役割が異なる。必要なのは、どの過去がまだ結果待ちであり、どの結果が到来したときに更新対象となるかを管理する時間構造である。
この構造を置くと、次に分けるべきなのは「結果がどの程度望ましいか」という評価と、「その結果をどの過去へ返すか」という帰属である。結果待ちの内部状態は、この二つを接続し、価値の評価を具体的な学習対象へ変換する役割を持つ。
3. 学習には価値更新より前に結果の帰属がある
強化学習では、行為の後に得られた報酬を用いて、状態や行為の価値を更新し、その後の方策を変える。ところが、報酬が得られたという事実だけでは更新対象は決まらない。結果が行為から遅れて到来する場合、その間には複数の状態や行為が存在するため、まず「この結果はどの過去に対応するのか」を選ぶ必要がある。このように、得られた結果の責任や功績を状態・行為へ割り当てる問題は credit assignment と呼ばれる。
たとえば、ある選択から数秒後に報酬が得られたとしても、その数秒の間に別の操作や状態変化があれば、報酬を直前の出来事へ機械的に結び付けるだけでは学習対象を誤る可能性がある。原因となった行為へ正しく結果を帰属できれば、その行為の価値を高められる。一方、無関係な状態へ帰属すれば、次回の選択規則も無関係な方向へ更新される。結果の評価と更新の間には、更新対象を選ぶ処理が必要になる。
既稿「強化学習と自由意志はどうつながるのか」では、経験によって状態や行為の価値を更新し、その価値に基づいて次の行為選択を変える構造を扱った[2]。そこへ時間軸を加えると、方策更新の前段に credit assignment が現れる。経験が行動変化へつながるには、結果を評価した後、その結果を生んだとみなす過去を選び、その対象へ更新を適用する必要がある。
この関係は、評価、帰属、更新という三段階に分けると明確になる。
| 段階 | 役割 | 時間上の問い | 誤った場合の帰結 |
|---|---|---|---|
| 評価 | 得られた結果がどの程度望ましいかを決める。 | 何が起き、その結果にはどの程度の価値があるかを判断する。 | 結果の価値を誤れば、望ましくない結果を強化したり、望ましい結果を弱めたりする。 |
| 帰属 | その結果をどの状態・行為へ結び付けるかを決める。 | いつの何がこの結果につながったかを選ぶ。 | 原因と無関係な状態や行為が更新対象となり、誤った因果関係を学習する。 |
| 更新 | 対応付けられた状態・行為の価値や選択規則を変える。 | 次に同じ状況が来たとき、どの選択を増減させるかを決める。 | 評価と帰属が適切でも、更新規則が合わなければ次の行動へ学習結果が反映されない。 |
三段階は直列につながっている。結果を評価すると、その評価を適用する過去が選ばれ、選ばれた状態や行為に対して価値や方策が更新される。報酬が大きくても帰属先を誤れば、学習されるのは本来の原因とは別の行為である。逆に、原因を正しく特定できても結果の価値評価を誤れば、更新の方向そのものが変わる。
遅延が長くなるほど、帰属の役割は大きくなる。結果の直前だけを候補にできる状況では時間的近接を手掛かりにしやすいが、行為と結果の間に複数の状態が入ると、それぞれが更新候補になる。第 2 章で述べた「結果待ちの内部状態」は、この候補を結果到来まで保持し、後から得られた評価を過去のどこへ適用するかを決めるために必要になる。
このため、遅延学習の中心には、結果の価値を計算する問題と並んで、結果を時間上のどこへ返すかという問題がある。価値更新は帰属された対象に対して実行されるため、credit assignment は学習内容を決める前処理に当たる。次に必要になるのは、神経系が複数の過去の候補をどのように保持し、結果が届いた時点で更新対象を選べる状態へ整理しているかを考えることである。
4. 学習系は時間上の因果候補を管理する
ここまでの論理だけから、遅延した結果を学習できる系には少なくとも五つの処理が必要だと考えられる。行為の履歴を保持し、そこから起こり得る結果を予測し、実際に結果が到来した時点で予測との対応を確認する。そのうえで結果を過去の状態や行為へ帰属させ、次の予測や行為選択を更新する。これらは独立した機能ではなく、未来の結果を過去の学習対象へ返す一連の処理としてつながっている。
| 処理 | 役割 | 必要になる理由 | 欠けた場合の帰結 |
|---|---|---|---|
| 履歴保持 | 直前までの状態や行為のうち、結果と対応する可能性がある情報を残す。 | 結果到来時にも原因候補となる過去を参照できる状態を維持するため。 | 結果が到来しても、その結果を結び付ける過去の候補を特定できなくなる。 |
| 未来予測 | 現在の状態や行為から、どの結果がいつ起こり得るかを見積もる。 | 実際の結果が予測通りだったか、予測から外れたかを判断する基準を持つため。 | 結果が得られても、それが期待通りだったのか予想外だったのかを区別しにくくなる。 |
| 結果確認 | 実際に何が起こり、いつ到来したかを予測された結果と照合する。 | 結果の有無、内容、到来時刻を確定し、学習へ使う情報を形成するため。 | 予測と現実との差を確定できず、どの内部状態を更新すべきか判断しにくくなる。 |
| 過去への帰属 | 確認された結果を、保持されている状態や行為のどこへ結び付けるかを選ぶ。 | 結果と因果的に関連する候補を更新対象として絞り込むため。 | 無関係な状態や行為が更新され、経験から誤った因果関係を学習する。 |
| 更新 | 帰属された状態や行為について、価値、予測、選択規則を変える。 | 得られた経験を次回以降の予測と行為選択へ反映するため。 | 結果を正しく評価・帰属できても、同じ状況で以前と同じ選択を繰り返す。 |
五つの処理は時間方向に連鎖する。行為が起きると、その行為に関係する履歴が保持される。同時に、その状態からどの結果が起こるかという予測が形成される。実際の結果が届くと、予測と現実が照合され、その結果を保持されているどの過去へ返すかが決まる。最後に、その帰属先の価値や予測、行為選択が更新される。
ここで未来の結果は、過去の意味を後から確定させる。行為した瞬間には、その行為が成功につながるのか、失敗につながるのか、結果とほとんど関係しないのかは確定していない。結果が到来すると、保持されていた過去の候補が「報酬につながった行為」「予測を修正すべき状態」「結果との関連が小さかった背景」へ振り分けられる。未来から得られた情報によって、過去の学習上の位置付けが変わる。
この構造では、履歴保持と未来予測にも役割の違いがある。履歴保持は「何が起きていたか」を結果到来時まで利用可能にする。一方、未来予測は「その状態から何が起こると期待していたか」を保持する。実際の結果はこの二つと照合されるため、同じ報酬が得られても、予測通りに得られた場合と予想外に得られた場合では更新内容が変わり得る。
学習をこのように見ると、時間構造とは単なる秒数の記録ではない。必要なのは、どの過去がまだ結果待ちの候補として残っているか、どの未来が予測されているか、実際の結果がどの候補へ帰属したかという関係である。1 秒という長さそのものより、その 1 秒の間に「行為から結果へ続く関係」が維持されていることが学習にとって重要になる。
この考え方から、実際の学習回路を調べるときに確認すべき条件も導ける。行為から結果まで何らかの内部状態が維持されるか、結果までの遅延を変えるとその状態の時間構造も変わるか、結果が予想通り到来した場合と省略された場合で活動が変わるか、さらにその状態へ介入すると学習結果そのものが変化するかである。これらが確認されれば、時間上の因果候補を管理する内部状態という考え方は具体的な神経回路へ接続できる。
5. この命題には反証できる条件がある
「学習には行為と結果の間を橋渡しする時間構造が必要である」という命題を神経回路へ適用するなら、どのような観測結果がこの命題を支持し、どのような結果が対応を弱めるかを先に定められる。観測後に都合のよい説明を選ぶのではなく、遅延学習に時間的な橋渡しが必要だという論理から、検証条件を事前に導くことができる。
第 4 章で整理した構造では、行為に関する履歴が保持され、未来の結果が予測され、実際の結果が確認され、その結果が過去の状態へ帰属され、最後に学習内容が更新される。この構造が実際の神経活動として現れるなら、少なくとも遅延期の活動、遅延時間への追従、結果省略への反応、運動からの分離、活動への介入効果、結果側の信号という六つの観点から検証できる。
| 確認事項 | 中心命題を支持する方向 | 中心命題との対応が弱くなる方向 | 検証している構造 |
|---|---|---|---|
| 遅延期の活動 | 行為後から結果到来まで、結果に関連する内部状態が持続する。 | 結果との時間関係を持つ持続活動が確認されず、行為時や結果時の瞬間的反応だけが現れる。 | 原因候補となる過去を結果到来まで利用可能にする履歴保持を検証する。 |
| 遅延時間の変更 | 結果までの時間を変えると、内部状態の持続時間や時間構造も対応して変化する。 | 遅延時間を変えても活動の時間構造が固定されたままになる。 | 活動が固定した運動系列ではなく、結果までの時間関係を表現しているかを検証する。 |
| 結果省略 | 予測された結果が到来した場合と省略された場合で、内部状態の終了や更新が変化する。 | 結果の有無にかかわらず、予定時刻だけで同じ活動が終了する。 | 内部状態が単純な経過時間だけでなく、結果確認まで含んでいるかを検証する。 |
| 運動との分離 | 身体運動や摂取動作を変えても、行為から結果までの時間関係に対応する活動が残る。 | 観測された活動の大部分が運動量、姿勢、固定した動作系列によって説明される。 | 時間的橋渡し候補の活動と、行動そのものを表す活動を分離する。 |
| 介入 | 遅延期の内部状態候補を妨害すると、結果への反応だけでなく学習成績そのものが変化する。 | 活動を大きく変化させても、学習速度や行為選択が維持される。 | 観測された活動が学習と相関するだけでなく、学習成立へ因果的に寄与するかを検証する。 |
| 結果側の信号 | 結果到来後の信号を操作すると、行為の強化やその後の学習が変化する。 | 結果側の信号を操作しても、行為選択や学習に変化が生じない。 | 結果確認から過去への帰属、更新へ進む教示信号としての役割を検証する。 |
六つの条件は互いに異なる代替説明を切り分ける。遅延期に活動が存在するだけなら、単なる持続的な覚醒や運動準備でも説明できる。遅延時間を変更したときに活動時間も変化すれば、結果までの時間との対応が加わる。さらに結果を省略したときに活動の終了条件が変われば、単純な内部時計よりも「期待した結果を待つ状態」という解釈が強くなる。
運動との分離は、時間表現を検討するうえで別の役割を持つ。たとえば報酬を得るときに特定の身体運動が毎回生じるなら、その運動と神経活動が同時に変化するだけでも結果までの時間に対応しているように見える。身体運動や摂取動作を変えても同じ時間関係が残ることを確認すれば、運動系列による説明範囲を狭められる。
ここまでの観測は活動と学習の対応関係を示す。一方、因果的な役割を確かめるには介入が必要になる。結果まで維持される活動を選択的に妨害したとき、学習速度や行為選択まで変化するなら、その活動は単に学習と並行して生じている状態より、学習過程の一部として位置付けやすくなる。結果到来後の信号についても同様で、その信号を操作することで過去の行為が強化されるなら、結果を学習更新へ変換する教示側の機能が支持される。
このように、単一の観測だけで中心命題を評価する必要はない。遅延期活動、時間伸縮、結果省略、運動との分離、介入効果、結果側の強化作用という異なる検証を重ねることで、「行為と結果の間を橋渡しする時間構造」という説明と、単純な運動活動、固定時間の計測、覚醒状態などの代替説明を比較できる。
ここまでの検証条件は、特定の脳部位や個別研究の結果から逆算したものではない。遅延した結果から学習するには、過去を結果到来まで利用可能にし、実際の結果と照合し、その結果を更新対象へ帰属させる必要があるという論理から導かれる。次に、この構造が既存の学習理論や神経回路研究の中ですでにどのような形で現れているかを照合する。
6. 既存理論も時間の橋渡しを必要としてきた
第 5 章までに置いた「過去を結果到来まで利用可能にし、未来の結果によって更新する」という構造は、特定の学習モデルだけに現れるものではない。神経科学と強化学習をたどると、時間尺度や実装は異なっていても、離れた出来事を結び付けるための仕組みが複数の階層で研究されてきた。
まず、脳が情報を統合する時間幅そのものが領域ごとに異なる。Hasson らは、大脳皮質に短い変化へ応答する領域から、より長い文脈を統合する領域まで、階層的な時間受容窓が存在することを示した[3]。短時間の感覚変化を処理する場合と、数秒以上にわたる文脈を使って状態を判断する場合では、現在の計算へ残しておく過去の長さが異なる。時間幅は一律に与えられるのではなく、処理対象に応じて変わる。
記憶系では、MacDonald らが海馬の time cells を報告している[4]。これらの細胞は、二つの出来事の間にある空白期間で異なる時点を順番に表現し、主要な時間条件を変更すると活動系列も組み替わった。外から見れば同じ「待っている時間」であっても、神経系の内部では複数の状態へ分解され、時間の進行に応じて異なる細胞集団が活動する。離れた出来事を結び付けるには、空白期間そのものを内部状態の系列として表現できる。
さらに短い時間尺度では、シナプス可塑性に eligibility trace という考え方がある。先行する神経活動がシナプスへ一時的な痕跡を残し、その痕跡が残っている間に報酬や驚きなどの第 3 の信号が到来すると、結合強度が変化する。Gerstner らは、この三因子学習則を、ミリ秒単位の神経活動と秒単位の行動結果を橋渡しする仕組みとして整理している[5]。
この考え方には実験的な対応もある。Yagishita らは線条体で、グルタミン酸入力からおよそ 0.3~2 秒後にドーパミンが到来した場合に、樹状突起スパインの構造可塑性が促進されることを示した[6]。先行する入力の痕跡が残っている時間窓にドーパミンが重なることで、その入力が更新対象になる。同じドーパミン信号でも、到来時刻が変われば先行入力との対応関係が変わり、学習への作用も変化する。
| 階層 | 時間を橋渡しする仕組み | 橋渡しされる対象 | 本稿の中心命題との対応 |
|---|---|---|---|
| 大脳皮質 | 領域ごとに異なる時間受容窓で過去の入力を統合する。 | 短い感覚変化から長い文脈までを現在の処理へ残す。 | 処理目的に応じて、利用可能な過去の時間幅が変わる。 |
| 海馬 | time cells が空白期間を異なる内部状態の系列として表現する。 | 時間的に離れた出来事の間を内部状態でつなぐ。 | 結果までの時間を均一な空白ではなく、状態遷移として保持できる。 |
| シナプス | eligibility trace が先行入力の更新可能性を一時的に保持する。 | 先行する神経活動と後から届く調節信号を結び付ける。 | 未来の結果を過去の入力へ帰属させる時間窓を作る。 |
| 線条体 | 先行入力とドーパミン到来の時間関係によって可塑性が変化する。 | 行為に関連する入力と後から得られる報酬信号を対応付ける。 | 結果の価値だけでなく、結果がいつ届いたかが更新対象を決める。 |
| 強化学習 | temporal-difference learning が連続する時点の予測差を利用する。 | 将来の結果を途中の状態へ段階的に伝播させる。 | 未来の価値を時間方向にさかのぼって現在の予測へ反映する。 |
| ドーパミン系 | reward prediction error が期待と実際の結果との差を表す。 | 予測された報酬と実際に得られた報酬を比較する。 | 結果確認によって既存の予測を更新する信号になる。 |
計算論では、Sutton の temporal-difference learning が別の形で同じ問題を扱う[7]。最終結果が得られるまで待ってから過去のすべてを一括更新する代わりに、連続する時点の予測値の差を用いて学習を進める。ある時点で得られた新しい予測が、その一つ前の時点の予測を修正し、その修正がさらに前の状態へ伝わる。未来の結果に関する情報を時間方向へ段階的に戻すことで、結果から離れた状態も学習対象になる。
Schultz、Dayan、Montague は、この計算構造と中脳ドーパミン活動との対応を示し、期待された報酬と実際の結果との差を reward prediction error として捉えた[8]。学習初期には予想外の報酬へ強く反応していたドーパミンニューロンが、学習後には報酬を予告する刺激へ応答するようになる。結果だけに反応しているのではなく、未来の報酬に関する予測が前方の状態へ移っていることを示す。
報酬の「いつ」も予測対象になる。Hollerman と Schultz は、予定とは異なる時刻に報酬が現れた場合や、予定時刻に報酬が現れなかった場合にドーパミン活動が変化することを示した[9]。Fiorillo らも、報酬が到来する時刻の不確実性に応じてドーパミン活動の時間的な分布が変わることを報告している[10]。学習されるのは報酬の有無や大きさだけでなく、その結果がいつ到来すると期待されるかという時間関係でもある。
ここまでの研究を並べると、時間的な橋渡しには一つの実装だけがあるわけではないことが分かる。皮質では異なる時間幅の統合、海馬では時間系列の表現、シナプスでは更新可能性の痕跡、強化学習では時点間の予測差、ドーパミン系では予測と結果の差として現れる。それぞれの仕組みは異なる階層を扱いながら、「現在の瞬間だけでは遅延した結果を学習できない」という同じ制約へ応答している。
この共通構造から次の問いが生じる。運動制御で遅延した結果を扱うことで知られてきた小脳にも、同様に過去と未来をつなぐ時間表現が存在するのか。小脳研究をたどると、この問いは報酬学習より前から、感覚フィードバックの遅れを予測によって補う問題として扱われてきた。
7. 小脳は遅延を扱う回路として研究されてきた
小脳研究では、現在の感覚入力だけでは行為を十分に制御できないという問題が以前から扱われてきた。身体を動かすと、その結果を表す視覚、固有感覚、触覚などの感覚情報が脳へ戻るまでに時間がかかる。高速な運動では、この遅延がそのまま制御遅延になる。感覚フィードバックを受け取ってから補正を計算した時点では、身体はすでに次の状態へ移っているためである。
この制約に対する代表的な考え方が、小脳による内部モデルである。Wolpert、Miall、Kawato は、運動指令のコピーと現在の身体状態から、これから生じる感覚結果を予測する forward model を整理した[11]。実際の感覚結果が返る前に次の身体状態を見積もることで、遅延したフィードバックだけに依存する場合より早く制御を進められる。
ここで予測されるのは、抽象的な「未来」ではなく、特定の運動指令によってどの身体状態が生じるかという対応関係である。予測した結果と実際に返ってきた感覚結果を比較すれば、内部モデルの誤差も評価できる。運動を繰り返すうちに予測が修正されれば、次回には実際の結果が届く前から、より適切な運動指令を生成できる。
この構造には、第 4 章までに整理した遅延学習との共通点がある。行為が先に起こり、その結果が後から届き、両者の対応関係を使って内部状態が更新される。運動制御では、この時間差を埋めるために結果予測が使われる。遅延報酬の学習でも、行為と後から得られる結果を結び付けるには、結果到来まで何らかの内部状態を維持する必要がある。扱う対象は異なるが、「現在の入力だけでは足りず、未来の結果を予測し、実結果によって更新する」という計算上の制約は共通している。
| 段階 | 小脳回路で扱われる情報 | 遅延への役割 | 学習との関係 |
|---|---|---|---|
| 運動指令 | 現在の身体状態と、実行しようとする運動に関する情報を使う。 | 結果が返る前に、予測計算を開始する起点になる。 | どの行為に対する結果を学習するかという原因側の情報になる。 |
| 結果予測 | 運動指令から、これから生じる身体状態や感覚結果を見積もる。 | 実際の感覚フィードバックが届くまでの遅延を予測で補う。 | 後から届く結果と比較するための内部状態を形成する。 |
| 結果確認 | 予測した結果と、実際に返ってきた感覚結果を比較する。 | 遅れて到来した実結果を、先行する予測へ対応付ける。 | どの予測が合っていたかを判定し、更新方向を決める。 |
| モデル更新 | 予測と実結果との差を使って内部モデルを修正する。 | 次回は結果到来前から、より適切な状態を予測できるようにする。 | 行為と遅延した結果の対応関係を経験に応じて変化させる。 |
小脳の内部モデルという考え方は、その後、認知機能へも広げられてきた。Ito は、大脳皮質内で形成される心的活動についても、小脳が内部モデルを作り、その予測と修正に関与する可能性を論じた[12]。Strick、Dum、Fiez は解剖学的・機能的知見を整理し、小脳が一次運動野などの運動領域に加えて、前頭前野を含む非運動領域とも閉ループを構成することを示した[13]。小脳回路の基本構造が運動以外の大脳領域とも接続するなら、予測と結果の比較という計算を異なる情報へ適用できる可能性がある。
Sokolov、Miall、Ivry は、この流れを適応的予測という観点から整理し、小脳が運動と認知の双方で、現在の状態から次に生じる結果を予測し、その誤差を使って内部モデルを更新するという共通原理を持つ可能性を提示している[14]。ここで共通するのは処理内容ではなく計算構造である。身体運動、知覚、認知では入力も出力も異なるが、現在の状態から結果を予測し、実際の結果との差によって次の予測を修正するという循環は共有できる。
既稿「クオリアは脳だけでは説明できない」でも、大脳皮質だけで閉じた系を想定せず、小脳、脳幹、身体、感覚入力を含む循環の中で知覚と行為を捉えた[15]。そこで小脳は、行為によって生じる結果を予測し、身体から戻る感覚情報との差を調整する回路として位置付けられていた。この構図では、知覚も行為も、一方向の情報処理ではなく、予測、実行、結果確認、更新が循環する過程として扱われる。
小脳が扱う時間は、運動結果の遅延だけに限られるとは考えられていない。Narain らは、人が時間間隔を推定するとき、過去に経験した時間間隔の分布へ推定値が引き寄せられる現象に注目し、小脳回路がその事前分布を学習できる計算モデルを示した[16]。このモデルでは、経験した時間間隔の統計が小脳回路の結合へ反映され、未知の時間間隔を推定するときの予測へ利用される。
この結果を踏まえると、小脳の時間処理を固定した秒数を刻む時計として捉えるより、経験から「どの時点に結果が起こりやすいか」という時間構造を学習する回路として見る方が広い現象を説明できる。運動では行為から感覚結果までの遅延を予測し、時間推定では過去に経験した時間分布から次の間隔を予測する。どちらも、現在の入力に過去の経験を加え、未来の結果を先回りして表現する。
この研究史から見ると、遅延報酬の問題を小脳へ接続することは、運動制御から切り離された別の問題を持ち込むことではない。小脳ではすでに、行為と遅れて届く結果を予測でつなぎ、実結果との差を使って内部モデルを更新するという計算が研究されてきた。次に確認すべきなのは、その時間的な橋渡しが感覚運動結果だけでなく、報酬の予測と学習にも現れるかという点である。
8. 小脳には予測誤差と報酬期待がすでに観測されていた
小脳と報酬学習の接点は、2026 年の研究で突然現れたものではない。2010 年代には、登上線維と顆粒細胞の双方で、予測、結果到来、結果省略に対応する活動が段階的に報告されていた。これらを時間軸に並べると、小脳回路の中に「結果を予測する側」と「予測と実結果の差を伝える側」が存在する可能性が見えてくる。
まず 2015 年、Ohmae と Medina は、マウスの瞬目条件付けで登上線維活動を記録した[17]。瞬目条件付けでは、特定の手掛かりの後に眼へ刺激を与えることを繰り返すと、動物は刺激が来る前に瞬きを起こすようになる。この課題では、刺激がいつ来るかという予測と、実際に刺激が来たかという結果の両方を操作できる。
登上線維は、予期していなかった刺激が到来したときに活動しただけでなく、来ると予測されていた刺激が省略された場合にも活動を変化させた[17]。つまり、登上線維が伝える情報には刺激そのものの到来だけでなく、「予測していた結果と実際の結果が一致したか」という関係が含まれる。小脳学習で古くから教示信号として扱われてきた登上線維に、時間差分型の予測誤差と対応する活動が観察されたことになる。
次に 2017 年、Wagner らは小脳顆粒細胞を二光子カルシウムイメージングで観察し、報酬に関連する複数の活動パターンを報告した[18]。顆粒細胞には、実際の報酬到来へ反応する細胞だけでなく、報酬が来る前から活動する細胞や、予期した報酬が省略されたときに活動が変化する細胞が存在した。
この結果は、小脳顆粒細胞が現在の感覚入力や身体運動だけを表現しているという理解を拡張した。報酬がまだ到来していない時点で活動が生じるなら、その活動には将来の結果へ関係する内部状態が含まれる。さらに報酬省略への反応があるなら、実際の結果と、それ以前に形成されていた期待との比較も小脳回路へ入力されていることになる。
2019 年には Kostadinov らが、プルキンエ細胞へ入る登上線維入力を観察し、報酬の予測、実際の報酬到来、予期した報酬の省略に対応する信号を報告した[19]。登上線維側でも、単純な結果到来より広い時間構造が表現されていた。
| 研究 | 主な観察対象 | 観測された情報 | 時間的な役割 |
|---|---|---|---|
| Ohmae と Medina 2015 | 瞬目条件付け中の登上線維 | 予期しない刺激の到来と、予期した刺激の省略に対応する活動が観察された。 | 予測された結果と実際の結果との差を教示する信号候補になる。 |
| Wagner ら 2017 | 小脳顆粒細胞 | 報酬期待、報酬到来、報酬省略へ関連する活動が観察された。 | 結果到来前から将来の報酬へ関係する状態を表現する候補になる。 |
| Kostadinov ら 2019 | プルキンエ細胞へ入る登上線維入力 | 報酬の予測、到来、省略に対応する信号が観察された。 | 期待と実結果を比較し、学習更新へ伝える教示側の役割を支持する。 |
三つの研究を並べると、顆粒細胞と登上線維に異なる時間的位置を割り当てられる可能性が見えてくる。顆粒細胞には結果到来前の期待に関連する活動があり、登上線維には予測された結果と実際の結果との関係を伝える活動がある。この組み合わせは、第 4 章で置いた「履歴保持と未来予測 → 結果確認 → 過去への帰属 → 更新」という構造と対応する。
ただし、この段階では二つの問題が残る。第一に、報酬関連活動と運動を分離する必要がある。水や食物を報酬に使う課題では、報酬到来と同時に舐める、口を動かす、飲み込むといった摂取運動が生じる。小脳は運動制御へ深く関与するため、報酬の前後で観察された活動の一部が、報酬期待よりも身体運動を反映している可能性がある。
第二に、観測された活動が学習に因果的に寄与するかを確認する必要がある。ある神経活動が報酬期待と同時に現れていても、その活動が学習に必要だとは限らない。学習の結果として生じる活動、覚醒や動機づけに伴う活動、行動を実行するための活動も同じ時間帯に現れ得る。学習機構の一部として位置付けるには、その活動へ介入したときに学習速度や行為選択そのものが変わることを確かめる必要がある。
この二つの問題を整理すると、第 5 章で先に置いた検証条件へそのまま戻れる。報酬までの遅延時間を変えると神経活動の時間構造も変わるか、予期した結果を省略すると活動の終了条件が変わるか、摂取運動を取り除いても同じ活動が残るか、さらにその活動を妨害すると学習自体が変化するかを調べればよい。
ここまでの研究史によって、小脳に報酬関連信号が存在すること自体はすでに示されていた。次に必要になるのは、それらの信号が行為から遅延した報酬までを実際に橋渡ししているかを、時間操作、運動との分離、因果介入を組み合わせて検証することである。
9. 報酬から摂取運動を外して仮説を照合する
2026 年 9 月 16 日、Benjamin A. Filio らは Nature Neuroscience に「Predictive and instructive cerebellar encoding of dopamine reward drives motivated behavior」を報告した[20]。この研究では、小脳に報酬関連活動が存在することを確認するだけでなく、第 8 章まで残っていた二つの問題、すなわち報酬と摂取運動の分離、そして観測された神経活動が学習へ因果的に寄与するかという問題を実験的に扱っている。
通常、水や食物を報酬として与えると、報酬の到来と同時に舐める、噛む、飲み込むといった摂取運動が生じる。小脳はこれらの運動制御にも関与するため、報酬前後の神経活動が「報酬を予測している」のか、「これから起こる摂取運動を準備している」のかを切り分けにくい。Filio らは、この交絡を避けるため、マウスが自ら行為することで脳内の報酬系を直接刺激する課題を用いた[20]。
マウスにはハンドルを押す行動を学習させ、成功した行為から一定時間後に報酬を与えた。報酬には、腹側被蓋野のドーパミンニューロンへの光遺伝学的刺激と、内側前脳束への電気刺激が使われた[20]。これらは水を受け取って飲むという摂取過程を伴わず、マウス自身の行為によって強化効果を得られる。そのため、行為、遅延時間、報酬到来という三つの要素を保ったまま、摂取運動という主要な交絡要因を外せる。
第 5 章で置いた仮説にとって特に重要なのが、ハンドル操作から報酬までの遅延を 1 秒と 2 秒に変更した実験である。もし顆粒細胞活動がハンドルを押した後に生じる固定した運動反応や覚醒状態を反映しているだけなら、報酬時刻を 1 秒から 2 秒へ変更しても、その活動時間まで同じ比率で変化する必然性はない。反対に、活動が「結果が到来するまでの状態」を表しているなら、予測される報酬時刻に合わせて活動時間も変化すると予想できる。
実際、小脳顆粒細胞の多くは報酬到来前に持続的な活動を示し、その時間構造は報酬遅延に合わせて変化した。1 秒後に報酬が来る条件では約 1 秒の区間を、2 秒後に報酬が来る条件では約 2 秒の区間を覆うように活動が「伸びた」[20]。単に同じ活動が長く残ったというより、学習された行為と予測された報酬時刻の関係に合わせて、集団活動の時間表現が再構成された。
この結果は、第 5 章で事前に置いた「結果までの遅延時間を変えれば、橋渡し候補となる内部状態の時間構造も変化する」という予測に対応する。1 秒という絶対時間を固定的に刻んでいたなら、2 秒条件への変更に合わせて活動全体が伸縮する説明は難しくなる。観測されたのは、学習した報酬時刻に応じて時間表現が変わる活動である。
報酬省略の実験は、この解釈をさらに絞り込む。予定された報酬時刻だけを内部時計で数えているなら、報酬が実際に到来したかどうかにかかわらず、同じ時刻で活動が終了すると予想される。Filio らが報酬を省略すると、顆粒細胞活動は通常の報酬到来時とは異なる持続を示した[20]。活動の終了条件には予定時刻だけでなく、実際に結果を受け取ったかという情報も関係していた。
この違いは、第 4 章で整理した「未来予測」と「結果確認」を分けるうえで重要である。予測された時刻まで活動するだけなら、時間経過を表す内部状態として説明できる。予測時刻を過ぎても実結果の有無によって状態が変化するなら、その活動は「いつ報酬が来るはずか」という予測と、「実際に報酬が来たか」という確認の双方に関係していることになる。
さらに Filio らは、同じマウスで水報酬とドーパミン報酬を比較した。顆粒細胞集団には、摂取運動を伴う水報酬と、脳内へ直接与えられるドーパミン報酬の双方に対応する予測活動が確認された[20]。特定の報酬形式が完全に同一の神経表現を持つという意味ではないが、少なくとも顆粒細胞の予測活動全体を舐める、飲み込むといった摂取運動だけで説明することは難しくなる。
| 事前に置いた確認条件 | Filio らの観測 | 代替説明との関係 | 中心命題との対応 |
|---|---|---|---|
| 行為後から結果まで内部状態が持続する | 多くの顆粒細胞が報酬前の遅延期に持続的な活動を示した。 | 行為時や報酬時だけに生じる瞬間的な反応では説明しにくい。 | 行為と結果の間を埋める内部状態候補になる。 |
| 遅延時間を変えると時間構造も変わる | 1 秒と 2 秒の遅延に合わせて顆粒細胞の活動時間が伸縮した。 | 固定した長さの運動反応や覚醒状態だけによる説明を弱める。 | 内部状態が結果までの時間関係を表現していることと整合する。 |
| 結果省略で状態終了が変わる | 報酬省略時には通常の報酬到来時とは異なる活動持続が観察された。 | 予定時刻だけを機械的に計測する内部時計による説明を弱める。 | 内部状態が結果の確認まで含んでいることと整合する。 |
| 摂取運動を外しても表現が残る | 脳内ドーパミン報酬でも予測的な顆粒細胞活動が確認された。 | 水を舐める、飲み込むといった摂取運動だけによる説明を弱める。 | 特定の運動を越えて報酬予測に関係する内部状態候補になる。 |
ここまでの結果を組み合わせると、単に「小脳顆粒細胞が報酬に反応した」という説明より具体的な構造が得られる。行為が起きた後、顆粒細胞集団には将来の報酬時刻まで続く活動が形成される。その時間構造は学習された遅延時間に合わせて変化し、実際の結果が到来したかどうかによって終了の仕方も変わる。さらに、この活動は水を飲むという特定の運動から切り離した条件でも観察される。
この結果は、第 5 章までに独立して導いた検証条件の複数と一致する。一方、ここから直ちに「小脳が遅延報酬学習の全体を実装している」と一般化することはできない。確認されたのは、マウス小脳の顆粒細胞集団に、行為と遅延した報酬の間を橋渡しする内部状態として解釈できる時間表現が存在し、その時間表現が報酬時刻と実結果の双方に対応して変化したことである。
残る条件は因果性である。顆粒細胞活動が遅延報酬と高い対応を示していても、その活動が学習成立に必要かは観察だけでは決まらない。また、結果が到来した側で、どの信号がこの予測状態を学習更新へ変換するかも確かめる必要がある。Filio らは、顆粒細胞と登上線維の双方へ介入することで、この二つの条件も検証している。
10. 予測する顆粒細胞と結果を教える登上線維が時間方向で分業する
顆粒細胞と登上線維の活動を同じ時間軸へ置くと、小脳内で異なる役割が分担されている可能性が見えてくる。顆粒細胞はハンドル操作の後から報酬到来までの遅延期に活動し、その持続時間は予測された報酬時刻に合わせて変化した。一方、多くの登上線維は、ドーパミン報酬が実際に到来した直後に活動した[20]。一方が結果到来前の区間を表現し、もう一方が結果到来後に強く活動するという時間的な分離が生じている。
この配置は、第 4 章で整理した「履歴保持 → 未来予測 → 結果確認 → 過去への帰属 → 更新」という構造へ対応させて考えられる。顆粒細胞集団は、行為が起きた後も結果が確定するまで時間依存の内部状態を維持する。報酬が到来すると、登上線維側から結果に対応する信号が入る。この二つが同じ小脳回路内で組み合わされれば、先行する行為に関連した状態と、後から届いた結果を時間的に結び付けられる。
| 回路要素 | 主に活動する時点 | Filio らの観測 | 学習構造として考えられる役割 |
|---|---|---|---|
| 顆粒細胞 | 行為後から報酬到来前 | 報酬までの遅延期に持続的に活動し、1 秒と 2 秒の報酬遅延に合わせて時間構造が変化した。 | 行為に関係する状態を結果到来まで維持し、後から届く結果と対応付ける時間表現の候補になる。 |
| 登上線維 | 報酬到来直後 | 多くの登上線維がドーパミン報酬の直後に活動した。 | 予測状態に対して実際の結果が到来したことを伝える教示信号の候補になる。 |
| 両者の組み合わせ | 行為から結果到来後まで | 結果前の顆粒細胞活動と結果後の登上線維活動が時間方向に分かれて観察された。 | 時間的に離れた行為と結果を一つの学習過程へ接続する回路構造として解釈できる。 |
顆粒細胞活動は、シナプス可塑性の理論でいう eligibility trace と時間構造上、似た位置を占める。ただし、Filio らの実験から顆粒細胞活動そのものを eligibility trace と同定できるわけではない。eligibility trace は、先行した活動によって特定のシナプスを一時的に更新可能な状態へ置く概念である。今回直接観測されたのは、行為から報酬まで持続する顆粒細胞集団の時間表現であり、その表現が後から届く教示信号と結び付く可能性である。
この時間表現が学習に実際に必要なら、遅延期の顆粒細胞活動を妨害したときに行動学習も変化するはずである。Filio らは、訓練中の遅延期に小脳顆粒細胞の活動を継続的に抑制した。その結果、マウスがハンドルを押してドーパミン報酬を得る自己刺激課題の学習が低下した[20]。報酬そのものを取り除いたのではなく、行為から報酬までの橋渡し候補となる活動へ介入したことで学習成績が変化した。
この介入は、第 5 章で置いた因果条件と対応する。遅延期活動が学習とは無関係な随伴活動であれば、それを抑制しても報酬に基づく行為獲得は維持される可能性がある。実際には学習が低下したため、顆粒細胞の遅延期活動は、報酬を予測していることと相関するだけでなく、遅延した結果から行為を学ぶ過程へ寄与していると考えられる。
Filio らは、結果側の信号についても逆方向から介入した。登上線維への刺激そのものを結果として与えると、それまで訓練されていなかったマウスもハンドル押しを獲得した[20]。その強化効果は水報酬やドーパミン系への直接刺激より弱かったものの、登上線維活動だけでも直前の行為を将来増加させる方向へ学習を変えられることになる。
ここで重要なのは、登上線維が単に報酬到来を検出しているという相関だけではない。登上線維を人工的に活動させることで、その直前に行われたハンドル押しが強化された。結果側の小脳信号が、その前の行為を強化する教示作用を持つことを示す因果的な証拠である。
顆粒細胞への抑制と登上線維への刺激は、反対方向から同じ学習構造を検証している。顆粒細胞側では、結果到来まで維持される予測状態を弱めると学習が低下した。登上線維側では、結果に相当する教示信号を人工的に与えると行為が強化された。一方は行為から結果までの橋を担い、もう一方はその橋の終端で学習更新を促すという分業と整合する。
この構図によって、「小脳に報酬信号がある」という説明は、より具体的な時間構造へ分解される。顆粒細胞集団は報酬到来前に予測的な状態を形成し、登上線維は結果到来後に教示的な信号を供給する。行為と報酬の間に時間差があっても、二つの入力系が異なる時点を担当することで、過去の行為と未来の結果を一つの学習過程として接続できる。
ただし、この分業を小脳だけで完結する報酬学習機構とみなす範囲を越える。報酬予測、価値計算、行為選択にはドーパミン系、線条体、大脳皮質、海馬など複数の回路が関与する。Filio らの結果が示すのは、その分散した学習系の中で、小脳もまた遅延した結果を時間的に結び付ける役割を担い得るという点である。
11. 同じ学習問題を複数の回路が異なる時間尺度で扱う
Filio らの結果から、小脳だけで報酬学習全体を説明する必要はない。報酬の予測、価値の更新、行為選択には、中脳ドーパミン系、線条体、大脳皮質、海馬など複数の回路が関与する。O’Doherty らはヒトの強化学習課題で、腹側線条体や眼窩前頭皮質の活動が temporal-difference learning から導かれる信号と対応することを報告している[21]。ドーパミン系と線条体系には、予測された報酬と実際の結果との差を価値更新へ使う回路として多くの研究蓄積がある。
ここで小脳研究が加えるのは、同じ報酬情報を別の場所でも表現しているという事実だけではない。「遅延した結果を、どの過去の状態や行為へ返すか」という共通の計算問題に、異なる回路がそれぞれの時間尺度と内部表現を使って関与する可能性である。価値を計算する回路、時間的な文脈を保持する回路、行為から結果までの予測状態を形成する回路が分担すれば、一つの回路だけで長い履歴全体を保持する必要はなくなる。
| 回路・領域 | 主に扱う情報 | 時間的な役割 | 遅延学習との関係 |
|---|---|---|---|
| ドーパミン系 | 予測された報酬と実際の結果との差に関係する信号を扱う。 | 結果到来時に予測の修正方向を示す。 | 結果を価値更新へ変換する教示信号の主要な候補になる。 |
| 腹側線条体 | 状態や行為と報酬価値との対応を扱う。 | 経験に基づいて将来の価値予測を更新する。 | どの選択を今後増減させるかという行為価値の学習に関与する。 |
| 海馬 | 出来事の順序や時間的文脈を含む状態表現を扱う。 | 離れた出来事の間にある履歴を内部状態として保持する。 | 結果を過去の文脈へ帰属させるための時間情報を供給できる。 |
| 小脳 | 行為から予測された結果までの時間関係や結果到来に関係する信号を扱う。 | 少なくとも Filio らの実験では、秒単位の遅延区間に対応する予測状態が観察された。 | 行為と遅延した結果を時間方向に結び付ける回路候補になる。 |
この整理では、複数の回路が同一の計算式を重複して実装していると考える必要はない。たとえば線条体が行為価値を更新し、海馬がより長い時間文脈を保持し、Filio らの実験で観察されたように小脳顆粒細胞が秒単位の遅延区間に対応する活動を形成するなら、それぞれが異なる情報を同じ学習問題へ供給できる。重要になるのは、どの回路が「報酬」を持っているかではなく、各回路が結果を過去へ返す過程のどの部分を担当しているかである。
ヒト小脳でも、強化学習信号が時間条件に依存することが報告されている。Trach、Ou、McDougle は、単純な感覚運動対応による説明を抑えた強化学習課題を用い、小脳 Crus I/II に報酬処理と報酬予測誤差に関連する活動を観察した[22]。さらに、選択からフィードバックまでの時間を延ばすと、小脳で検出される強化学習信号は秒を超える遅延に対して弱くなった。一方、同じ課題で腹側線条体や海馬には同じ形の遅延依存性が確認されなかった。
この差は、複数の回路が異なる時間幅を担当するという見方と整合する。Filio らと Trach らの結果を合わせると、小脳の強化学習信号は比較的短い行為と結果の時間関係に敏感である可能性がある。海馬や線条体が別の時間幅や情報形式を扱うなら、同じフィードバック遅延でも回路ごとの影響は異なる。結果が遅れるほどすべての学習信号が一様に弱くなるのではなく、回路ごとに利用できる時間窓が異なる可能性がある。
Filio らのマウス実験と Trach らのヒト実験は、そのまま一対一に対応するものではない。前者では顆粒細胞や登上線維の活動を細胞・回路水準で測定し、1 秒と 2 秒の報酬遅延や因果介入を扱っている。後者ではヒト fMRI により Crus I/II の集団活動を測定し、選択からフィードバックまでの時間を操作している。対象種、課題、測定法、空間分解能、時間分解能が異なるため、「同じ小脳機構を観察した」とまでは言えない。
それでも、両者は一つの共通した制約を示している。マウスでは、顆粒細胞の活動時間が 1 秒と 2 秒の報酬遅延に応じて伸縮した。ヒトでは、フィードバックが遅くなると小脳の強化学習信号が弱くなった。小脳における報酬学習信号が、結果の価値だけでなく「いつ結果が届くか」という時間条件に敏感である点では一致している。
ここで「予測誤差」という語の扱いにも注意が必要になる。同じ名称が使われても、理論ごとに予測対象と更新対象は異なる。temporal-difference learning における reward prediction error は、将来得られる報酬価値の予測と実際に得られた情報との差を使って価値を更新する。一方、Friston の自由エネルギー原理では、感覚入力を生成する内部モデルと実際の入力との差をより広い枠組みで扱い、知覚、行為、学習を統合的に説明する[23]。
共通しているのは「予測した状態と実際の結果との差によって内部状態を更新する」という上位構造であり、何を予測し、どの誤差を、どの変数の更新へ使うかは理論ごとに異なる。この区別を保つことで、小脳、ドーパミン系、線条体、海馬をすべて同じ「予測誤差回路」としてまとめることを避けながら、それぞれが時間的な学習へどう寄与するかを比較できる。
既稿「AI は『次の単語を予測しているだけ』なのか」でも、外から見える予測課題と、その予測を成立させる内部状態を分けて考えた[24]。ある系が次の結果を予測できるという事実だけでは、その内部で何を保持し、どの時間幅を統合し、どの誤差で更新しているかは決まらない。生物の神経回路と生成 AI は実装も学習則も異なるが、「履歴から内部状態を形成し、その状態から未来を予測し、実際の結果によって内部状態を更新する」という計算上の分解は共通して適用できる。
報酬学習をこの視点から見ると、一つの「報酬中枢」を探すより、複数の回路が異なる時間幅と情報形式を分担しながら、未来の結果を過去の行為へ返していると考える方が観測結果を整理しやすい。学習を成立させているのは一つの信号ではなく、履歴、予測、結果、価値、時間を異なる回路が受け持ち、それらが結果到来時に接続される分散した時間構造である。
12. 学習とは因果関係を成立させる時間構造の更新である
最初の問いへ戻る。未来に起きた結果は、なぜ過去の行為を変えられるのか。
そのためには、結果が到来した時点でも、原因候補となる過去が学習系の内部で利用可能である必要がある。行為が起きた瞬間、その行為が成功につながるのか、失敗につながるのか、結果とほとんど関係しないのかはまだ確定していない。行為に関係する内部状態が結果到来まで維持され、実際の結果と照合されることで、初めてその過去をどのように更新するかが決まる。
このとき未来の結果は、すでに起きた出来事そのものを書き換えるわけではない。変わるのは、その出来事が次の予測や行為選択においてどのような意味を持つかである。同じハンドル操作でも、後から報酬が得られれば「繰り返す価値のある行為」として更新され、予測した報酬が来なければ「予測を修正すべき行為」として更新される。未来の結果によって、過去の出来事の学習上の位置付けが決まる。
| 時間上の段階 | その時点で利用可能な情報 | 結果によって追加される情報 | 学習によって変わるもの |
|---|---|---|---|
| 行為直後 | どの状態で、どの行為が実行されたかが分かっている。 | その行為がどの結果につながるかはまだ確定していない。 | 行為に関係する状態が、結果待ちの候補として保持される。 |
| 遅延期 | 行為から時間が経過し、結果に関する予測が維持されている。 | 結果の内容と実際の到来時刻はまだ確定していない。 | どの過去を結果へ結び付ける可能性があるかという時間構造が維持される。 |
| 結果到来 | 実際に何が起き、いつ起きたかが確定する。 | 予測と結果との差、結果の価値、到来時刻が利用可能になる。 | 保持されていた過去の候補が、結果との関係に応じて再分類される。 |
| 学習後 | 過去の行為と結果の対応関係が更新されている。 | 更新された関係を、次に同じ状態が現れたときに利用できる。 | 価値に加えて、どの状態や行為がどの結果を予告するかという関係が変わる。 |
既稿「意味は差異の読み取りから生まれる」では、予測と結果の差が記録、解釈、反応、更新へつながる構造を扱った[25]。報酬学習でも、更新を引き起こす情報は報酬の絶対量だけに限定されない。期待した時刻に報酬が来た、予想より早く来た、遅れて来た、予定されていたのに来なかったという差異も、内部状態をどのように修正するかを決める情報になる。
この時間差には、価値とは別の情報が含まれている。期待通りの時刻に報酬が来れば、その結果まで維持されていた時間構造は有効だったと評価できる。報酬が予定より遅れれば、結果へつながる内部状態をより長く維持する必要が生じる。報酬が省略されれば、それまで結果を予告していた状態と実際の結果との対応関係を修正する必要がある。学習されるのは「どの結果が良いか」と同時に、「どの状態から、どの程度の時間を経て、その結果が生じるか」という関係でもある。
既稿「なぜ世界は意味を持つのか」では、外界の差異が主体の記憶、予測、価値、行為可能性と結び付くことで意味を持つと整理した[26]。この観点から見ると、報酬学習によって意味を獲得するのは報酬そのものだけではない。報酬へ至る手掛かり、行為、その後の待機時間、結果が来ると予測される時点まで、一連の時間区間が次の行為を導く情報へ変わる。
たとえば学習前の 2 秒間は、単に何も起きていない待機時間に見える。しかし、ある行為の 2 秒後に繰り返し報酬が得られるようになると、その 2 秒間は「結果へ向かっている状態」として機能するようになる。Filio らの実験で顆粒細胞活動が 1 秒条件から 2 秒条件へ伸縮したことは、このような時間区間が神経活動の側でも学習された結果時刻に合わせて再構成され得ることを示している[20]。
既稿「人間と環世界」では、主体が検出し、意味付けし、行為へ利用できる差異によって、その主体にとっての環世界が構成されると考えた[27]。学習前には中立だった刺激や時間区間が、学習後には未来の結果を予告する状態へ変わる。物理的な環境が同じでも、主体がそこから読み取る因果関係が変われば、次に選択される行為も変わる。
この変化を強化学習の観点から見ると、更新対象は単独の行為価値だけに限定されない。ある状態がどの未来を予告するか、どの行為がどの結果へつながるか、その結果までどれだけの時間があるかという関係全体が更新される。第 6 章で見た temporal-difference learning、eligibility trace、time cells、第 7 章以降で見た小脳の予測状態は、異なる実装を通じてこの時間的な対応付けを支えている。
既稿「自由意志について再考する」では、主体の自由を瞬間的な無原因性よりも、経験を受けて自分の選択規則を時間的に更新できる能力として整理した[28]。この更新には、経験した結果をどの過去へ返すかという処理が先行する。望ましい結果が得られたとしても、その結果をどの行為へ帰属させるかが定まらなければ、次の選択規則は変えられない。時間的 credit assignment は、経験を将来の選択へ変換するための前提になる。
Filio らの研究は、この一般的な構造をマウス小脳の一回路で具体的に示した。顆粒細胞集団は、行為から遅延報酬までの時間に合わせて活動を伸縮させた。実際の報酬が省略されると、その活動の終了も変化した。さらに顆粒細胞活動を抑制すると学習が低下し、登上線維を刺激すると直前の行為が強化された[20]。予測状態と結果側の教示信号が時間方向に分かれながら、一つの学習過程へ寄与する構図である。
この結果から言える範囲は、小脳が報酬学習全体を単独で担うということではない。むしろ、第 11 章で見たように、ドーパミン系、線条体、海馬、小脳など複数の回路が、それぞれ異なる情報形式と時間尺度で同じ credit assignment の問題へ関与している可能性がある。価値を更新する回路だけでなく、結果が届くまで過去を利用可能にする回路があって初めて、遅延した経験を次の行為へ変換できる。
学習とは、結果の価値を覚えることに加えて、どの過去とどの未来を結び付けるかを更新することである。報酬学習が「時間を学ぶ」というのは、経過した秒数を記録するという意味ではない。ある行為の後に何が起こるのか、その結果はいつ到来するのか、結果が来るまでどの内部状態を維持するのか、実際の結果をどの過去へ返すのかという関係を組み立てることである。
未来の結果から学ぶためには、過去を一定時間だけ現在の内部へ残しておかなければならない。そして結果が到来したとき、その過去の意味を更新して次の予測と行為へ渡す必要がある。学習とは価値の更新であると同時に、因果関係を成立させる時間構造の更新でもある。
参考文献
- id774, 時間はどこにあり、「いま」はどこで生まれるのか(2025-12-27). https://blog.id774.net/entry/2025/12/27/3144/
- id774, 強化学習と自由意志はどうつながるのか(2026-01-28). https://blog.id774.net/entry/2026/01/28/3389/
- U. Hasson, E. Yang, I. Vallines, D. J. Heeger, N. Rubin, A hierarchy of temporal receptive windows in human cortex, Journal of Neuroscience 28(10), 2539–2550 (2008). https://pubmed.ncbi.nlm.nih.gov/18322098/
- C. J. MacDonald, K. Q. Lepage, U. T. Eden, H. Eichenbaum, Hippocampal “time cells” bridge the gap in memory for discontiguous events, Neuron 71(4), 737–749 (2011). https://pubmed.ncbi.nlm.nih.gov/21867888/
- W. Gerstner, M. Lehmann, V. Liakoni, D. Corneil, J. Brea, Eligibility Traces and Plasticity on Behavioral Time Scales: Experimental Support of NeoHebbian Three-Factor Learning Rules, Frontiers in Neural Circuits 12:53 (2018). https://www.frontiersin.org/journals/neural-circuits/articles/10.3389/fncir.2018.00053/full
- S. Yagishita et al., A critical time window for dopamine actions on the structural plasticity of dendritic spines, Science 345(6204), 1616–1620 (2014). https://pubmed.ncbi.nlm.nih.gov/25258080/
- R. S. Sutton, Learning to Predict by the Methods of Temporal Differences, Machine Learning 3, 9–44 (1988). https://mlanthology.org/mlj/1988/sutton1988mlj-learning/
- W. Schultz, P. Dayan, P. R. Montague, A neural substrate of prediction and reward, Science 275(5306), 1593–1599 (1997). https://pubmed.ncbi.nlm.nih.gov/9054347/
- J. R. Hollerman, W. Schultz, Dopamine neurons report an error in the temporal prediction of reward during learning, Nature Neuroscience 1, 304–309 (1998). https://www.nature.com/articles/nn0898_304
- C. D. Fiorillo, W. T. Newsome, W. Schultz, The temporal precision of reward prediction in dopamine neurons, Nature Neuroscience 11, 966–973 (2008). https://pubmed.ncbi.nlm.nih.gov/18660807/
- D. M. Wolpert, R. C. Miall, M. Kawato, Internal models in the cerebellum, Trends in Cognitive Sciences 2(9), 338–347 (1998). https://pubmed.ncbi.nlm.nih.gov/21227230/
- M. Ito, Control of mental activities by internal models in the cerebellum, Nature Reviews Neuroscience 9, 304–313 (2008). https://www.nature.com/articles/nrn2332
- P. L. Strick, R. P. Dum, J. A. Fiez, Cerebellum and Nonmotor Function, Annual Review of Neuroscience 32, 413–434 (2009). https://www.annualreviews.org/content/journals/10.1146/annurev.neuro.31.060407.125606
- A. A. Sokolov, R. C. Miall, R. B. Ivry, The Cerebellum: Adaptive Prediction for Movement and Cognition, Trends in Cognitive Sciences 21(5), 313–332 (2017). https://pmc.ncbi.nlm.nih.gov/articles/PMC5477675/
- id774, クオリアは脳だけでは説明できない(2026-07-23). https://blog.id774.net/entry/2026/07/23/5127/
- D. Narain, E. D. Remington, C. I. De Zeeuw, M. Jazayeri, A cerebellar mechanism for learning prior distributions of time intervals, Nature Communications 9, 469 (2018). https://www.nature.com/articles/s41467-017-02516-x
- S. Ohmae, J. F. Medina, Climbing fibers encode a temporal-difference prediction error during cerebellar learning in mice, Nature Neuroscience 18, 1798–1803 (2015). https://www.nature.com/articles/nn.4167
- M. J. Wagner et al., Cerebellar granule cells encode the expectation of reward, Nature 544, 96–100 (2017). https://www.nature.com/articles/nature21726
- D. Kostadinov, M. Beau, M. Pozo, M. Häusser, Predictive and reactive reward signals conveyed by climbing fiber inputs to cerebellar Purkinje cells, Nature Neuroscience 22, 950–962 (2019). https://www.nature.com/articles/s41593-019-0381-8
- B. A. Filio et al., Predictive and instructive cerebellar encoding of dopamine reward drives motivated behavior, Nature Neuroscience (2026). https://www.nature.com/articles/s41593-026-02449-z
- J. O’Doherty et al., Temporal difference models and reward-related learning in the human brain, Neuron 38(2), 329–337 (2003). https://pubmed.ncbi.nlm.nih.gov/12718865/
- J. E. Trach, Y. Ou, S. D. McDougle, The Human Cerebellum Encodes Temporally Sensitive Reinforcement Learning Signals, Journal of Neuroscience 46(26), e2313252026 (2026). https://pubmed.ncbi.nlm.nih.gov/42209265/
- K. Friston, The free-energy principle: a unified brain theory?, Nature Reviews Neuroscience 11, 127–138 (2010). https://www.nature.com/articles/nrn2787
- id774, AI は「次の単語を予測しているだけ」なのか(2026-09-03). https://blog.id774.net/entry/2026/09/03/5536/
- id774, 意味は差異の読み取りから生まれる(2026-05-09). https://blog.id774.net/entry/2026/05/09/4740/
- id774, なぜ世界は意味を持つのか(2026-01-02). https://blog.id774.net/entry/2026/01/02/3191/
- id774, 人間と環世界(2026-01-26). https://blog.id774.net/entry/2026/01/26/3371/
- id774, 自由意志について再考する(2026-01-27). https://blog.id774.net/entry/2026/01/27/3375/