{"as_of":"2026-08-11T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9eacadd8fe0e282de7ecb32650169c5eae3fc3c51caf4b9a36395b234d491149","coverage":[{"denominator":209,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T08:27:03.376909Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:00:57.517509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:30:07.939680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-05T20:31:47.521445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-10T16:57:45.636309Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.521445Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:03aec7e7e766f961c2160a6dc67fa7e2f02147acb23f416d6eb212e421404b72","observation_id":"94af6eae-201b-430b-b6fe-6754917d7091","resolution":{"observed_at":"2026-08-05T20:31:47.521445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2604.22199","last_updated":"2026-04-24T04:09:42Z","snapshot_observed_at":"2026-07-06T23:08:37.811548Z","submitted_at":"2026-04-24T04:09:42Z","title":"An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T11:27:34.992950Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2604.22199"},"observation_digest":"sha256:93ca8837d4f5e79f702a0e04772dbe92c5710581a18b5f0abbb95e9ddadec3ab","observation_id":"2412ae16-5e9a-40b5-b564-7a85281ef93e","resolution":{"observed_at":"2026-05-11T19:36:14.650855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.00143","last_updated":"2026-05-29T02:24:45Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-29T02:24:45Z","title":"Regime-Adaptive Continual Learning for Portfolio Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T20:30:20.156082Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.00143"},"observation_digest":"sha256:8fc77d3643c8f2280afd4c542d6aeca9ed1853a5e8d43af9c2957b58c692362e","observation_id":"47743675-6bcd-41d1-8d14-00ae3593e0dd","resolution":{"observed_at":"2026-06-28T20:32:37.261070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.03382","last_updated":"2026-06-04T22:09:00Z","snapshot_observed_at":"2026-08-02T02:33:38.414458Z","submitted_at":"2026-06-02T09:26:26Z","title":"Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T10:51:30.546134Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.03382"},"observation_digest":"sha256:644c68792ef36ed5bd5b2bc599ad2ffa54c99bb29447526e8752b7c36f53c91c","observation_id":"da285bb5-9a5b-4138-8aa5-fcc1d3441142","resolution":{"observed_at":"2026-07-02T02:36:26.590082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-12T15:01:54.826833Z","title":"A survey of continual reinforcement learning.arXiv preprint arXiv:2506.21872, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06379","last_updated":"2026-07-09T05:21:29Z","snapshot_observed_at":"2026-08-07T12:33:45.469282Z","submitted_at":"2026-06-04T16:47:33Z","title":"EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T15:01:54.826833Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.06379"},"observation_digest":"sha256:7fbfd7e94286c7c5d38cf0fb1e0d10c98428522667fcc45fad6a23e4deefdae6","observation_id":"c20592d6-2b33-455d-a84e-ee351c363d1c","resolution":{"observed_at":"2026-07-12T15:01:54.826833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.06380","last_updated":"2026-06-04T16:47:41Z","snapshot_observed_at":"2026-08-08T04:53:50.040262Z","submitted_at":"2026-06-04T16:47:41Z","title":"Emergent Language as an Approach to Conscious AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T01:28:54.111496Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.06380"},"observation_digest":"sha256:d7dd4663eff59ed7268e9767eeeed8fb06223fc809bcfa260ebbfe9542309e91","observation_id":"ef9c21df-094f-4543-b88d-c1505b9bcc70","resolution":{"observed_at":"2026-07-02T13:16:58.586054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.08102","last_updated":"2026-06-10T11:06:40Z","snapshot_observed_at":"2026-08-07T23:21:09.999828Z","submitted_at":"2026-06-06T11:07:13Z","title":"Continual Quadruped Robots Coordination via Semantic Skill Discovery","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T19:37:53.168569Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.08102"},"observation_digest":"sha256:5f957450a5e6e8d83f87c4b2c226daae08e68624e273d503dac4c69d233709f6","observation_id":"533b93a4-5150-45aa-9c08-05701e58881d","resolution":{"observed_at":"2026-07-02T21:37:25.181442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.21872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-04T19:30:07.939680Z","title":"A Survey of Continual Reinforcement Learning","venue":"cs.LG","work_id":"53e5266a-78db-4c8c-aad6-269446580cfc","year":2025},"citing_paper":{"arxiv_id":"2606.25389","last_updated":"2026-06-24T04:40:21Z","snapshot_observed_at":"2026-08-03T02:20:03.390753Z","submitted_at":"2026-06-24T04:40:21Z","title":"Offline Multi-agent Continual Cooperation via Skill Partition and Reuse","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T21:14:31.778575Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2606.25389"},"observation_digest":"sha256:2bc51a3c65f4d04c1f33602bfa2c971244e0f3d7cc31dfe2a0cf1c31f9b1cf01","observation_id":"21dd0c6d-fa7e-4830-b873-f87c5e74bbea","resolution":{"observed_at":"2026-07-04T19:30:07.940887Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-07-31T18:18:00.298402Z","title":"A Survey of Continual Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24320","last_updated":"2026-07-27T12:01:29Z","snapshot_observed_at":"2026-08-10T02:48:58.894844Z","submitted_at":"2026-07-27T12:01:29Z","title":"Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T18:18:00.298402Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2607.24320"},"observation_digest":"sha256:ca279c696165897eaf5bb3269f10e42981d78349acb010c09b87dd67e9d39f63","observation_id":"eabe5058-98a9-4b26-9e80-3762ad6ec7b1","resolution":{"observed_at":"2026-07-31T18:18:00.298402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-06T00:31:37.297766Z","title":"arXiv preprint arXiv:2506.21872 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01149","last_updated":"2026-08-02T11:00:04Z","snapshot_observed_at":"2026-08-10T20:15:17.072718Z","submitted_at":"2026-08-02T11:00:04Z","title":"PATH-Bench: Path-Dependent Evaluation of Lifelong Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T00:31:37.297766Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2608.01149"},"observation_digest":"sha256:d3ea98be2e42271bbeea45593be362bb228f4347376126761d49c3355dda6ad7","observation_id":"fca4c27e-653f-412c-b5c1-84667ab4b2ca","resolution":{"observed_at":"2026-08-06T00:31:37.297766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21872","snapshot_observed_at":"2026-08-10T14:00:57.517509Z","title":"A survey of continual reinforcement learning.arXiv preprint arXiv:2506.21872, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07148","last_updated":"2026-08-07T12:10:08Z","snapshot_observed_at":"2026-08-11T04:11:41.256211Z","submitted_at":"2026-08-07T12:10:08Z","title":"A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:57.517509Z"},"links":{"cited_paper":"/paper/2506.21872","citing_paper":"/paper/2608.07148"},"observation_digest":"sha256:63238f5c86c54eb2752ba72db5c2b545c982500b13b889ca96e66c1357dcafad","observation_id":"3c78565f-e685-4545-bc56-87ba44375a07","resolution":{"observed_at":"2026-08-10T14:00:57.517509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21872/citation-record","integrity":"/paper/2506.21872/integrity","json":"/paper/2506.21872/citation-record.json","paper":"/paper/2506.21872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b69f1bb-70b2-4187-9819-77a85125739a","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:68a006ae1b8c91f2600a869bfa0c513dd952e251d44002c0e6be75c5bc20545e","observation_id":"967ff375-bbf9-4eec-a065-dca450e2480d","resolution":{"observed_at":"2026-05-19T08:27:12.432852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"87cfceda-6de3-4d61-b65d-e35a974c060d","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3f6f44e91f91a48a11909cd5d33186d9a415e67d471a28eb60b0fc1d88d217cd","observation_id":"b3ad794c-f3ad-4b68-84b7-2a597d68c1dd","resolution":{"observed_at":"2026-05-19T08:27:12.448167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play","venue":null,"work_id":"354748dc-4961-47ef-8a3b-5858faf18d71","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:76e5e334ab33f60468ab5ea2b2fb8469693ef6e953e432cbd6f4ece11a3a7e48","observation_id":"46da753e-c281-4e5a-91ce-e0800ffc2317","resolution":{"observed_at":"2026-05-19T08:27:12.443848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved prediction of protein-protein interactions using AlphaFold2","venue":null,"work_id":"5f450b19-f7e2-4d77-8b18-b8f8f3b8917d","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a8835b57e0e25549ba8a7c35a79aded0570b168fbd44e8f888d77a1ef00da709","observation_id":"1a703971-a976-4bd5-9a91-3183a9e62fb2","resolution":{"observed_at":"2026-05-19T08:27:12.439976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning high-accuracy error decoding for quantum processors","venue":null,"work_id":"af80b563-f4a3-482d-989f-b24a24c5c6ee","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:13c3d220ae390361b834c54628221ed1859cbf66c0999b5e6abec46b31180484","observation_id":"0a3884d8-166e-41e2-81ab-7e0e354fc3b2","resolution":{"observed_at":"2026-05-19T08:27:12.436340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"8291c45e-801c-48c4-a105-230c8e25da8a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:beaad9c0eb9f55237602761ef03afd36d76e00191d4e990f12dc10c001ec0fbf","observation_id":"c979f30f-04a4-446b-a926-4f0b575cd962","resolution":{"observed_at":"2026-05-19T08:27:12.430350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3ff04b76dc5827618e1332dc6e02e7cb8c6b656c48c141467420becefeef6701","observation_id":"859afd83-0bbf-4300-869f-cfc4b186ff60","resolution":{"observed_at":"2026-05-19T08:27:11.207615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepther- mal: Combustion optimization for thermal power generating units using offline reinforcement learning","venue":null,"work_id":"fe98123b-170e-4e6c-b360-fd5afbf30484","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:0d366a7b0f01f404f49ebbd24dfb5473899b666d6044f217019513f8d653aa42","observation_id":"b5ca8f71-1075-4796-bac6-09c8befb8c90","resolution":{"observed_at":"2026-05-19T08:27:12.426347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":"614b0c51-1ba1-4074-856d-fe9eab9b657a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:de07fd2e9af685ca6a0e1eaac5640b904851f6ae02ba8ed05ec14800d3d92c47","observation_id":"1cacd800-3716-4f5b-8895-678a8211897d","resolution":{"observed_at":"2026-05-19T08:27:12.237995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles","venue":null,"work_id":"f27f9c47-4a29-4dfc-add9-90f034f12aaa","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:193b5e2e5b88ffb1113cc86a4cf1a9bd255894b369fe2ab22da7c931b2cfbe18","observation_id":"a8835f6b-7ae6-4705-aa3c-56f3ebdcd1c6","resolution":{"observed_at":"2026-05-19T08:27:12.046499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grandmaster level in StarCraft II using multi-agent reinforcement learning","venue":null,"work_id":"e46b29eb-39c1-4880-b6ef-fabd3192600b","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5ff782f11159874810937fa397efc7e8abc0b7fc7c9977821e0b47f6c36b6f90","observation_id":"206c745d-f98f-4a76-8f4c-371382266358","resolution":{"observed_at":"2026-05-19T08:27:12.080902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards sample efficient reinforcement learning","venue":null,"work_id":"fb5edb2f-eac3-4276-a9a7-3b7766f5e99d","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d6b846e1f2c8602fafb3d093e410daed77100fa7a78553eb16c9407fafd921da","observation_id":"280239a3-c4c6-4640-b83f-1ec173301a41","resolution":{"observed_at":"2026-05-19T08:27:11.863549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ding and H","venue":null,"work_id":"cf068522-82e9-4406-baed-84c299d0e8a3","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5056b2b52cc438cbf1d5b37582c54ecfd80d5bc09311d6db48594c0a418322f4","observation_id":"ab61ff0e-9777-4df5-a632-40f83bbe1815","resolution":{"observed_at":"2026-05-19T08:27:12.004858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis","venue":null,"work_id":"713d4fe9-9a50-49fd-b8b9-8e17768e1692","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4ec29e08ffc5e5f7433132db09d6404f6d0391b5ec8539c2f2f97df163ce7f50","observation_id":"b7545c45-2671-410a-8b5b-ce74d6ea4e5d","resolution":{"observed_at":"2026-05-19T08:27:11.805347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biological underpinnings for lifelong learning machines","venue":null,"work_id":"74993d3b-72cf-4853-95cd-0c3760ea0b2a","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b42fdfdc8bd93f262508497bed61d0e2c93b3f87a859efc26d43c267e02600c6","observation_id":"6d1a35f1-f732-46d8-916a-ee5841acdec8","resolution":{"observed_at":"2026-05-19T08:27:12.041850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual lifelong learning with neural networks: A review","venue":null,"work_id":"b5c3df35-87bc-4dcf-bec6-06fe5ce42912","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c6ab5c0470ae26f0e32f70591a95b19ecccb2b49543e6e050919382a5baf5a72","observation_id":"31e9954b-12b6-4795-bedc-2132e5022cbe","resolution":{"observed_at":"2026-05-19T08:27:12.017728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A continual learning survey: Defying forgetting in classification tasks","venue":null,"work_id":"d9102a60-4816-4519-9fe1-5513c62cd96b","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1ac54ee7ceb5678e82c7dd1fa999344907445f1ef9638aedd334000ec5d71494","observation_id":"7e16880e-0531-4610-8cf2-350e38c0b5a9","resolution":{"observed_at":"2026-05-19T08:27:11.774606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey of continual learning: Theory, method and application","venue":null,"work_id":"07608b2d-cefe-4cbe-9446-249404783f40","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:49276d72490c3f4fccc5ab8a1dfc9cd0678070c3c078feb14717dbf915430f69","observation_id":"2b1357f1-c02a-47dc-84c2-408b6c4c1fc8","resolution":{"observed_at":"2026-05-19T08:27:12.189475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated continual learning via knowledge fusion: A survey","venue":null,"work_id":"f8687ba3-b8a8-4b1a-a5ef-222caf89201d","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b26e3e44a3dcd7eb2a7926d4b0fc66cf2717149295c9e3982b5965039e2394f7","observation_id":"95c9d345-2f1d-4c35-b1d5-cdf07f31624e","resolution":{"observed_at":"2026-05-19T08:27:12.373331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CHILD: A first step towards continual learning","venue":null,"work_id":"4d69dbe8-0414-47d2-a115-8968c81f6381","year":1997},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:3165af8ae7b0d1078478684ba44c44e6ea1445c36c03d3ca85f8365710d799b0","observation_id":"40a4d10c-71b1-4a6a-b752-1e7d63822726","resolution":{"observed_at":"2026-05-19T08:27:11.832538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards continual reinforcement learning: A review and perspectives","venue":null,"work_id":"0b365226-d53b-4d0d-97b0-337ac1efdbe9","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:21f09ac19af3d6b2eb007fd76c978feba5b7a4c39ac889805a9b1a4376900f15","observation_id":"2d837f75-7687-492f-b5aa-138e00975d5d","resolution":{"observed_at":"2026-05-19T08:27:11.628921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast TRAC: A parameter-free optimizer for lifelong reinforcement learning","venue":null,"work_id":"32a44200-f9ed-469d-bc24-fb572a3496b7","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:025600cc05b0f60febb67d90051a0feaa7844d9f0d294692eaae31e97f9d5268","observation_id":"08d46c16-7cee-4883-a305-bd0c05b87d66","resolution":{"observed_at":"2026-05-19T08:27:11.965198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey of forgetting in deep learning beyond continual learning","venue":null,"work_id":"fd486825-554d-493d-8d78-70314349a116","year":2025},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:546b1f3d35738c48ee179c914fcfac2857f7969c54d9619db986b22e0988d561","observation_id":"9fe53a8b-fa4d-4b2c-acd9-f3c34d3c4d01","resolution":{"observed_at":"2026-05-19T08:27:12.140951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Markov decision processes","venue":null,"work_id":"5f519251-b438-480a-93cc-4feb321eabf4","year":1990},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ef69a855aa13229acdecd4adc0a534ef2226ffae11da27b4e8f614baaf436f87","observation_id":"484f22d7-9290-4000-8245-3e71bd78e1a4","resolution":{"observed_at":"2026-05-19T08:27:12.405697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"38450394-ac41-4201-8c61-4acafa6c7f43","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:69d352edfd7ef3964b904f886c4a9917aae773f5690e4de1cdf21538bd76edc1","observation_id":"8e3bc458-7486-4c8b-842f-a0a2f3d45f40","resolution":{"observed_at":"2026-05-19T08:27:11.740074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prioritized experience replay","venue":null,"work_id":"d0f94e53-aaef-48c5-b65f-e74f495abd43","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1a5a6f4753bdae27f4564c57d7e3ae70718c3681dc395a9b9c5b24d440ce1ccd","observation_id":"4abe9bc8-35b3-454e-893a-6b468a84c1d5","resolution":{"observed_at":"2026-05-19T08:27:12.076735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"014a8f1e-76c1-4df3-8a28-e5c74a1ddf29","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c3f899674b094dd566dbcc18a75bc019a3e1021e47092d7406508fdd260a7da4","observation_id":"2b2dc532-3797-4124-8304-bfdb11072062","resolution":{"observed_at":"2026-05-19T08:27:12.072661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep recurrent Q-Learning for partially observable mdps","venue":null,"work_id":"cdb1c044-3d19-4d28-b328-cb50718a014f","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:964a2166b7c5921e98b5de824725ef421d67a02acd5e20c535d52b8e8fbf321e","observation_id":"155d3c30-45e2-48f8-b761-92ba9be4a797","resolution":{"observed_at":"2026-05-19T08:27:11.910398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"44bc519a-47ad-464b-97fd-a1589d629de7","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:35e314a0aae8f5052923e74b00dbe5a3ad0c47997897f3a41bf84d7a192b96d8","observation_id":"0a865d94-e831-4b8e-b43f-81305b19c246","resolution":{"observed_at":"2026-05-19T08:27:12.184912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous control with deep reinforce- ment learning","venue":null,"work_id":"20eb029f-e386-4cca-b833-05b15c43a8b9","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9141e9b41ef9da9e5bfbfaf63a049a95de53bd156a1a060fd7b50eeb118e5899","observation_id":"ba3c09b4-617a-44ee-9a2b-b59e5347c484","resolution":{"observed_at":"2026-05-19T08:27:11.819433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing function ap- proximation error in actor-critic methods","venue":null,"work_id":"e5dcd3c8-1256-42d9-a398-c17dd9223591","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:198ac78fec2474534344c6409d9c9ae96d837389365805c6acf96dff406f97a9","observation_id":"f1161da1-f9e5-4cfd-9b11-9bd95126cc35","resolution":{"observed_at":"2026-05-19T08:27:11.729214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trust region policy optimization","venue":null,"work_id":"b7fef1fc-3aea-43e3-ac9c-29e46daa1ae2","year":2015},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:45adf65471b65a23589f36da94837cb832f47fc05ade7ede811696f96dd97629","observation_id":"85692d8d-42f1-4d4d-8326-5658bb22746f","resolution":{"observed_at":"2026-05-19T08:27:11.711997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8ed332a0fe38625265eda40f6c3bb95bb1ca5bcd9e23fb5d53d02425c8be3194","observation_id":"dc52effd-16ad-4450-93bd-04d7d315908b","resolution":{"observed_at":"2026-05-19T08:27:11.179467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"e702c970-9397-4d2d-97fc-1e37240be7a4","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ca544be37dfd10b462692dd151dcd2b862a1b5f7e609c3e4db07272f2002b4a3","observation_id":"6084fd90-87f7-4980-8fff-c7c5bb1ffb6e","resolution":{"observed_at":"2026-05-19T08:27:11.991637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A wholistic view of continual learning with deep neural networks: Forgotten lessons and the bridge to active and open world learning","venue":null,"work_id":"f595b5cf-180e-4a65-a11e-459983d7a985","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e87f3bcdd1b1fc06c036e7be995547d097a5f94133af8bccd8db8ade6b754351","observation_id":"717ba5ac-84e0-40fe-ac83-c6518315f0e7","resolution":{"observed_at":"2026-05-19T08:27:12.401957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning for robotics: Definition, framework, learning strategies, opportunities and challenges","venue":null,"work_id":"c98a4e63-5cac-421e-8575-de8ccc0a6fc5","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:7a2f42cd1bcca4028828f394caa574bb1e74d67d2ab4d3b3d9562813d4ee6350","observation_id":"0c7961cc-3f26-469f-83ad-4ed780f19ef6","resolution":{"observed_at":"2026-05-19T08:27:11.956405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual variational autoencoder via continual generative knowledge distillation","venue":null,"work_id":"cfe8f186-6e60-418b-a05e-89e723356983","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8487daefb7b2a8114aac54ad1a66e7e23a34c841e37dbe68c66d8f6f1defb406","observation_id":"01461a72-d0a8-40c8-b145-7fbbe9de06a6","resolution":{"observed_at":"2026-05-19T08:27:12.116126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"iCaRL: Incremental classifier and representation learning","venue":null,"work_id":"60b321d8-e09f-4d9e-92af-3528ee480d4d","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c0414b1080b9d7f207472feb7eacc06b0f81b69e84bd6104d3905dc1bc69d886","observation_id":"814a68dd-9aa1-46ff-bb13-21661b254b63","resolution":{"observed_at":"2026-05-19T08:27:12.171662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning with deep generative replay","venue":null,"work_id":"d0765f55-3048-4685-9087-1263cf466c21","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:44ceb24ff43f04423e20b25899eeb81a706eaded3d031cff8eb04a373337a5b8","observation_id":"bdff437e-3417-408b-8a67-a659810f3018","resolution":{"observed_at":"2026-05-19T08:27:11.721486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-incremental learning via deep model consolida- tion","venue":null,"work_id":"8655caa7-cd04-4253-97a5-bd23eb8de574","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:6892c22362cfd485f955595b7ed61182c4f1e55a35913fc56f37f54ae453ecae","observation_id":"0ae8e263-5e4e-4666-aa1c-7ca597e36698","resolution":{"observed_at":"2026-05-19T08:27:12.102519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Differential privacy preservation in robust continual learning","venue":null,"work_id":"625adca0-27c9-4e80-8b7e-5cf590cd6930","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:63e62c92c66aae910201957284f8080e46f035a7983d308dee4baf147e08d597","observation_id":"e437c4b7-df05-4f04-a258-b3706b0868c2","resolution":{"observed_at":"2026-05-19T08:27:11.843767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"39af75ff-8c2a-4069-82bd-6816531bf57f","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ccea59932378ca1ee235cd52b2b5fa2ea7ffab5d147d2d9c1c733c0f7f8600ab","observation_id":"766a0077-67bd-4f60-b2d5-bcbaa054e9e0","resolution":{"observed_at":"2026-05-19T08:27:12.206444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual learning via inter-task synaptic mapping","venue":null,"work_id":"8b207376-9ddf-4fae-90b3-4be5c1b9e948","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b349465ebb6affef79caed4b5267f227e26e934af5a46c99104fa29c12b5096d","observation_id":"c6ea9064-a1e4-41e9-9830-9d266c186e7d","resolution":{"observed_at":"2026-05-19T08:27:12.210606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning without forgetting","venue":null,"work_id":"7ac411d6-37c7-4b5e-a29b-d9e0cf6ad5dc","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:7d7151f7d46df36952decae92e98019c85688336713e8b70441329c49be70862","observation_id":"df6a1fc9-53bb-4fb3-aa0e-55a41832d4d3","resolution":{"observed_at":"2026-05-19T08:27:11.681615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class-incremental learning by knowl- edge distillation with adaptive feature consolidation","venue":null,"work_id":"5d4ee1d5-40e4-4b46-8ece-6c695d4be592","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f65f44cc17e7779d47eff06487c326acd32caf270340e15654f5f7968d411dd7","observation_id":"eaad7dcf-3b91-4f68-96da-c2d49ee0e448","resolution":{"observed_at":"2026-05-19T08:27:12.247226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PackNet: Adding multiple tasks to a single network by iterative pruning","venue":null,"work_id":"82bdaa0c-741a-4037-89e9-05478e32f2dc","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5ab33232445bb1ffb0596592993d1c20763e9a3f0dfb5cad3082286319563757","observation_id":"a60c4aad-e340-4cec-bb05-6ecf79b68333","resolution":{"observed_at":"2026-05-19T08:27:12.241824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piggyback: Adapting a single network to multiple tasks by learning to mask weights","venue":null,"work_id":"de5807a0-a1ed-4832-836f-cb367742bb7b","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9152493ea3fdc7d8cdbeb566a5b59a4677b5ec8e8cdd2b9be12b8ebc2e5f5c93","observation_id":"f99e7528-3d36-4728-b8cc-bfebf65a2031","resolution":{"observed_at":"2026-05-19T08:27:11.757431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong generative modelling using dynamic expansion graph model","venue":null,"work_id":"f756f0ef-1a91-499c-b439-baa36946f574","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c1924bdcb68e024b1c43b48e406728e88f12a36081e6c484b4b3294896baf29c","observation_id":"626a6b33-eadc-4be7-8691-d3edcd1b0aa8","resolution":{"observed_at":"2026-05-19T08:27:11.897391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Few-shot incremental learning with continually evolved classifiers","venue":null,"work_id":"8687b90c-e5bf-4f10-8930-a231ae7e88b1","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:beaf79fc8ba64e7d8fd69e2b210e0529682c49c8f33d8f03bac268c9fd8dcdc8","observation_id":"24575a05-0ab4-4036-a0d5-ef3b258183ef","resolution":{"observed_at":"2026-05-19T08:27:11.744031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12488","last_updated":"2019-01-23T16:58:13Z","snapshot_observed_at":"2026-07-06T07:11:21.870009Z","submitted_at":"2018-10-30T02:08:35Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","version":4},"cited_work":{"arxiv_id":"1810.12488","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.12488","snapshot_observed_at":"2026-07-04T16:09:57.300453Z","title":"Re-evaluating Continual Learning Scenarios: A Categorization and Case for Strong Baselines","venue":"cs.LG","work_id":"41d65f99-cf0a-4af4-b181-84fb2c16135f","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1810.12488","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:9168697c5a1e2b3cd504669bd302a2d25c5c2c2dc0496535897007e380c66860","observation_id":"515b7a97-b40b-46c2-9620-14d3b4c05486","resolution":{"observed_at":"2026-05-19T08:27:11.172394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Three types of incremental learning","venue":null,"work_id":"b65fc642-3119-4e4e-b162-c644f0624bbf","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:72cd5fa98977685fc7654e82a5b61038dfeb22ad1ca4171c2049244ebdd8f6c3","observation_id":"9e81b28d-15c5-49f6-a6cc-ebe4dbb9798a","resolution":{"observed_at":"2026-05-19T08:27:11.973937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A definition of continual reinforcement learning","venue":null,"work_id":"784fa317-742e-4e73-93b2-f6ca2a15a2cb","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:fd633dfd94e6b4f5653567b8b0070de8fe95476d2ae20e87fd89872aedbde625","observation_id":"b707d3f7-1f83-4d44-8d73-22d6add971db","resolution":{"observed_at":"2026-05-19T08:27:12.413783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss of plasticity in continual deep reinforcement learning","venue":null,"work_id":"54eb2c79-5308-49ea-8a64-186203b3b702","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8f6cfd5b5d4a913684ebeab55da23342343e5f49db05076497e87cb5f5eb9cbd","observation_id":"0cff2393-36f5-419e-860b-6b5b10059ce6","resolution":{"observed_at":"2026-05-19T08:27:12.055108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of multi-task deep reinforcement learning","venue":null,"work_id":"cab1d404-1048-43ac-8329-cedebbf38ee6","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:74d71764623db0669f3b74df2d1357c0cea9f94c603238ed4050e307c8dba635","observation_id":"99681c59-4e18-43b7-8853-ff4b38474a13","resolution":{"observed_at":"2026-05-19T08:27:12.193570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learning in deep reinforcement learning: A survey","venue":null,"work_id":"abdd9c36-8aa2-456b-9f8c-6adafcdec799","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:50cdea6b833b325845ed1dd8318bda12632fb5b0159fd4670a7a4c25089dcab9","observation_id":"e80d4a7c-178e-4c6c-a776-530f5724bd8c","resolution":{"observed_at":"2026-05-19T08:27:12.068456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual reinforcement learning with complex synapses","venue":null,"work_id":"beedb7d8-0361-4fc4-9152-4ae234e640de","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c5e375b8b869726dcfb1a1bceed5fb76bbdab3260f4e349a9430e87bbf03ab23","observation_id":"70ddc7db-ee9e-4555-b5f7-83e858eb2d5f","resolution":{"observed_at":"2026-05-19T08:27:12.022265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":"42370f36-f88b-4486-8583-6153804104a4","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:18ce0f1188bb63d3ef7781dc35f43bef60c43dda71c126993070552110dcb21b","observation_id":"eb5cad15-b9fe-40ba-ab37-2241bb6b4caa","resolution":{"observed_at":"2026-05-19T08:27:12.270042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04832","last_updated":"2026-04-18T13:11:19Z","snapshot_observed_at":"2026-08-07T20:09:01.472991Z","submitted_at":"2024-11-07T16:13:54Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","version":3},"cited_work":{"arxiv_id":"2411.04832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04832","snapshot_observed_at":"2026-07-04T19:30:07.847309Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","venue":"cs.AI","work_id":"a7c70fc3-1b92-4e76-a995-cbc2130c36d0","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2411.04832","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4b90fca679447ce71d293646422c48879a8718e87f0417cd6f64d531f3324cd3","observation_id":"d1afbb7e-de5f-4f15-9c70-999c49d8b9fc","resolution":{"observed_at":"2026-05-19T08:27:11.132613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A study of plasticity loss in on-policy deep reinforcement learning","venue":null,"work_id":"7074f475-f254-4e3e-8af8-6dff0e994570","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4d3b005f556523d33fb9a91fa600fc572bbda5fed85b2fcf0850451e68dabf5e","observation_id":"1a47ce9d-d194-4dfa-ac0a-f630c79b98d5","resolution":{"observed_at":"2026-05-19T08:27:12.084992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contin- ual world: A robotic benchmark for continual reinforcementlearning","venue":null,"work_id":"9daa3299-0dcc-45ea-808a-cba7d6d69924","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:bb4be044b5fd9fbee16260e4eddeccb1360a9de19da42c7128e164cb8ced7f71","observation_id":"5cf69aa2-3cac-4005-894c-24cdd69c6010","resolution":{"observed_at":"2026-05-19T08:27:12.341334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling transfer in continual reinforcement learning","venue":null,"work_id":"40c1bc3a-9759-4e1d-92fd-84f28d5f1b53","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ada91d401155965fad29e535e694bae7026e05a8605a65ed8c571ab6208d6388","observation_id":"2e254c6f-13fc-4e2b-81a1-ee45be498e4f","resolution":{"observed_at":"2026-05-19T08:27:12.381893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-composing policies for scalable continual reinforcement learning","venue":null,"work_id":"83e3a493-0e8c-4e0a-b891-74fedd4484e2","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4f443ae8abe893702a94e5ef38fd8e3850a189bb4e4ba7e83c297ba95452acdb","observation_id":"17f51a78-7825-4d18-8b38-1d90f8d5ebe1","resolution":{"observed_at":"2026-05-19T08:27:12.377738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous coordination as a realistic scenario for lifelong learning","venue":null,"work_id":"f237f775-bd55-4d6f-ba6d-965546bca7ff","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2328ee027a1747b3a1c57b7b365c327b1cf52b3adae84d231d2743d6b4f95980","observation_id":"2478aee0-0810-43ff-ab83-f1e5abae3856","resolution":{"observed_at":"2026-05-19T08:27:11.810086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07454","last_updated":"2022-03-14T19:20:26Z","snapshot_observed_at":"2026-07-06T12:47:48.418460Z","submitted_at":"2022-03-14T19:20:26Z","title":"L2Explorer: A Lifelong Reinforcement Learning Assessment Environment","version":1},"cited_work":{"arxiv_id":"2203.07454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07454","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L2Explorer: A lifelong reinforcement learning assessment environment","venue":null,"work_id":"9199e60e-f398-4364-bc2c-6e555296c049","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2203.07454","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2941c0d9f9e5f1b12419aea34e9c4690e2cef65a265c933852e4831390e9d8d3","observation_id":"39074b72-6c35-492d-97a5-6bfd955aa841","resolution":{"observed_at":"2026-05-19T08:27:11.165479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building a subspace of policies for scalable continual learning","venue":null,"work_id":"756c7da8-23d1-44de-91c6-88cdda539acd","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:075c1b4b430c3a704b48e672d0a672ea52b1f7fadb3eeb716cd03312bdae6c7c","observation_id":"45dafd26-e4db-4958-8372-2652816ed364","resolution":{"observed_at":"2026-05-19T08:27:12.345029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-based lifelong reinforcement learning with bayesian exploration","venue":null,"work_id":"9fe812d2-0ce8-424f-89f9-59e167bd3832","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b7584385a000ffb5ada863efaf126ea309cccb6681dd57ea8f792c9722373c67","observation_id":"18d40ed3-d7ae-40c4-8a07-53d26acecdb8","resolution":{"observed_at":"2026-05-19T08:27:12.348927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual reinforcement learning in 3D non-stationary environments","venue":null,"work_id":"054601b2-2867-4770-a552-a3840efd1e62","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f555d629b9693636e3de500833876dc2b84456f7f40cbd868df3eed6f20e687a","observation_id":"a4c19a8f-7830-4ab5-9aaf-986e40db702c","resolution":{"observed_at":"2026-05-19T08:27:12.353185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CORA: Benchmarks, baselines, and metrics as a platform for continual rein- forcement learning agents","venue":null,"work_id":"d527659a-f70a-4b62-8fad-706917c2d1f8","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b6f928843e56af24bbea456bb3840137a591ec3b09bc81afad37f9caf24e5493","observation_id":"97c30c7c-a467-4e55-8725-f7eeaca1f00e","resolution":{"observed_at":"2026-05-19T08:27:12.389860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"COOM: A game benchmark for continual reinforcement learning","venue":null,"work_id":"b4afb6dc-9729-4930-a26a-c6240ebd03db","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:96261d305f00e5cd72e7388d171baa6be4e1a44a239cee9d6263729efff5933c","observation_id":"de4c8c94-5768-449a-8295-2d110be8c0ea","resolution":{"observed_at":"2026-05-19T08:27:12.315650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy and value transfer in lifelong reinforcement learning","venue":null,"work_id":"0b423d2f-4f16-4ce4-86ce-e6727d8193bd","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:77b6e14a8e0f6744d6b8c86bed19645031765b52f5377c8da90855c3771fb438","observation_id":"a17bc714-3f58-46bc-bca6-50698560b051","resolution":{"observed_at":"2026-05-19T08:27:12.331084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning envi- ronments for goal-oriented tasks","venue":null,"work_id":"74175d3a-2110-4ce9-805d-b9a08f0cd26e","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:be96e5b5e525acb175d672a73d76375f786df7633ce200d6817714e2e0842ec8","observation_id":"020c2df7-8e4d-4379-adba-e0239c9af79c","resolution":{"observed_at":"2026-05-19T08:27:12.328324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03801","last_updated":"2016-12-13T12:19:48Z","snapshot_observed_at":"2026-07-06T05:22:21.129782Z","submitted_at":"2016-12-12T17:32:49Z","title":"DeepMind Lab","version":2},"cited_work":{"arxiv_id":"1612.03801","doi":null,"metadata_source":"pith","pith_arxiv_id":"1612.03801","snapshot_observed_at":"2026-07-09T12:56:14.879463Z","title":"DeepMind Lab","venue":"cs.AI","work_id":"8a8d827f-5377-4733-bfe8-bc66c011d458","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1612.03801","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:80e60eed285ba0b93b4059567ee066af06c17a3f9c24f7b3eea3cf0f6419f8f8","observation_id":"dbb71f58-8c2a-4b0e-825c-ebf1b0115f54","resolution":{"observed_at":"2026-05-19T08:27:11.193393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progress & compress: A scalable framework for continual learning","venue":null,"work_id":"4d6e5885-59ee-4e4b-9eb7-aca407e2d4ec","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:a347af2f42eda87dc3375ae4eeb912a6fccfb30322967623bf26fcada19276d1","observation_id":"02f6d114-3c64-4a32-881c-1c44015ba22e","resolution":{"observed_at":"2026-05-19T08:27:12.297774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2c24d4dec8dec75f16bdbc402cbd965abe928a608dfe3dfa4894a9acebaaea27","observation_id":"ddd202c7-ae37-4a30-8447-3b99b380b73b","resolution":{"observed_at":"2026-05-19T08:27:11.186560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Same state, different task: Continual reinforcement learning without interference","venue":null,"work_id":"f9fec60c-cff9-4ff9-9b20-ff45571d1790","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:8e81142e3215768ba3d77fc8a8646f24a00d9dece60f28e43e168f2cc0a742fb","observation_id":"35081155-68e4-431e-8434-5153db5b9898","resolution":{"observed_at":"2026-05-19T08:27:12.311291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MuJoCo: A physics engine for model-based control","venue":null,"work_id":"f2f6b30f-b75b-4799-9383-c4d1c0cda7ff","year":2012},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1e69d9627c0a0455095f3a9cddf66de9f048b41ac84c79e7619ba68643508a07","observation_id":"b64a08aa-db33-4884-adeb-73882401fdfc","resolution":{"observed_at":"2026-05-19T08:27:12.333984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy consolidation for continual reinforcement learning","venue":null,"work_id":"78839a4b-e56a-4ad7-92d7-22495a48e3b2","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:5a57641abb56f5199dc229affd0d6fcedafc176bfe7551e6260bb3117b8ce19b","observation_id":"82198ff5-e320-4e48-9dda-8a13420048ec","resolution":{"observed_at":"2026-05-19T08:27:12.369300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPALA: scalable distributed deep-RL with impor- tance weighted actor-learner architectures","venue":null,"work_id":"9c7fde71-a215-4ea2-b6e2-1bce80935db0","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:293863f3497406c9311aba2e1cab439aa8f922526dcb891751efd05cdb72a6f7","observation_id":"a6ff9d46-9a2a-48c3-8a76-9e83157444c9","resolution":{"observed_at":"2026-05-19T08:27:12.265828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prediction and control in continual rein- forcement learning","venue":null,"work_id":"0f65b3b7-504f-41da-98da-1528df3c7c26","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:53d0f1f0df21a88a7ad0794f6d4220e28234d0df138c60439da10fd7f865409f","observation_id":"a428e50b-c3e8-4acb-92b8-66aad0e30a1f","resolution":{"observed_at":"2026-05-19T08:27:12.279403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":"7df79982-58ff-4516-9d3a-d99b4b218e69","year":2013},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:e91fc4af7e63b5bd0cb1694d9375cd1588610068028c6e765f436b7dd74953c9","observation_id":"868c6bfb-980a-43e9-b82e-3640d785e62e","resolution":{"observed_at":"2026-05-19T08:27:11.947778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04671","last_updated":"2022-10-22T14:34:44Z","snapshot_observed_at":"2026-08-09T14:14:13.613085Z","submitted_at":"2016-06-15T08:20:51Z","title":"Progressive Neural Networks","version":4},"cited_work":{"arxiv_id":"1606.04671","doi":"10.1007/978-3-030-58598-3_10","metadata_source":"pith","pith_arxiv_id":"1606.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Neural Networks","venue":"cs.LG","work_id":"0700d73f-b94d-4cd3-be40-086e4c4544c4","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1606.04671","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:7f4a26b87179fef458d2216bb3e6b9675ec2e8773e0330ae51bb632ddbf7b144","observation_id":"9423d14f-91ec-4f24-b28c-de36e6d8bc10","resolution":{"observed_at":"2026-05-19T08:27:11.158048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04782","last_updated":"2017-08-16T06:20:52Z","snapshot_observed_at":"2026-08-10T10:13:54.999657Z","submitted_at":"2017-08-16T06:20:52Z","title":"StarCraft II: A New Challenge for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1708.04782","doi":"10.48550/arxiv.1708.04782","metadata_source":"pith","pith_arxiv_id":"1708.04782","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"StarCraft II: A New Challenge for Reinforcement Learning","venue":"cs.LG","work_id":"9c70874f-186a-43a4-be0b-cc1efa99bd91","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1708.04782","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:2ef10c36c06452d6a53bcf48912ae1bb060d7fb2bedd6e77d401ec1a7c24cbd0","observation_id":"2ce40946-0517-48f3-80c3-2264f19c5da5","resolution":{"observed_at":"2026-05-19T08:27:11.200227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong reinforcement learning with temporal logic formulas and reward machines","venue":null,"work_id":"b5e2e7c5-d294-486e-9d82-a33609f67944","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b129e8be14d7d6c5b08ef090ec6a2f7f9f692bf4b2b416e0ed0c0001d3b24c28","observation_id":"32a6c183-0629-404a-8029-233133c45b14","resolution":{"observed_at":"2026-05-19T08:27:11.931889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reset-free lifelong learning with skill-space planning","venue":null,"work_id":"65519e83-35c8-40d3-905e-ffc4ca150a0e","year":2021},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:1721b3c7c605b0388e37a82ab43c0e3f5cd8df0f0474583d8a3fdf9c8c948db4","observation_id":"33925282-0e5a-4b8a-a1fa-820a11ee2696","resolution":{"observed_at":"2026-05-19T08:27:12.202370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-free generative replay for lifelong reinforcement learning: Application to starcraft-2","venue":null,"work_id":"f51d9a40-5169-4332-9ab7-9308fdd8ee3c","year":2022},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:af99f9fb8557594ae577c5a1718d304cefc0cd4c4b89e4c3c372ad20315ff253","observation_id":"55b3df8d-281a-490a-8296-16a4f7b4fa18","resolution":{"observed_at":"2026-05-19T08:27:12.120628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lifelong federated reinforcement learn- ing: A learning architecture for navigation in cloud robotic systems","venue":null,"work_id":"be3852ef-b9a5-480e-b288-f652272a2df5","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:54c05afbcfbeecc4ce9dad4b7acfe4f31ebaaa123177164ccc9ea859ed9af99a","observation_id":"c0e337d2-531b-49d5-a644-76028358c161","resolution":{"observed_at":"2026-05-19T08:27:12.026730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discorl: Continual reinforcement learning via policy distillation","venue":null,"work_id":"b9011baa-4c23-4352-bbb6-1992f2045250","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:4ef1f8660c3a09d5fbd69b7b5a4f5341b4afe29f0b4caa2a454505ccda53360b","observation_id":"118af6e2-62a8-4ad1-8ba3-f645e0ae9516","resolution":{"observed_at":"2026-05-19T08:27:12.421526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continual vision-based reinforcement learning with group symme- tries","venue":null,"work_id":"c835ae49-63e8-4bed-8b1a-8893475f21f5","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:ed7e7bd08c2c1cbcbf0aaf28a5afdcf32dbc98f88d65480bcfb7114cf1eae78b","observation_id":"44082620-c4a0-499c-8455-dd0329c42bff","resolution":{"observed_at":"2026-05-19T08:27:12.227470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating continual learning on a home robot","venue":null,"work_id":"8ddee9cf-cc02-4c68-9e43-89a234454dac","year":2023},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d2382c1b546a50122fe3d0491beaa768209253b922ff3de6f538b934f94a6c45","observation_id":"303b791b-35c3-49d4-a128-4311420e6a65","resolution":{"observed_at":"2026-05-19T08:27:12.288214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hanabi challenge: A new frontier for AI research","venue":null,"work_id":"75ab25a7-29bc-49d7-b46f-d4f0c613fe01","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:fcbdac47747f53556bfab9b8e0b3d29ce725237c4e06f6c28b3adbfdfe638ff3","observation_id":"495f9316-a600-41bd-a01c-b05782289478","resolution":{"observed_at":"2026-05-19T08:27:11.987401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"8c44db02-bddf-4428-82b9-0bacd61ed2cd","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:c9581b4c61770a963a586865e5f98a01a00eb192ee2caa0bab708cca3c0cda46","observation_id":"fa2a6d7c-5931-4e10-9d8e-dd7bf093dac1","resolution":{"observed_at":"2026-05-19T08:27:12.283887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using task features for zero-shot knowledge transfer in lifelong learning","venue":null,"work_id":"a6bf9df0-0863-4a91-bc61-9b5ce20e0218","year":2016},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:149cd5cd136bb8462de484f8e387134dcfda14878ead60619572f37922b65b35","observation_id":"91bde47c-78d3-4ab4-b208-4c170d3656f9","resolution":{"observed_at":"2026-05-19T08:27:12.038028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A deep hierarchical approach to lifelong learning in minecraft","venue":null,"work_id":"0c0832e9-f838-4baa-bd6c-43c021f380ed","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:cf28b722a168a2f19f81e64ae9be02de5048f479a5963a6978968c96532a46e7","observation_id":"d0a384fc-ec91-4545-b10c-2a197faad6b8","resolution":{"observed_at":"2026-05-19T08:27:11.951834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.08734","last_updated":"2017-01-30T18:06:07Z","snapshot_observed_at":"2026-08-08T23:54:34.458489Z","submitted_at":"2017-01-30T18:06:07Z","title":"PathNet: Evolution Channels Gradient Descent in Super Neural Networks","version":1},"cited_work":{"arxiv_id":"1701.08734","doi":"10.48550/arxiv.1701.08734","metadata_source":"pith","pith_arxiv_id":"1701.08734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PathNet: Evolution Channels Gradient Descent in Super Neural Networks","venue":"cs.NE","work_id":"67145523-6c66-41a2-a3b0-ceb37c0dc852","year":2017},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/1701.08734","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:49caac1c8d38ae1025844d20e66490f259768c707fad1157622ddb1dd51ae6c5","observation_id":"3ca6ef8f-5e1c-41b5-8d48-ceb974194ed7","resolution":{"observed_at":"2026-05-19T08:27:11.138798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selective experience replay for lifelong learning","venue":null,"work_id":"b8c0d048-28dc-4c66-91c0-ab6565e1a0aa","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:78da9e07e9736e2c736e1107287cb9a91dd56e33a523b0e4001033be3e8b37c1","observation_id":"ee9ec092-6db5-444f-825a-8c8360b50916","resolution":{"observed_at":"2026-05-19T08:27:12.393970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"State abstractions for lifelong reinforcement learning","venue":null,"work_id":"5b64c803-7e09-421f-a7c8-0a25ec7e17d5","year":2018},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:08efbadbc9af5374f9314c39682b623e9688face367bc462a8ff57ff8f8e6765","observation_id":"430f585f-d5e0-4884-bf77-89ed2dde9e5f","resolution":{"observed_at":"2026-05-19T08:27:12.417607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Composing value functions in reinforcement learning","venue":null,"work_id":"ba478965-e19c-43fd-9592-cb3b686a7096","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:b179a75cdfbe5eb5c4cde852cca44a013348029391eb7f71a03ad878cf7981d8","observation_id":"01c0ebe3-3e3e-4411-8bc0-08c0b04746f1","resolution":{"observed_at":"2026-05-19T08:27:11.854198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experience replay for continual learning","venue":null,"work_id":"da2b1011-ddb4-48cc-82ce-97d51e38a065","year":2019},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:f91f5df86751f79adb42993ab274bf734cf3fd7a8f5b4cd741843c9b16cbacb0","observation_id":"c2f767ba-2b53-4386-b31b-71d48db83b35","resolution":{"observed_at":"2026-05-19T08:27:11.618533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model primitives for hierarchical lifelong reinforcement learning","venue":null,"work_id":"ce337adf-fb37-4d1c-a6de-ffbe46267cf1","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d67462da862f161bc6bfe6b0f7c1f10efa4a04a85e82b7ae8eca65e18d06534a","observation_id":"41155558-dce9-4e25-b1b8-49382d35d32e","resolution":{"observed_at":"2026-05-19T08:27:11.960618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning amidst lifelong non-stationarity","venue":null,"work_id":"c5398b90-8632-49da-946c-d35956ddeb9c","year":2020},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:dbc7224ce26e5e8b644109fd5d52c56bfbaa6c53bf967bf0bb4d6c6339c8d358","observation_id":"aa54b45f-78e4-4864-91f0-d07ac192f820","resolution":{"observed_at":"2026-05-19T08:27:11.639980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":88},"total_outbound_references":209},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 209 outbound references and 11 inbound Pith citation observations for arXiv:2506.21872."}