{"as_of":"2026-08-21T01:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88492ddd5620aa478c19b03bd5a3d4c95ab581d5b60bce4867338eaf6439fa7e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:10:19.203780Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T19:24:48.899301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:26.615794Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"cited_work":{"arxiv_id":"2507.09177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09177","snapshot_observed_at":"2026-07-02T02:36:26.615794Z","title":"Continual reinforcement learning by planning with online world models","venue":null,"work_id":"f26d6db0-4821-40c3-8437-0ba8881dc698","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":186,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2507.09177","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:6dfe92a0f0cc5a56ad09204e3f3b03b542ba9dadd6c3a4766026ce8e014ede91","observation_id":"f477ed61-5763-4485-a849-ab24ba3c43b7","resolution":{"observed_at":"2026-05-17T15:14:26.172861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"cited_work":{"arxiv_id":"2507.09177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09177","snapshot_observed_at":"2026-07-02T02:36:26.615794Z","title":"Continual reinforcement learning by planning with online world models","venue":null,"work_id":"f26d6db0-4821-40c3-8437-0ba8881dc698","year":2025},"citing_paper":{"arxiv_id":"2606.03382","last_updated":"2026-06-04T22:09:00Z","snapshot_observed_at":"2026-08-02T02:33:38.414458Z","submitted_at":"2026-06-02T09:26:26Z","title":"Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:51:30.546134Z"},"links":{"cited_paper":"/paper/2507.09177","citing_paper":"/paper/2606.03382"},"observation_digest":"sha256:37e52231fba731b64c9d34c0fbee1a97dcd1a6d6685ede618a9dee69ca7845c4","observation_id":"289902f6-1611-4218-b269-0f3be319bdd3","resolution":{"observed_at":"2026-07-02T02:36:26.617162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09177","snapshot_observed_at":"2026-07-11T19:24:48.899301Z","title":"Continual reinforcement learning by planning with online world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04409","last_updated":"2026-07-05T17:02:40Z","snapshot_observed_at":"2026-08-13T11:30:46.774675Z","submitted_at":"2026-07-05T17:02:40Z","title":"Learning Task-Sufficient World Models by Synergizing Agentic Exploration and Structured Modeling","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-07-11T19:24:48.899301Z"},"links":{"cited_paper":"/paper/2507.09177","citing_paper":"/paper/2607.04409"},"observation_digest":"sha256:f07ca91350c360a588b8a581b132a78df1e82547114bdfc17bc33fce1b1f8342","observation_id":"b8bb22d9-ae2e-47c6-847a-11af09512cfd","resolution":{"observed_at":"2026-07-11T19:24:48.899301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09177/citation-record","integrity":"/paper/2507.09177/integrity","json":"/paper/2507.09177/citation-record.json","paper":"/paper/2507.09177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:15.146099Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.146099Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:bea7cf54489d60947fd1c04e5e59c8a12781d307b8c7bc1ca878415702cc7a12","observation_id":"bcef066c-562c-4fe1-ba23-6bce07c6075a","resolution":{"observed_at":"2026-08-06T18:10:15.146099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.889348Z","title":null,"venue":null,"work_id":"40278b46-72ae-4212-9510-7d0458e3bc94","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.170221Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:e81ee04ddea119c7601c7b0cbb950bce1633bf590c3bccff0828765e92b013ae","observation_id":"a1428363-22f9-41ee-83ee-3a81a56f7c4b","resolution":{"observed_at":"2026-08-06T18:11:19.973952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.726221Z","title":"P., and Singh, S","venue":null,"work_id":"1033e0d9-e7e1-479e-a4c6-7d48f8dffb4c","year":2024},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.203364Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:526bc369f3b91e84992fa2ca41062405e5403287cbfcb27269ee9a68eed65694","observation_id":"3bef8d88-881f-4838-90c0-b3b628cda6a7","resolution":{"observed_at":"2026-08-06T18:11:19.808082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.615489Z","title":"Gradient based sample selection for online continual learning","venue":null,"work_id":"70c82696-1fee-4e02-97b4-072f9f10c6eb","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.245228Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:5da09b4fd08368c75acdb79d6a0de72515d5a77d20b3f73f5686685c1fde98fa","observation_id":"222e613d-4b87-4f7a-b59f-0a43e2adcbf6","resolution":{"observed_at":"2026-08-06T18:11:19.663322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.459960Z","title":"Selfless sequential learning","venue":null,"work_id":"ef86aef4-947b-485c-a964-d3282ca00298","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.287952Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:0bc4240bbbcb8cd919acdbc6c2dcf7875fc23328f2a7de4181167e7efbb1759d","observation_id":"f52bf769-aa2d-482c-a0bd-033c5c328056","resolution":{"observed_at":"2026-08-06T18:11:19.517144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.358226Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":"f791e317-0381-4e6d-82ab-db5a56a5f73e","year":2013},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.322815Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:997d8d3e253f42dbd21c8758901ad35b70923284abfdd73fe3ae81b99905bb4a","observation_id":"b403af44-f0e8-4aba-9ef5-e21207d7242d","resolution":{"observed_at":"2026-08-06T18:11:19.420054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.178308Z","title":"A markovian decision process","venue":null,"work_id":"ee2265e3-491f-4a64-a699-d5828bce7a66","year":1957},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.362639Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:195a2e2794b397e5d0dfe826d084cf3f0bc570ae16cec4837cfee57e8ffef7dc","observation_id":"7654f282-6daa-4a29-91e2-68d2b5fbcb0a","resolution":{"observed_at":"2026-08-06T18:11:19.223912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:19.036331Z","title":"Class-incremental continual learning into the extended der-verse","venue":null,"work_id":"8ebf6166-299b-4980-8853-94a0fde55f9c","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.401256Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:64c426dba2c41ea43dada31e58832b07b3af6fae5dcbba23bb8c5d2387cf6ef7","observation_id":"a01e71f1-fe0c-45d4-b2da-790ffd11e411","resolution":{"observed_at":"2026-08-06T18:11:19.107268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.889335Z","title":"Efficient lifelong learning with A-GEM","venue":null,"work_id":"fd100be4-56a8-465e-9acf-574d0546d50f","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.438261Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:18a13e8a0f199320c85e577bb2c12a3afd1781be19871ed75e12b186d385f312","observation_id":"24baf1fd-cd45-4741-a602-7956ec43e93a","resolution":{"observed_at":"2026-08-06T18:11:18.941144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.811580Z","title":"Continual learning with tiny episodic memories","venue":null,"work_id":"680d36e6-695a-455e-abdc-fb15c5269c6c","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.475347Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:09c2e196ed075815fcef86d98791545eade3b70f5db80b0e139e11ff63d1aa4e","observation_id":"b9e7680b-8b1b-4a3e-80a5-e88a5cc8ec24","resolution":{"observed_at":"2026-08-06T18:11:18.833051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:15.513110Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.513110Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:e89e41e019a0106ca62f657897c62f928fa0da8631a9be9484b36431545fe15b","observation_id":"03b9ab8f-27f1-427e-8697-3abb3aa88aa7","resolution":{"observed_at":"2026-08-06T18:10:15.513110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.684464Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"6dfe9795-6351-4498-afaf-3581fea5b106","year":2020},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.571933Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:b881c6a9cf7f4864641c74e5681e6eff3720295ec1c9958364e6c49e390eefd6","observation_id":"a86586b8-8ace-452e-a33f-ca8228b5ea28","resolution":{"observed_at":"2026-08-06T18:11:18.739423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.569552Z","title":"P., Mannor, S., and Rubinstein, R","venue":null,"work_id":"137e6b58-2d83-485a-b3c1-ee6ef7c07add","year":2005},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.605091Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:70f44c6a505f393e2f4c9aba64b4f63769d14f466496280c91d0b1d7c4a9d343","observation_id":"c8488fd5-6762-45da-8876-c217ef5c9211","resolution":{"observed_at":"2026-08-06T18:11:18.641746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.494071Z","title":"Orthogonal gradient descent for continual learning","venue":null,"work_id":"fcb3bfdf-f00a-4b71-adf3-6ea781a5d0c6","year":2020},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.646313Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:f50413ae79819e1e7bab158dae7ab059a43d08dfac922835cba7d6a10f6fc34d","observation_id":"bba66180-0264-4d0a-853b-d3b57dd244d4","resolution":{"observed_at":"2026-08-06T18:11:18.533855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.392045Z","title":"E., Prett, D","venue":null,"work_id":"f77c5051-fbe0-4fc1-b488-93741223f40e","year":1989},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.774071Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:8388cce0ef33b33137572257fdf496947d9e4f4fcf5fd9339136b42fc15db114","observation_id":"4806d2a2-973d-4563-b189-dec4109d1ea3","resolution":{"observed_at":"2026-08-06T18:11:18.440369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.255029Z","title":null,"venue":null,"work_id":"6d104ec3-0aff-46eb-9449-72f2714a1f90","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.828706Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:1a62f8a5ca21d1939443f4112155decc2330a17726ff896b910d547909ea0a9f","observation_id":"735f65e6-ddd4-446b-8ada-4a9df7c2d61e","resolution":{"observed_at":"2026-08-06T18:11:18.295080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:18.146300Z","title":"Building a subspace of policies for scalable continual learning","venue":null,"work_id":"117d9710-7f24-4e85-9a06-6b61bb34c336","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.884057Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:934ae1a06442428fde707c0ca14a6a244f87f49f9fad8379b30e8a03558f9f91","observation_id":"87b97f19-ff11-477c-bdb8-802b38c5f9bc","resolution":{"observed_at":"2026-08-06T18:11:18.221087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.988475Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"6375935a-1375-408c-8f98-8a52d40313e2","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.940751Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:6ae27ba976ab44e5f92a51b005fcbd8ab42bf30d5050c954503507174037ac72","observation_id":"7dd5b270-61f1-4a4e-ac3b-cbff40db3651","resolution":{"observed_at":"2026-08-06T18:11:18.077729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.753741Z","title":"K., et al","venue":null,"work_id":"ec3af1b6-0d40-4faa-aefa-aaaadf99d9dc","year":2006},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:15.997879Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:32b4f671686b815d889990f77885265f20172f21cfd1c41c1b007e4600d49543","observation_id":"2c32fd81-cccc-402b-a755-74a42ac606f3","resolution":{"observed_at":"2026-08-06T18:11:17.934115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.691211Z","title":"Continual model-based reinforcement learning with hypernetworks","venue":null,"work_id":"d3b4ec7e-49e1-44a7-8cb5-c1f492f5f2a7","year":2021},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.074901Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:6c398365b72745e9457c6243ae409ae261dd5476ccb71ce639a88695ee5a8897","observation_id":"7432bbca-23d6-4717-845d-783972b524e0","resolution":{"observed_at":"2026-08-06T18:11:17.739091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.555294Z","title":"A theory of universal artificial intelligence based on algorithmic complexity","venue":null,"work_id":"10b7140b-87b9-40f6-a2a5-7e874a133fe2","year":2000},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.168793Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:7658f9400e9d639b478d9a9feaa99fe526da47b8dbffaf905b6e8ca09c20fbae","observation_id":"1231d891-ef7e-40fc-ba0f-6b350745ef2d","resolution":{"observed_at":"2026-08-06T18:11:17.626556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.484963Z","title":"and Cosgun, A","venue":null,"work_id":"08eab233-6f03-4f1a-a398-fddc08e662ed","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.231032Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:77d7c989d5421437f0853ccbd8c34f3e61c47af3cc53a8cd417326c212891c5b","observation_id":"d0b8e610-57df-4736-9afd-ba62473f840c","resolution":{"observed_at":"2026-08-06T18:11:17.518041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.339181Z","title":null,"venue":null,"work_id":"34fc8bce-5155-46f6-80d6-fdc550628f63","year":1984},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.306480Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:a0f4181cde3e81361b230ebf1c8251e5b861cf281fd269da919a82ffd44daf57","observation_id":"d9d65a93-6dde-4dc3-9a1a-b8862b131f64","resolution":{"observed_at":"2026-08-06T18:11:17.394837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.187072Z","title":"R., Hwang, S","venue":null,"work_id":"d0c504ff-abf7-45f5-9226-a1e4fadda44d","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.382778Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:32916c478578a1c8eaeb600b01baeadf63b099c53f4ba71ae6bdf98571bac562","observation_id":"fb3d6e27-a890-42f3-8b73-d412c66b0039","resolution":{"observed_at":"2026-08-06T18:11:17.252092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.149839Z","title":"J., Zohren, S., and Roberts, S","venue":null,"work_id":"22797d2c-0934-4311-9145-f9167978b20f","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.450734Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:94e9c8bafa28ad372b0a486431c6f9e0b94b58259ba9ab7b0574949e3d9c1f58","observation_id":"af2c2f29-c797-4ed1-8bf8-0865b9f59b3d","resolution":{"observed_at":"2026-08-06T18:11:17.162487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:17.058739Z","title":null,"venue":null,"work_id":"2f39d8e6-a2d9-44eb-a06f-ed6001977daa","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.525313Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:d058fa484bc9f20ecfb41630e0a38ce89cdfa3a1fbab9f3b750454afd788e067","observation_id":"aa13dbb3-1635-41ec-a7bc-caeb50cfb20b","resolution":{"observed_at":"2026-08-06T18:11:17.129523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.965547Z","title":"Towards continual reinforcement learning: A review and perspectives","venue":null,"work_id":"bfe62a82-463d-4738-860a-bb5ea59a26b8","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.635145Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:c766241c6cf3d5f67b5ea09ead107d10c630b64f591cadb729432fe34b6df4cd","observation_id":"76988404-6cc3-4711-bfd3-8f78e750082a","resolution":{"observed_at":"2026-08-06T18:11:16.999266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:16.731665Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.731665Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:c7eff46bb6c455f87a166d8bef090bbd903a5e5bba2ec347f456c46c5e9f4c42","observation_id":"7d2667ea-0b44-435a-8f5e-51689b3a4949","resolution":{"observed_at":"2026-08-06T18:10:16.731665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.851283Z","title":"A., Milan, K., Quan, J., Ramalho, T., Grabska-Barwinska, A., et al","venue":null,"work_id":"81545bf3-71a2-4905-9458-db0952ff95f7","year":2017},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.781120Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:cbbccd84ffbfed0d0627d91f8b94692589fafb9f61cfaad47e55820d471e6a54","observation_id":"87b20be5-795c-4899-8e7d-7adad73193e9","resolution":{"observed_at":"2026-08-06T18:11:16.906941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-06T18:10:16.832020Z","title":"Ai2-thor: An interactive 3d environment for visual ai","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.832020Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:758a1835d1cbef19f1d6200ed3e7917db4d422ddac408f6bad2f9c8350f2ae2d","observation_id":"dd1b8742-3c0b-4850-ac32-dc19d36c1a78","resolution":{"observed_at":"2026-08-06T18:10:16.832020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.743137Z","title":"u ttler, H., Nardelli, N., Miller, A., Raileanu, R., Selvatici, M., Grefenstette, E., and Rockt \\","venue":null,"work_id":"7ed37d4f-05eb-49b4-9db6-aa09e9da7f44","year":2020},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.889860Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:1cb5c36ff98909c7c0bf8ae04773869502bb2a7dcb48e91ef46d5f2c5b085bf0","observation_id":"edd5aaa1-ab79-4980-92a4-8921934cbc10","resolution":{"observed_at":"2026-08-06T18:11:16.801382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.564134Z","title":"S., and Lin, M","venue":null,"work_id":"82847211-9604-40cf-b6be-913d9f6d1d5e","year":2024},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:16.964447Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:f3c5e0e500a04189650279f3630aa436fb760d6e83e6bc2d571f391572d2e2bd","observation_id":"e45eaaae-6a69-490a-a0f2-98975964f710","resolution":{"observed_at":"2026-08-06T18:11:16.658919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.423657Z","title":"and Lazebnik, S","venue":null,"work_id":"83880b18-79bd-4299-87a1-93282c1ea3c9","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.095740Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:1ae0875aaf590574b643b532b0fffa7937a5143e9a1836dfb9e3b173fa25813b","observation_id":"51524395-bfbd-4be1-ae87-baac32b95709","resolution":{"observed_at":"2026-08-06T18:11:16.471864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.273400Z","title":"Deep online learning via meta-learning: Continual adaptation for model-based rl","venue":null,"work_id":"5dfe2078-432f-487c-a14b-3773e2618f8c","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.212292Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:d78d369370301c24085e0e92209ea1047da8c411b9cb1aecce7c10ce31c93b9f","observation_id":"9ce9e3f1-959b-482b-a229-0fe5e5776b5a","resolution":{"observed_at":"2026-08-06T18:11:16.353061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.250504Z","title":"R., De Schutter, B., Wiering, M","venue":null,"work_id":"9f98e5fa-dd57-44d2-9af3-380e40b2a863","year":2005},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.298275Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:c5fd05f3b757f9ed977146aae15f51585ec59a3ce22d33c7dbcd6dcb657e993a","observation_id":"d2104027-d851-4333-ba15-e566b568854d","resolution":{"observed_at":"2026-08-06T18:11:16.259082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:16.049058Z","title":"and Vidal, R","venue":null,"work_id":"1ade92c1-1566-4931-a193-d5769c20562d","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.373685Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:eb4c0ebb7cccedba25ae2709dd63db02809315a8a0cde50a93d8688b8b516f29","observation_id":"d0299dec-4fab-402a-b3e2-d175b8d33653","resolution":{"observed_at":"2026-08-06T18:11:16.145695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.908856Z","title":"V., and Vidal, R","venue":null,"work_id":"3c24397d-0099-4946-aad8-cc8ef6ec7dd4","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.440877Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:843aa4accc6831cd4b87a0c477e9dd94ac61aadf8ee6642953550934177e1e33","observation_id":"3884e2c7-1e0c-4e97-b4c0-114dd928cec7","resolution":{"observed_at":"2026-08-06T18:11:15.968542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.831651Z","title":"O., and Calandra, R","venue":null,"work_id":"2ff51de0-10d8-4a8a-9ed4-2f92cdc6109f","year":2021},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.529574Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:e67fa173a43fc6d536b04796b6bec2385a91df4bc96c0a9b66b12f0bfd611981","observation_id":"477a1953-439a-4b86-8e8d-a78d2bbf0d10","resolution":{"observed_at":"2026-08-06T18:11:15.857791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.699281Z","title":"Sample-efficient cross-entropy method for real-time planning","venue":null,"work_id":"9c6f0597-1618-459a-96fc-be35bebc034b","year":2021},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.625496Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:081f4695a75587dcbeb4a97437fbd40a1a9a224eed9cd1d5897fdf10742ff071","observation_id":"70a7bfb6-2d6a-4799-8535-c0e3911b44bb","resolution":{"observed_at":"2026-08-06T18:11:15.756384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.575478Z","title":"Cora: Benchmarks, baselines, and metrics as a platform for continual reinforcement learning agents","venue":null,"work_id":"d8e1a9a5-8fe1-42c1-a4f3-3976ae9b56f2","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.698008Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:d9f6cc7abc2e1c71d5dd027a3b33624c4680bdbc65fae9a6512ccd130dd1d40a","observation_id":"ea16f5d9-736c-4f97-8771-f2d6264ad600","resolution":{"observed_at":"2026-08-06T18:11:15.616354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.544326Z","title":"Learning to learn without forgetting by maximizing transfer and minimizing interference","venue":null,"work_id":"1b82d66a-7150-4402-a035-94c8bc31a9f1","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.754884Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:ac8e2738a387c99622678fd683f401a397f6deec884c1cac6c65c54f38f1d3e6","observation_id":"d4f7d7f4-8338-42c5-a0cb-1f810958a38e","resolution":{"observed_at":"2026-08-06T18:11:15.553428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.496969Z","title":"Experience replay for continual learning","venue":null,"work_id":"9ef1e237-c397-4d7e-a9ca-f6c5e99ced31","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.807528Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:14a46870e4db23d9d480675a8cbc402367c9a45f115d594ca656f66446a78379","observation_id":"f232caa8-7826-467d-98a3-01518d114fce","resolution":{"observed_at":"2026-08-06T18:11:15.527004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.391829Z","title":"The cross-entropy method for combinatorial and continuous optimization","venue":null,"work_id":"79cf0c05-7929-443f-b34c-396910a30550","year":1999},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.916005Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:27efe47597ee8c89e743720d7cbaefcd666c83aa7752ed3ede82acf6bb8f5d1c","observation_id":"87c44d83-294b-4227-9b40-e659a84e8c8f","resolution":{"observed_at":"2026-08-06T18:11:15.435368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.305401Z","title":"Curious exploration via structured world models yields zero-shot object manipulation","venue":null,"work_id":"201c047d-e495-40f7-9cf7-8786b13880e9","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.986840Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:ff9afd526c725656104adc8eabc8e4bb8c7ce4f004f002b29a95069c4d19b8c3","observation_id":"adf74431-fe53-4ee6-a69b-d0fa59e045d3","resolution":{"observed_at":"2026-08-06T18:11:15.338379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.192442Z","title":"M., Grabska-Barwinska, A., Teh, Y","venue":null,"work_id":"a5c88f9a-b46a-4017-b7db-417b88d40ca5","year":2018},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.059835Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:35342f5a65e95f88cde3098d05329ad83454dda45e09f001e8b6abe2df77f071","observation_id":"6b726db6-5975-45df-b231-b5696bf2a301","resolution":{"observed_at":"2026-08-06T18:11:15.258193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:15.085083Z","title":null,"venue":null,"work_id":"790ea76c-c8eb-4786-a87a-45c02f326abb","year":2012},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.127946Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:faab9dccfb90443d1ee09808fff90d474fad108b4ae0e1e6ba00a5d84cab577a","observation_id":"c1cbf20f-c36a-441b-a36b-5366a0c145d2","resolution":{"observed_at":"2026-08-06T18:11:15.123043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.985764Z","title":"Autonomous reinforcement learning: Formalism and benchmarking","venue":null,"work_id":"10f2cb79-6338-4a1c-82b9-151329bdba99","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.218857Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:46297f0b4d43356aa7abe9485f7d080226a9d48c53ab71a7b639c1381120487e","observation_id":"36674e8b-0cdd-4ef2-a85c-3c37a992cdf2","resolution":{"observed_at":"2026-08-06T18:11:15.029920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.923187Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"bbde7d9d-f6cc-4816-9467-1f0a29e2f92d","year":2020},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.273145Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:59feab281d2a22d753d64f62a8b103812662414d7b39cf84d9c9e95b3c1b53c2","observation_id":"187b17b3-fbb3-47e8-b78c-bc6a6075ade2","resolution":{"observed_at":"2026-08-06T18:11:14.929917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.882902Z","title":null,"venue":null,"work_id":"2adf56a7-c4e3-4fe4-8031-7675075dc2b2","year":1990},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.318361Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:708b273715cd062600021b132a91806b93a78b9105b00174b649b6477bbecc73","observation_id":"ae1e6d2b-ad26-4669-811a-b8dbcf469a76","resolution":{"observed_at":"2026-08-06T18:11:14.902729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.819966Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"793e05bf-817f-40ce-bbd1-1859f99cbf6a","year":2012},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.380419Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:d6e047c052fb9c6a75ee1680ecdd6f01a3ae0d771719b8313ae1ec45654c96d8","observation_id":"2289b0f7-af4c-40f8-8a28-f763a7cb7df3","resolution":{"observed_at":"2026-08-06T18:11:14.838708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.695565Z","title":null,"venue":null,"work_id":"da750a7f-8231-4ef8-981b-5b539437829b","year":1985},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.454588Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:7e155d0a513a3ff9bfbd88b21235fadc94252744ba76c79275d58799430223bc","observation_id":"2bc98a74-7c0c-4211-bf50-332b3052b698","resolution":{"observed_at":"2026-08-06T18:11:14.755578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.568569Z","title":"and Ba, J","venue":null,"work_id":"c2d71d40-8cc4-4e8c-b189-70203b5b7b40","year":2020},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.530369Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:acc46db242c5dbc778a413b3762cc667ae9a3ac442834607a574351a0a4212fa","observation_id":"9465a9fc-214e-4397-b9f4-cf242043823e","resolution":{"observed_at":"2026-08-06T18:11:14.610854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01149","last_updated":"2015-10-28T13:23:51Z","snapshot_observed_at":"2026-08-14T22:33:53.863727Z","submitted_at":"2015-09-03T16:18:30Z","title":"Model Predictive Path Integral Control using Covariance Variable Importance Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01149","snapshot_observed_at":"2026-08-06T18:10:18.638329Z","title":"Model predictive path integral control using covariance variable importance sampling","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.638329Z"},"links":{"cited_paper":"/paper/1509.01149","citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:3a9071d016319ce7a83877eae306267e5f057ccd9fe551e06a12addcd9770258","observation_id":"2ba237eb-ed53-4787-ba6c-59981f511b95","resolution":{"observed_at":"2026-08-06T18:10:18.638329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.464155Z","title":"Continual world: A robotic benchmark for continual reinforcement learning","venue":null,"work_id":"e4dfbdf0-53c8-445d-bea1-f786ad4352a1","year":2021},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.750710Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:2c2edeac4fb7b2985affe5b4be5fcc2026fc71ee5b87f1f701cb700da6c6ae4d","observation_id":"238598ba-ef15-4136-8ce9-e21085f140ff","resolution":{"observed_at":"2026-08-06T18:11:14.518922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:11:14.354926Z","title":"Continual task allocation in meta-policy network via sparse prompting","venue":null,"work_id":"e3c3c168-c62c-48ee-82b0-8934dcd5a428","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.806077Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:335d860389188934e3d3effb411f8053ffc7bf9bc57faa7da2c91b61364d30e7","observation_id":"f0b98d82-4964-4612-90d2-2583f87170d5","resolution":{"observed_at":"2026-08-06T18:11:14.418368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.950996Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"aeb983e4-66c6-4159-8923-77e63f11b009","year":2019},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.908717Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:9316ce4dabd5e9eb3850654a7dae96f46b67ed239e7604b301a7cbaeccf3ed32","observation_id":"438b62fe-351d-46cf-bf4e-e9796a7295cc","resolution":{"observed_at":"2026-08-06T18:11:14.267972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.846621Z","title":"Continual learning through synaptic intelligence","venue":null,"work_id":"2ed4c26a-df0b-4cef-b7a0-78d1b9e385a9","year":2017},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:18.974652Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:ac440f84b20b861e330eb72566a8146f19ac3924163da42ebafcbe8c565577f7","observation_id":"c36e89c5-84d1-4553-94a0-59853dfb233f","resolution":{"observed_at":"2026-08-06T18:10:19.891697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.643665Z","title":"The Schur complement and its applications, volume 4","venue":null,"work_id":"c36056ef-06ee-4805-af4b-98e64d76c4d2","year":2006},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:19.057358Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:09f70606ff2219bdd29cf49dc65fea45c167b8c5c1234b202636a49f31e793d3","observation_id":"61f55a7f-cb68-44fa-b2b9-84baa3f27b02","resolution":{"observed_at":"2026-08-06T18:10:19.723179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.535413Z","title":"ACIL : Analytic class-incremental learning with absolute memorization and privacy protection","venue":null,"work_id":"df0cbf0f-8027-4a22-955a-57bd7f4c75ea","year":2022},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:19.108937Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:021a01dd1461f0258674963031f7c2ffa3f214dd4348cbd7725515ea7cedd7be","observation_id":"29fabc1a-1ff6-4b94-9699-6590b2f89abe","resolution":{"observed_at":"2026-08-06T18:10:19.581119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.429289Z","title":"GKEAL : Gaussian kernel embedded analytic learning for few-shot class incremental task","venue":null,"work_id":"4e600116-88ee-46d4-b203-e77ac4af4446","year":2023},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:19.154747Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:ff12f6e3e631209835f3a8567b10b90c8e4adce3b206dc43e6e371a07adc1ab4","observation_id":"572e2b75-52be-4b2c-86cd-ae47ff919a37","resolution":{"observed_at":"2026-08-06T18:10:19.459214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:19.301921Z","title":"DS-AL : A dual-stream analytic learning for exemplar-free class-incremental learning","venue":null,"work_id":"960cf34f-2996-4878-bcde-b4e0ac8f5fcd","year":2024},"citing_paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:19.203780Z"},"links":{"citing_paper":"/paper/2507.09177"},"observation_digest":"sha256:b2b5a82493b32cfe58e4cad4c4c44561c50de614b25ee317489f841ff1c6a97a","observation_id":"69969800-dead-4048-a9d5-4e087eb8d5b2","resolution":{"observed_at":"2026-08-06T18:10:19.377619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09177","last_updated":"2025-07-12T07:52:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T19:49:11.833916Z","submitted_at":"2025-07-12T07:52:31Z","title":"Continual Reinforcement Learning by Planning with Online World Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 3 inbound Pith citation observations for arXiv:2507.09177."}