{"as_of":"2026-08-18T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8606a1cb2d25d171a94dcf6cbe8cfdb4914063dfa1c5098181d2c0c295a4e528","coverage":[{"denominator":246,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:16:00.018724Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.10330/citation-record","integrity":"/paper/2505.10330/integrity","json":"/paper/2505.10330/citation-record.json","paper":"/paper/2505.10330"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.069279Z","title":"Mastering the game of go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.069279Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7eef9ae03a06cfebe77777ad29f93afdc6a45861050088aa39b4b77610d98185","observation_id":"8bb213dc-9450-46f7-b3fd-2b6099c64b29","resolution":{"observed_at":"2026-08-15T21:15:59.069279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.077876Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.077876Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:238f4c8c0ff78dc99594761d3aab73cc1b969c23801262111c687a75d47c6468","observation_id":"f1d598b9-b60d-44cb-bcea-26b056cab1bf","resolution":{"observed_at":"2026-08-15T21:15:59.077876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.084850Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.084850Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:19b50b31180d30e414790e753d0b25890ff3db9abcb98247d0a7f0ac8e2c19f0","observation_id":"c49256e1-822a-4cd1-9957-b794514bb4ab","resolution":{"observed_at":"2026-08-15T21:15:59.084850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T21:15:59.091559Z","title":"Dota 2 with large scale deep reinforcement learning,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.091559Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:52fde7554fdbb3ffe2cac32683bfb07192277df89d94511c5244c36529839a13","observation_id":"c5f77ab1-08bf-4a91-b0e4-b52429619df8","resolution":{"observed_at":"2026-08-15T21:15:59.091559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.099808Z","title":"Agent57: Outperforming the human atari benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.099808Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5c3b4ba69b85ca0da03ad41e6cf7690866bcb2f19f76b5ecffb4c9faa78763dc","observation_id":"8549a4f1-5811-4511-98c9-6885b84f8aee","resolution":{"observed_at":"2026-08-15T21:15:59.099808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.113283Z","title":"Reinforcement learning based recommender systems: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.113283Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c75679b90fe0bad6399859bb884db594ca08901091096837741ec3aee95df049","observation_id":"a9ad6ea3-71c7-494c-9814-82a1b315d9e0","resolution":{"observed_at":"2026-08-15T21:15:59.113283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.126194Z","title":"Deepmind ai reduces google data centre cooling bill by 40%,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.126194Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:303de7c2fa97ff1ad70d5a09382aa6503ad9749384cfdd5ee8f5f209458eda76","observation_id":"8787a233-f3d0-4d8f-9132-a9af6cf52f1d","resolution":{"observed_at":"2026-08-15T21:15:59.126194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.133657Z","title":"Gnu-rl: A precocial reinforcement learning so- lution for building hvac control using a differentiable mpc policy,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.133657Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:721d4fa2cb7e219415c4ff96e774cf4d49eb25f06b338331dfdd8b3c542c1083","observation_id":"646eedef-cc8e-4f49-b633-505c07d9fab7","resolution":{"observed_at":"2026-08-15T21:15:59.133657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.145334Z","title":"Magnetic control of tokamak plasmas through deep reinforce- ment learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.145334Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:072cd6e6827c90765d4c6413a1d5a1454fa8dde7f6a29cd8b5fd65535dab1097","observation_id":"b0a39276-513c-4fb5-9374-9fa80e2814a4","resolution":{"observed_at":"2026-08-15T21:15:59.145334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.155739Z","title":"Adversarial policies beat superhuman go ais,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.155739Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:858c720babd1972d002623d6f4118250928d5d11cf6af02e9ed17f51e5aa0310","observation_id":"7edde538-4863-4b5a-83d5-8bfb448839a6","resolution":{"observed_at":"2026-08-15T21:15:59.155739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.161373Z","title":"Adaptation in constant utility non-stationary environments.,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.161373Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9a152ae04b47428c2bfa395d880e4aea4e715a2c00a6c46dc13527e7ceeb4617","observation_id":"af2d9cac-75a0-4ae1-b2b1-61604bdac3ad","resolution":{"observed_at":"2026-08-15T21:15:59.161373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.175120Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.175120Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a2dabe18e87d25324f40630d268540a4b95cfd0d11f2a5c40e06791464d6e24c","observation_id":"074e49ff-b87b-447a-a19c-54a6f7d03619","resolution":{"observed_at":"2026-08-15T21:15:59.175120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.181875Z","title":"Impact of timing in post-warning prepositioning decisions on performance measures of disaster management: A 163 real-life application,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.181875Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7e51f0ab076da28caea9582b8a6a1c69d2d7611d0695fdc17bcbd82e53c8db27","observation_id":"a2369159-0aec-464f-976d-cbb0314a3961","resolution":{"observed_at":"2026-08-15T21:15:59.181875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.190382Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.190382Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:75e541042ae80f5b2ddc0c3f6e4534efd7a6e1fe17f441f2ae1247f3694b4ef5","observation_id":"bee051dd-7a95-4a27-a96b-1dbfbd3ba6f1","resolution":{"observed_at":"2026-08-15T21:15:59.190382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.198548Z","title":"Learning optimal adap- tation strategies in unpredictable motor tasks,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.198548Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:cac6bf4fb256da7e7538a522f680ca1f40b3eeb40d3de680233a1ab2539203b7","observation_id":"f6f5d207-465d-4eeb-ac17-ec1b171158f6","resolution":{"observed_at":"2026-08-15T21:15:59.198548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.210439Z","title":"Reward learning: Reinforcement, incentives, and expectations,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.210439Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:92d9e056676aad29f5632f0f430691a8aa9b9fae9af328acc2a1f10f40f60551","observation_id":"f8612988-d5f0-4eef-9623-d2bd9a89fe36","resolution":{"observed_at":"2026-08-15T21:15:59.210439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00010","last_updated":"2021-01-14T22:29:59Z","snapshot_observed_at":"2026-07-06T09:34:12.558713Z","submitted_at":"2020-06-30T18:00:01Z","title":"Towards precision holography","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00010","snapshot_observed_at":"2026-08-15T21:15:59.221123Z","title":"Inte- grating animal temperament within ecology and evolution,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.221123Z"},"links":{"cited_paper":"/paper/2007.00010","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c6ae27afeef3760e952f5bbbecb2408402b91d665c5607214eddcbad1167fe37","observation_id":"d62bc700-fd5f-499a-90a3-9ed6e906c8ec","resolution":{"observed_at":"2026-08-15T21:15:59.221123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.227562Z","title":"Deep neural networks for youtube rec- ommendations,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.227562Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a42ff1e70d7b7aaefb3b070fcf114e14bd77030271417ac3865943c9fe764489","observation_id":"c23d9383-47bb-428d-a8c1-3c1eb5e75a59","resolution":{"observed_at":"2026-08-15T21:15:59.227562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.236715Z","title":"Scheduling on a budget: Avoiding stale recommendations with timely updates,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.236715Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a388e868e70a89d5d2c2cf0abc6e3db39130142911c38bba5ccfb0da674c252a","observation_id":"1accb39b-d7ba-4401-9899-aa4f85be4955","resolution":{"observed_at":"2026-08-15T21:15:59.236715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.249385Z","title":"Catastrophic interference in connectionist net- works: The sequential learning problem,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.249385Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c97b03fd41cbecb0614ac87c1aaeb9b6d3f2918c054ede5fb682b9baa4ee9431","observation_id":"ab83c578-080a-4238-abbc-def669a488b2","resolution":{"observed_at":"2026-08-15T21:15:59.249385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.257424Z","title":"Learning to predict by the methods of temporal differences,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.257424Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1cf2a103ef624f0d554e2f9e54adcc2a651f5fe733280c2f808e9eb7acdc8b54","observation_id":"3b8e47fc-3c03-43bf-86b5-4a19971b3148","resolution":{"observed_at":"2026-08-15T21:15:59.257424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.267179Z","title":"Analysis of temporal-diffference learning with func- tion approximation,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.267179Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ddbcf96aa2cd68261d2cd2ec1ac3cf0a27af5fc060ef2ab69fe24fb680490801","observation_id":"a86c677b-3431-4fd4-b80d-033953f4dd8e","resolution":{"observed_at":"2026-08-15T21:15:59.267179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.277183Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.277183Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f2ecb67636555a6be34cf8525144175fab3f81e443416cb646a9aa363184b302","observation_id":"3c6ccfc8-6e62-4ea6-9593-08ac31f9e694","resolution":{"observed_at":"2026-08-15T21:15:59.277183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-18T08:00:35.342323Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-15T21:15:59.289096Z","title":"Deep reinforcement learning and the deadly triad,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.289096Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:273d9f0cab69e30ce2047e2186e51d46d81434757e4e3d42db05517cfce5efc3","observation_id":"0c6c19b7-8dff-4885-a1c6-a42f99cfcad4","resolution":{"observed_at":"2026-08-15T21:15:59.289096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.299736Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.299736Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:17da7e60d62cbf87f03277934fc4ff451a2b807c33c6fdff0d75f78617da9dfd","observation_id":"f7e9ba2d-1b8c-498f-95b0-416f42011241","resolution":{"observed_at":"2026-08-15T21:15:59.299736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.309292Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.309292Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:6ff797fe42689388edd60d11428f7c1815b644f58fb0a849dc2d715a453d7efa","observation_id":"35b57e3e-b9be-41c7-ba46-c22dc1ce44b0","resolution":{"observed_at":"2026-08-15T21:15:59.309292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.316184Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.316184Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:33c1b846381f226c507b9cf42cf094b2604d5baff250490fd4b8549a11f5f089","observation_id":"a41617e8-6cbd-47b7-b593-472866fd3b01","resolution":{"observed_at":"2026-08-15T21:15:59.316184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.324781Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.324781Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:105c671248f6804923c08d134c083c9f7438c3af680e2d8532321778b2cae625","observation_id":"16062bad-540c-40c8-8a77-2a1b55b195bc","resolution":{"observed_at":"2026-08-15T21:15:59.324781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.335060Z","title":"Distributed distributional deterministic policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.335060Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f349b659b7bdcab3b813610fb83bdc352b012751a0ab0a620851c3e20c86ea3d","observation_id":"945f7532-0f0b-4353-ae67-1ee4d13088d4","resolution":{"observed_at":"2026-08-15T21:15:59.335060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.346698Z","title":"Scalable trust-region method for deep reinforcement learning using kronecker-factored approximation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.346698Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:91fcb0acd78c478380a972d7df55fe17e0d79711d26cba281987fe58772898a9","observation_id":"62c1d1da-3bcd-4d85-8c46-9edcb8be888e","resolution":{"observed_at":"2026-08-15T21:15:59.346698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.354303Z","title":"Soft actor-critic: Off-policy maxi- mum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.354303Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b656c6bf1a959c2bf4d8a71007837933e089e96cafefcf7636f21de3aab3ff57","observation_id":"02d67d68-b000-47bb-a1dc-d36558a3c55f","resolution":{"observed_at":"2026-08-15T21:15:59.354303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.369754Z","title":"Trust region pol- icy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.369754Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fac90eca9881345da34784aef0e39c3dd7b34cf5ed9403f71750f568523a97a0","observation_id":"58588fe6-dc46-4e88-aba3-8b8681a924ef","resolution":{"observed_at":"2026-08-15T21:15:59.369754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:15:59.377816Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.377816Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:0bc43f1ba70bc05e345b23511ee046404a8121c39985425ed49b240855780aae","observation_id":"88e42701-3dea-44a9-99d1-2e07398935cd","resolution":{"observed_at":"2026-08-15T21:15:59.377816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.384898Z","title":"Dyna, an integrated architecture for learning, planning, and reacting,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.384898Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:646b0ffb0d38d6791fa188190255e0d0ba99f4d3c96d5f70977fddea158574cc","observation_id":"dd4d2e19-2898-4e64-bdbc-e559d47f153a","resolution":{"observed_at":"2026-08-15T21:15:59.384898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.395462Z","title":"First return, then explore,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.395462Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:23f5865f21c338f8839a67f282c85ddf074ba55a8982c79d8c4eb18c148af8f9","observation_id":"6bb3b444-52e1-4069-b7d3-3ef783a3f54f","resolution":{"observed_at":"2026-08-15T21:15:59.395462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.406216Z","title":"Learning latent dynamics for planning from pixels,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.406216Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:54486701b0ab2daf8d0301b1c4f77c4d7481db1e8dc6ad8cae339b8d20d1850a","observation_id":"4a0ed717-3cb0-47e0-9674-b2ce1d30610f","resolution":{"observed_at":"2026-08-15T21:15:59.406216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.418445Z","title":"Curious model-building control systems,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.418445Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:dd8c5b29a63b44ef5822e4472ea4c58ecd1d7ad4aa23f29969e1665cb72c1e9a","observation_id":"6ec25d40-c564-4cfc-9958-99194229e867","resolution":{"observed_at":"2026-08-15T21:15:59.418445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.09249","last_updated":"2015-11-30T11:35:26Z","snapshot_observed_at":"2026-08-14T22:20:45.647783Z","submitted_at":"2015-11-30T11:35:26Z","title":"On Learning to Think: Algorithmic Information Theory for Novel Combinations of Reinforcement Learning Controllers and Recurrent Neural World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.09249","snapshot_observed_at":"2026-08-15T21:15:59.428205Z","title":"On learning to think: Algorithmic information theory for novel combinations of reinforcement learning controllers and recurrent neural world models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.428205Z"},"links":{"cited_paper":"/paper/1511.09249","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:47a910fcb219eb4088352671149e852c00b3a73b2323adc4ca2ff5a6011ec7e0","observation_id":"f56d2ea2-50f9-4060-9e51-c18d150b418c","resolution":{"observed_at":"2026-08-15T21:15:59.428205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.437614Z","title":"Recurrent world models facilitate policy evolution,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.437614Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:05028ff17533be3db5036820acf988e703e126029a2b0b16e310a46ac8ca86af","observation_id":"18c87a44-82aa-4a6c-a073-bbf03641872c","resolution":{"observed_at":"2026-08-15T21:15:59.437614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.448190Z","title":"Dream to control: Learning behav- iors by latent imagination,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.448190Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:634b606588faf5d119471162178cd7cb6623ce79eed0dd699b42e3a44b511476","observation_id":"ed22c21e-7630-4db0-bb89-f39ec53129d3","resolution":{"observed_at":"2026-08-15T21:15:59.448190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.464751Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.464751Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ff8f03683a6968948d89f3e23530dc317af129301c7eac61c9382cf63f594f40","observation_id":"7fc91ebd-9bd0-4bde-b830-847e45b5a062","resolution":{"observed_at":"2026-08-15T21:15:59.464751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-15T21:15:59.472534Z","title":"Mastering diverse domains through world models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.472534Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:4f2f770ad93cb6e62e9697218f3bf8c71188af65d893c5ab26685d43795fe382","observation_id":"f04e09b9-1be3-458e-aa98-d378d4291cd3","resolution":{"observed_at":"2026-08-15T21:15:59.472534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1259","last_updated":"2014-10-07T18:08:30Z","snapshot_observed_at":"2026-08-14T23:20:50.864190Z","submitted_at":"2014-09-03T21:03:41Z","title":"On the Properties of Neural Machine Translation: Encoder-Decoder Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1259","snapshot_observed_at":"2026-08-15T21:15:59.485835Z","title":"On the proper- ties of neural machine translation: Encoder-decoder approaches,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.485835Z"},"links":{"cited_paper":"/paper/1409.1259","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a13da214e2b37661c843b65663aa68206282d3f08c417dfd6a45c11801789173","observation_id":"5b345e16-a794-4728-a06a-8084bf0f0700","resolution":{"observed_at":"2026-08-15T21:15:59.485835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.492201Z","title":"Convolutional networks for images, speech, and time series,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.492201Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7dc7a1c2c331cdf63d2300c24c20132ddf3bff85f05ce902568a3a862b40328c","observation_id":"67b5deec-6cfc-4b56-b67c-f299ef73d8bd","resolution":{"observed_at":"2026-08-15T21:15:59.492201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-15T21:15:59.498195Z","title":"Estimating or propagating gradi- ents through stochastic neurons for conditional computation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.498195Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f63c3e0148f4b8a6786458e66534310e444557b0a9ee7b252185519f0bc96597","observation_id":"c7d134be-e586-4825-9cd3-1e8f6610bc10","resolution":{"observed_at":"2026-08-15T21:15:59.498195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.507948Z","title":"Dm control: Software and tasks for continuous con- trol,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.507948Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:93283fae29074cf2c45d40f1fe6c67864feea302b2bdc5bdf918e653c1fcd4e8","observation_id":"6f2691ef-5777-46ef-b275-9dfce39284dc","resolution":{"observed_at":"2026-08-15T21:15:59.507948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.515230Z","title":"The arcade learning environment: An evaluation platform for general agents,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.515230Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:d08943720846db66082f7a8bd99f35df353d24bf934cc6c89241f4ec2aed19b5","observation_id":"0e902dc0-ae37-426c-976e-cd0e7fdcf3c7","resolution":{"observed_at":"2026-08-15T21:15:59.515230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.521131Z","title":"Policy invariance under reward transforma- tions: Theory and application to reward shaping,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.521131Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b7f3f07a4b8e92bc23d226f36bd6864e1e5b3f9e75560e29c4ef2f04b41d743d","observation_id":"373b9b0a-ee95-4973-9969-b4f351d66902","resolution":{"observed_at":"2026-08-15T21:15:59.521131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.530020Z","title":"Self-improving reactive agents based on reinforcement learning, plan- ning and teaching,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.530020Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:08f324b65264fa8128ffee7f926f228c638fd5d9a18b1aea4a771f4004ea639a","observation_id":"d46664b3-7be0-4861-9f84-5e1cc92ec8ce","resolution":{"observed_at":"2026-08-15T21:15:59.530020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.537162Z","title":"Sample efficient actor-critic with experience replay,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.537162Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:dcad0ce3c382294c6b8b80679d26212733bf85d611129b4324fcbcc54d969a74","observation_id":"badbb7e8-9f76-4d1f-946d-d40e6b9ec770","resolution":{"observed_at":"2026-08-15T21:15:59.537162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.545797Z","title":"Rainbow: Combining improvements in deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.545797Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f04cf96266ee7e9260c1a7c467464b9609116a59183222cb9547e8795da073e6","observation_id":"63dc1484-2984-4929-8633-a13d189143e0","resolution":{"observed_at":"2026-08-15T21:15:59.545797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-14T20:07:22.164941Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-15T21:15:59.552889Z","title":"A deeper look at experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.552889Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b43fd02985199504df37e39d234a05969604c742596a220af41d8590d20480b1","observation_id":"2c3f1207-1be5-45d3-911d-b2b49a2c82c4","resolution":{"observed_at":"2026-08-15T21:15:59.552889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.560650Z","title":"Revisiting fundamentals of experience replay,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.560650Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1e7b262da0f69d6f0678e840ec35dbaebab2000cc0bc9b9571138eeb6de5a65a","observation_id":"a84b1911-47e9-4e67-8861-60e084505eb1","resolution":{"observed_at":"2026-08-15T21:15:59.560650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.571827Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.571827Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:47099689fbb9598b3cfdb894d5d901ed8a3c63985360079e77538759695a7883","observation_id":"2be1cbd3-8fe3-4fd6-b634-012b09fd6ff4","resolution":{"observed_at":"2026-08-15T21:15:59.571827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.579543Z","title":"Prioritized experience replay method based on experience reward,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.579543Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1c6eec17ecc3c7186af7cd28ca0ed6b3de7724623dee5bef7655223370ab36f9","observation_id":"887dd01e-658c-4e6b-b6a4-58075e686d7d","resolution":{"observed_at":"2026-08-15T21:15:59.579543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.587135Z","title":"Model-augmented prioritized experience replay,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.587135Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8c9dc64b2171ca9b5cf22e3c7e9729885b76f8f0a7d499c8fdf7c25f04334ae0","observation_id":"bf2d5765-a429-4875-9021-55001a1a28f7","resolution":{"observed_at":"2026-08-15T21:15:59.587135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.593754Z","title":"Prioritized experience replay based on dynamics priority,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.593754Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e940cd01f04960a1e6035a0999930b962ee23e057777d9876a0fee0a42d31c16","observation_id":"21827c24-b782-4c12-b54a-9cdff7bc22da","resolution":{"observed_at":"2026-08-15T21:15:59.593754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.600732Z","title":"Image augmentation is all you need: Reg- ularizing deep reinforcement learning from pixels,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.600732Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:0e50d1bc9157cee7f49244ac9c08abf1c67eff60e9639c0fd4b6664e83066a9d","observation_id":"28880909-9ef5-4f2b-95e2-716081aa983e","resolution":{"observed_at":"2026-08-15T21:15:59.600732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.608644Z","title":"Temporal difference learning for model pre- dictive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.608644Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fc7da93ebc86fda05dff56ddf3f8458bd3b44e590c61885fc264c922bfb2d463","observation_id":"bb3261a3-2354-4fab-9fa7-3b8d165774e3","resolution":{"observed_at":"2026-08-15T21:15:59.608644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07888","last_updated":"2023-07-04T21:25:52Z","snapshot_observed_at":"2026-08-08T22:17:29.770172Z","submitted_at":"2020-09-16T18:38:54Z","title":"Transfer Learning in Deep Reinforcement Learning: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07888","snapshot_observed_at":"2026-08-15T21:15:59.617648Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.617648Z"},"links":{"cited_paper":"/paper/2009.07888","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:2af20ef1332d901cf1e0390a2c3d7b66b310fbc4a6d5e2623f5c2c74e384de10","observation_id":"951eaa83-08f4-44f7-875d-a76e668421e0","resolution":{"observed_at":"2026-08-15T21:15:59.617648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T21:15:59.629259Z","title":"Distilling the knowledge in a neural net- work,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.629259Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1379de2e56839ab8695f16764373a94c122cc2c7ed716fc6c6530e71b7e813a0","observation_id":"ac750a00-b921-4bb4-b3a7-bbb561a2299d","resolution":{"observed_at":"2026-08-15T21:15:59.629259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.642310Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.642310Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:13e5ce0f49156e4a1c2dba89c75b4ca6e20e288d23e7a2239b27322e71abe498","observation_id":"bbfd7cca-92d8-457e-8cdd-354b96510e35","resolution":{"observed_at":"2026-08-15T21:15:59.642310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.650908Z","title":"Teaching on a budget: Agents advising agents in rein- forcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.650908Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:52aa34be18b3e7b8c05e3074c756153a348f4ded572ffae4850a4b061f24f045","observation_id":"f5b1d7c9-131f-4cb5-a799-62ab7283ce40","resolution":{"observed_at":"2026-08-15T21:15:59.650908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.661472Z","title":"Online transfer learning in reinforcement learning do- mains,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.661472Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1683b56b0b3c35e93877e3e850c57895d68b3cd70cfb885c7a82ea89e48847b5","observation_id":"65a7e75e-8a59-4218-8d61-f9c10140c608","resolution":{"observed_at":"2026-08-15T21:15:59.661472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.673376Z","title":"A survey on transfer learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.673376Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fe19396fe8c0502f31531788e5eb93b543e7d86aebfa1679b7c7634c55d542c5","observation_id":"3fec6310-43f4-4baf-8400-abe9f017ca53","resolution":{"observed_at":"2026-08-15T21:15:59.673376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.682328Z","title":"Transfer learning for reinforcement learning domains: A survey.,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.682328Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5c35ee5d49c5cc90a0b0b8879c434e02f11aa4fca398d45e55f634f0a026df14","observation_id":"f6b7be33-429f-4471-aff3-7e626e0f478c","resolution":{"observed_at":"2026-08-15T21:15:59.682328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15361","last_updated":"2024-12-12T09:06:56Z","snapshot_observed_at":"2026-08-16T15:44:59.607133Z","submitted_at":"2023-03-27T16:32:21Z","title":"A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15361","snapshot_observed_at":"2026-08-15T21:15:59.692146Z","title":"A comprehensive survey on test-time adaptation under distribution shifts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.692146Z"},"links":{"cited_paper":"/paper/2303.15361","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:5d31fff7bc8f798ca3d0ae35e20b263aec6923e05ba6895a444b95734ce68951","observation_id":"e75e4662-eb63-4180-9447-11933bcccff1","resolution":{"observed_at":"2026-08-15T21:15:59.692146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.701112Z","title":"A review of novelty detection,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.701112Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:93781c4846235948b22fe62bbecac12b2e559609542f2956417848a90148c65a","observation_id":"7d2f22a2-1761-4126-a62a-7f75083599cc","resolution":{"observed_at":"2026-08-15T21:15:59.701112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.709383Z","title":"Towards a unifying framework for formal theories of novelty,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.709383Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:2f05616c6feff0329efd5eb6cb4daf4d22f5eaf70a97b0cbfbc9ba8573311035","observation_id":"558d6a72-f865-4a75-8344-4d1000c6f88c","resolution":{"observed_at":"2026-08-15T21:15:59.709383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.717946Z","title":"Open-world learning for radically autonomous agents,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.717946Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:ef1e53b9c70e4fde1810b8f463f6dcfd62af19ac13bba3369f561baec4ba8b74","observation_id":"d4e83569-863d-413b-aa9a-e99ca2d53c82","resolution":{"observed_at":"2026-08-15T21:15:59.717946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.730032Z","title":"Mixtbn: A fully test-time adaptation method for visual reinforce- ment learning on robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.730032Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e86c939c2695328e7f9512a27512b509a00feedd64d36deb9b68c54636e7a48c","observation_id":"13fd4986-b491-4ed7-a7f1-c23a1214b0f3","resolution":{"observed_at":"2026-08-15T21:15:59.730032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.745099Z","title":"Active test-time adaptation: Theoretical analyses and an algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.745099Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1c12338180cecfa74466a8914b68221258216458e7d11a5f0d353ac221c20cc1","observation_id":"506e06de-0f6c-4e4c-967b-c2cfd0644945","resolution":{"observed_at":"2026-08-15T21:15:59.745099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.754014Z","title":"Unknown sample discovery for source free open set domain adaptation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.754014Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:131bef2248b6b307f56586df5669b3c711a2c1efd33d8b0aa31a9c556abd1eb9","observation_id":"d69bb3f9-5363-4488-9c46-4db95f5d3cff","resolution":{"observed_at":"2026-08-15T21:15:59.754014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.775138Z","title":"Hidden-mode markov decision processes for nonstationary sequential decision making,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.775138Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:fc07bb3458bfd713ebdfb4afb8b6fcdabbdf57775150f0324b1ed22781b4a1b2","observation_id":"86a5621a-af8d-4542-bd5d-eff244394314","resolution":{"observed_at":"2026-08-15T21:15:59.775138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.786510Z","title":"Choosing search heuristics by non-stationary reinforcement learn- ing,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.786510Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8c698b775a7ea37766f8aa137e5b35b29c2863c719d6daafcb9e697ab4a574ea","observation_id":"55f29354-0515-4d56-89dd-d7eb3a83b818","resolution":{"observed_at":"2026-08-15T21:15:59.786510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.799270Z","title":"Non-stationary reinforcement learning without prior knowledge: An optimal black-box approach,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.799270Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:c8ae425278df8bbee7761aaf3dea5254b01becd4fbb3cdafb8f2cfcdb9cb6750","observation_id":"15c88ad6-90e1-4269-8d00-b9cf1aa2b763","resolution":{"observed_at":"2026-08-15T21:15:59.799270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.811735Z","title":"Near-optimal model- free reinforcement learning in non-stationary episodic mdps,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.811735Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e86e98d02c97e17a69ee77a771899c52b253020146bbcb2aaf2c9b4d23b1d3d0","observation_id":"6474dc5c-ee3b-41bb-88f1-bbf9ddcfd52e","resolution":{"observed_at":"2026-08-15T21:15:59.811735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.819317Z","title":"Non-stationary reinforcement learning under general function approximation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.819317Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9f1a1b09991e46bc70e66cecc0631dcf56eee1d9a2d70a61eb4a68ed9f48cf32","observation_id":"68f75129-2aab-4295-b69a-6b5d0005fe42","resolution":{"observed_at":"2026-08-15T21:15:59.819317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.826698Z","title":"Addressing environment non-stationarity by repeat- ing q-learning updates,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.826698Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7c3e9044acb3205adc11de4154ca31c663ca36649c5d44ae31fd37ba552ba23b","observation_id":"f5ad77ed-1116-4b98-8967-2c6100a10b5d","resolution":{"observed_at":"2026-08-15T21:15:59.826698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.839173Z","title":"Non-stationary markov decision processes, a worst-case approach using model-based reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.839173Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b7a10b09e75a4666b130f358fef3c59ed165cd7f3a9506efbc43c48b9ebde3ce","observation_id":"4fd715e3-9bdb-4ef1-b845-316ab26f6ef8","resolution":{"observed_at":"2026-08-15T21:15:59.839173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.847130Z","title":"Reinforcement learning algorithm for non-stationary environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.847130Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:20b15503bfda81ccb1b8560bbb4585b2b3823aa1ef5d3ba6347dafec58aa21fc","observation_id":"9de3e21d-e44e-4e85-a7c4-4eb6ac2ec82a","resolution":{"observed_at":"2026-08-15T21:15:59.847130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.858236Z","title":"Reactive exploration to cope with non-stationarity in life- long reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.858236Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7d43d5fed9cb2fa2be0c153a5a4f8c99c29777da7e1f1e0942129a7fd97030e9","observation_id":"575e6f73-7b01-44d9-a2c4-484e39a41db0","resolution":{"observed_at":"2026-08-15T21:15:59.858236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.872781Z","title":"Transfer in reinforcement learning: A framework and a survey,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.872781Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:f8b4a12559e6ea222c61375da3d4290cd401516ef57cbd9aa9403e0eaf01b382","observation_id":"3644160b-304e-427c-b30b-62cfa6749b00","resolution":{"observed_at":"2026-08-15T21:15:59.872781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.881669Z","title":"Cross-modal domain adaptation for cost-efficient visual reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.881669Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:9ee9c19473037f6061319d8945c526c0ccf68d46d36d911d80034fd1028e7440","observation_id":"9389818f-b3cd-40fd-98a9-52b142a18d76","resolution":{"observed_at":"2026-08-15T21:15:59.881669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.889965Z","title":"Deep reinforcement learning amidst lifelong non- stationarity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.889965Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:210415192c6e21b4ff7c3948709caa9c40265484b13ab3c49312da0b2810902f","observation_id":"7879d77e-0e4d-4cb7-9b88-f95b63e0c972","resolution":{"observed_at":"2026-08-15T21:15:59.889965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.900392Z","title":"Model-based nov- elty adaptation for open-world ai,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.900392Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:e5ab00eb58eddc08676510cfbb5143a93b8a703ef5046c5213c1ac8d13cb32ca","observation_id":"56d56f0c-6e62-4b3d-b297-60328daf7490","resolution":{"observed_at":"2026-08-15T21:15:59.900392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.906124Z","title":"Detecting and adapting to novelty in games,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.906124Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:8de65593617c024a2a081f4a6f284adfb76f318ddaa78ce9b7ef4247e84ee0c9","observation_id":"139fd434-fe0d-47ba-a6de-b7b3fabcfcf2","resolution":{"observed_at":"2026-08-15T21:15:59.906124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.915271Z","title":"Spotter: Extending symbolic planning operators through targeted reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.915271Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:71dd610651949dde1a0ed3a1ec9370df078c7c98e20e7f6c502b34ff3ccd6886","observation_id":"05e3ef52-8c99-4259-a8d1-4afd3b6bea1f","resolution":{"observed_at":"2026-08-15T21:15:59.915271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.929097Z","title":"An integrated architecture for online adaptation to novelty in open worlds using probabilistic programming and novelty-aware planning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.929097Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:92b1ffe9b057f3b64ebb8a8c81d4259ecb70eef2eab14678474254d4bfc4a81d","observation_id":"d3c11078-a8b5-47ed-a070-7c91546c2ea9","resolution":{"observed_at":"2026-08-15T21:15:59.929097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.938416Z","title":"Lifelong machine learning systems: Beyond learning algorithms,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.938416Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:b5e25807fb20979a7db16e9652cddf6e0ff96c6e11efc7c9aaa89ab71e6fc5f0","observation_id":"03e8f72d-2128-4d16-828f-768e541c3d4e","resolution":{"observed_at":"2026-08-15T21:15:59.938416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.947252Z","title":"Online learning and online convex optimization,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.947252Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:a597d933cee08b13c8617ade92fbbeaa60f713fc405226ded02965e9577e2cea","observation_id":"b634438a-fd1c-4970-9325-a0c36b931914","resolution":{"observed_at":"2026-08-15T21:15:59.947252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.955337Z","title":"Introduction to online convex optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.955337Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:cc69cf78e14c461acdf92c2b1207e75f2f141238c00fb3e57276aad6cdde802d","observation_id":"a3890c45-8d6e-47ea-b98f-efa00d81004f","resolution":{"observed_at":"2026-08-15T21:15:59.955337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.963420Z","title":"Measuring catas- trophic forgetting in neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.963420Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:823435ea747f9eeb6f35449153593011faf765374dbe6b9552294bab4c5ac3aa","observation_id":"c74011aa-0093-46f0-b1c4-b3b7358044e2","resolution":{"observed_at":"2026-08-15T21:15:59.963420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.971825Z","title":"Memory efficient experience replay for streaming learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.971825Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:1f5a9672c08da614dc9d33413419547695ed21a3cc22c349598d3a218e6e0010","observation_id":"af57c857-b637-430a-9a20-f7357cfd3fd8","resolution":{"observed_at":"2026-08-15T21:15:59.971825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09536","last_updated":"2021-05-06T17:55:20Z","snapshot_observed_at":"2026-08-16T18:50:29.795403Z","submitted_at":"2021-01-23T17:23:08Z","title":"Memory-Efficient Semi-Supervised Continual Learning: The World is its Own Replay Buffer","version":2},"cited_work":{"arxiv_id":"2101.09536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.09536","snapshot_observed_at":"2026-08-15T21:16:02.794253Z","title":"Memory-Efficient Semi-Supervised Continual Learning: The World is its Own Replay Buffer","venue":"cs.CV","work_id":"786896a4-2254-45e6-a2e9-971aff5cdc26","year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.979001Z"},"links":{"cited_paper":"/paper/2101.09536","citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:d05909decab9a86797893afe2f91216018eef033ddb90e381f64ab563d66b55d","observation_id":"333e7cbe-c8be-4d13-8436-cdb184485355","resolution":{"observed_at":"2026-08-15T21:16:02.803170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.987683Z","title":"Reinforcement learning with gaussian pro- cesses,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.987683Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:7f8bd7b3ac22689e81301d20703cea3b2ce85d9d40c0eec10342f5eac860136a","observation_id":"0a5f28b3-0f63-4859-a0c3-c6671931149a","resolution":{"observed_at":"2026-08-15T21:15:59.987683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:15:59.994086Z","title":"Chevalier-Boisvert, L","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:15:59.994086Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:cad998aa725d746d358dfa024b350f925171f97bd54ec76ff8cd4d807e5e2d27","observation_id":"acd0dfca-ade8-4287-975d-c5ddbb3c3399","resolution":{"observed_at":"2026-08-15T21:15:59.994086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.004212Z","title":"A multi-agent simulator for generating novelty in monopoly,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.004212Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:84407d71dd79726bbb1b94ccaba4be6a48f99da14f9e842505f8a1b4a76568a0","observation_id":"399c1633-f32f-4532-a424-8730b4830a13","resolution":{"observed_at":"2026-08-15T21:16:00.004212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.012629Z","title":"Novelty gen- eration framework for ai agents in angry birds style physics games,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.012629Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:35bd8abfa21ce0e1a7e3964c203360a2edebebfb6c32cdbd4ef9fb177499cc96","observation_id":"f026a157-e36f-4327-9ee7-0c6efc7721b6","resolution":{"observed_at":"2026-08-15T21:16:00.012629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:00.018724Z","title":"Schmidhuber, A possibility for implementing curiosity and boredom in model- building neural controllers, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:00.018724Z"},"links":{"citing_paper":"/paper/2505.10330"},"observation_digest":"sha256:d83c573aeda7a19f7e9d79529a379daaf3d694ca48d8ee6bec78ec03ce2dca29","observation_id":"405165c0-6884-4373-b9d5-c509a3d9a614","resolution":{"observed_at":"2026-08-15T21:16:00.018724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10330","last_updated":"2025-05-15T14:19:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:00:54.223856Z","submitted_at":"2025-05-15T14:19:01Z","title":"Efficient Adaptation of Reinforcement Learning Agents to Sudden Environmental Change"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":246},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 246 outbound references and 0 inbound Pith citation observations for arXiv:2505.10330."}