{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e665d987c4b6eabd250d879d8845ae31b02735523110aecaa1bd4a82df8a8077","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T14:35:04.201252Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.20869/citation-record","integrity":"/paper/2509.20869/integrity","json":"/paper/2509.20869/citation-record.json","paper":"/paper/2509.20869"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:f45763f5c621e000e4c37868c0639ec98809471e9762af8cea4cebf17df8076f","observation_id":"406c6330-e16c-4254-bc3d-d4e3e05296a3","resolution":{"observed_at":"2026-05-18T14:36:29.733081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A cerebellar-based solution to the nondeterministic time delay problem in robotic control","venue":null,"work_id":"0c8405b0-cfe5-4a5f-97ae-139ace5b6a9b","year":2021},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:4aba37f62e555d3bf9c0553242d19f29d6bc36c5dda5e3df9f6232279ac25e29","observation_id":"72534a24-05bf-4b51-8beb-8a1f3a953b5f","resolution":{"observed_at":"2026-05-18T14:36:29.767000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closed-loop control with delayed information","venue":null,"work_id":"d8eb41c0-58ee-44a3-8c61-464e7862f8a8","year":1992},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:02466e743e37d4c4289e15311aa3020ae726ca5df9b694b17b7d03223b96dd16","observation_id":"e01764b1-1e9a-4854-9f58-fb98943a31bb","resolution":{"observed_at":"2026-05-18T14:36:29.762654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Update with out-of-sequence measurements in tracking: exact solution","venue":null,"work_id":"bbde94da-5310-4bbb-8d5b-c442f7b412bf","year":2002},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:3af2d8cea9f20ade13e5a1b76b4b09c5cbd84e377a9da9225daf18b51a23503d","observation_id":"ef87f7b6-4d46-48e4-b0af-fdcf08c586fb","resolution":{"observed_at":"2026-05-18T14:36:29.758344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with random delays","venue":null,"work_id":"f1d267bc-c1b1-4ada-a52a-9f67685b7b69","year":2020},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:eb289356197294860e1469bf3c865aad1dccc8ed380322828a1035e72d02c8fa","observation_id":"7bc3da22-b67c-43f6-8632-964cb02ecbcb","resolution":{"observed_at":"2026-05-18T14:36:29.654857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayesian filtering: From kalman filters to particle filters, and beyond","venue":null,"work_id":"d7d76cbc-191c-411f-a6eb-fb43cf374349","year":2003},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:3b98743a8a7a837fbc79b35ffa7362897e94d5644ccc60edf5833407b2dad9ff","observation_id":"b381dd62-2fac-4a1d-9bd0-317180f5b5bc","resolution":{"observed_at":"2026-05-18T14:36:29.754284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.11992","last_updated":"2023-12-13T02:40:47Z","snapshot_observed_at":"2026-07-06T10:36:28.110086Z","submitted_at":"2021-01-28T13:35:37Z","title":"Acting in Delayed Environments with Non-Stationary Markov Policies","version":4},"cited_work":{"arxiv_id":"2101.11992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.11992","snapshot_observed_at":"2026-07-04T13:29:51.953490Z","title":"Acting in delayed environments with non-stationary markov policies","venue":null,"work_id":"1854213f-87b6-4990-9329-1595cd2eddd8","year":2021},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2101.11992","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:f03cc01fb5d8461381c5e457dea4f99a7c86880bc061000d8bf0cb2b1de8401c","observation_id":"fa3ed8f9-681a-4d5f-b352-ee0340607649","resolution":{"observed_at":"2026-05-18T14:36:28.716906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communication delay in uav missions: A controller gain analysis to improve flight stability","venue":null,"work_id":"03c2a3c7-8733-428e-82d6-c72c01b64311","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:c78b7ab867b26a1388319d8aa8ce67048b1f8d5b9aa784febdae309d09b5aa78","observation_id":"8be2a045-383f-418a-b260-d0a7cfb37400","resolution":{"observed_at":"2026-05-18T14:36:29.750778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"3459c73d-0233-4d7e-88d2-7d8d6e827455","year":2018},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:c25b05a293fc0a22c85b4562148ab0cf86d8ce55aafd23df872d3465ca723f27","observation_id":"4e40442a-2c12-40dc-b7c9-dada1b99b725","resolution":{"observed_at":"2026-05-18T14:36:29.747267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"5898851c-eb35-4784-8521-c6d066521f7f","year":2018},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:c6d5aa47e6ef6158dfe30605a640fe4692e98efe872cbed7d5a7b0a4830f8e3f","observation_id":"7bbcee7c-c512-4c9e-b4d7-ff8d076b055b","resolution":{"observed_at":"2026-05-18T14:36:29.743794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":"2f36e6e5-5bd4-4fd2-a38a-f7aebbfce579","year":2019},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:1d0e782e8220c57fd295e604f02fedddb97fe13d2c11f7ec07bd879b756800e3","observation_id":"fa203662-7aeb-4f51-b27d-28624a6e409c","resolution":{"observed_at":"2026-05-18T14:36:29.740137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":"2010.02193","doi":"10.48550/arxiv.2010.02193","metadata_source":"pith","pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Atari with Discrete World Models","venue":"cs.LG","work_id":"154f6f5f-bb34-456d-8107-45d5b51433ce","year":2020},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:b671833ec26e9b467d18f808bc27ddd47cd47f512a87ce0b8ea90872bfad316e","observation_id":"0b8b7500-655a-40b8-a17b-88c3cde4c777","resolution":{"observed_at":"2026-05-18T14:36:28.665464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:a56232cedd8abeff28366de00e40a61883314e3d0510958e797cf134e380bde9","observation_id":"c1e3cbb5-a00d-4b7b-9008-c9d334e38497","resolution":{"observed_at":"2026-05-18T14:36:28.653506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"88feb974-8483-4bb0-92e9-cda6533e08b4","year":2025},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:408d55a838b26a8f39c50e3b2c1017898ab72906c8f29ecce94cf0d86d7b565a","observation_id":"56d1e66a-7a89-4d5f-b2e1-fd29dd86f723","resolution":{"observed_at":"2026-05-18T14:36:29.736667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-07-06T12:46:08.838773Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:a6852311c98a4ed8517e4128a4b6168a33a41e4b697bd54b8f14c00c72b371ad","observation_id":"b0bb3a76-b285-49d5-9221-c98dfe250bd5","resolution":{"observed_at":"2026-05-18T14:36:28.673612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep variational reinforcement learning for pomdps","venue":null,"work_id":"3d773c71-f560-481a-9958-303270baaa9a","year":2018},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:5a6cc3764d58319577c1f18e562928c245f96ae798400e1d84877124c2ee0594","observation_id":"2a7b6924-cb74-4409-8502-f3f51bf66c04","resolution":{"observed_at":"2026-05-18T14:36:29.729376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"4caf0c95-6028-430d-8542-4eb5fec4b18e","year":2019},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:96ec7b667a3f9a70fb2cbd2b0a5d232e37c92b685181ba4b0073f4a9507c9abc","observation_id":"84e91d7f-f57f-4b85-a5d4-51d70d9e83c3","resolution":{"observed_at":"2026-05-18T14:36:29.725374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planning and acting in partially observable stochastic domains","venue":null,"work_id":"f3a1787e-c83c-4ec1-9ce2-047145faaa19","year":1998},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:11e467b80c4880d61cf1e9ee7989eb148d156cacbae8c1a507228a3238b878fe","observation_id":"d05b673c-0738-4295-b6e8-4cbec606981b","resolution":{"observed_at":"2026-05-18T14:36:29.719253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12309","last_updated":"2024-06-26T02:44:18Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-18T23:18:27Z","title":"Reinforcement Learning from Delayed Observations via World Models","version":2},"cited_work":{"arxiv_id":"2403.12309","doi":"10.48550/arxiv.2403.12309","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning from delayed observations via world models","venue":"arXiv (Cornell University)","work_id":"50707d0d-667f-4afc-9f08-2464a0bc7422","year":2024},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2403.12309","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:996ffa26f1f625f342665228c94cf02ca96f50399d887b201e58e799b9c74575","observation_id":"483fdeb5-9396-4933-90e4-86a7b701633c","resolution":{"observed_at":"2026-05-18T14:36:28.711413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Markov decision processes with delays and asynchronous cost collection","venue":null,"work_id":"2f0783fd-78d4-4f8b-837d-36d32586f0f3","year":2003},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:19dc89df25939d7ad46ba1ca2612320338aeb020df85aa9046fadca8ac02fb4c","observation_id":"ed57e875-7fdb-474e-a745-8451d699d7a0","resolution":{"observed_at":"2026-05-18T14:36:29.715880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Belief projection-based reinforcement learning for environments with delayed feedback","venue":null,"work_id":"f29cb564-d4dc-4fa5-a51b-bc678b8a5777","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:924ac2644203d3ed0a7c92bb6d4918d79d5d039ed9d6d5120427507c0c11b880","observation_id":"60b78f21-3d45-49f6-a1a0-919c31b3491b","resolution":{"observed_at":"2026-05-18T14:36:29.694161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A partially observable markov decision process with lagged information","venue":null,"work_id":"46e93462-1878-4b62-9b00-11b4dafc0984","year":1987},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:ccdc4e43fb33748b88f9310c2a2589af3bebb592771fc41fa340bb5ca2536c0f","observation_id":"9c8707cc-49fd-46a9-9bd7-ebfc7d22173d","resolution":{"observed_at":"2026-05-18T14:36:29.712594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic latent actor-critic: Deep reinforcement learning with a latent variable model","venue":null,"work_id":"9855c3b3-4d7b-42c0-b93a-deb2363767a5","year":2020},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:86eaea1895670da485befc0e475cd299a2acbcf23b678ccb61c66e89b07e50e9","observation_id":"b9cdf566-2d78-41cc-b6b1-aed62d3fca77","resolution":{"observed_at":"2026-05-18T14:36:29.708711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a belief representation for delayed reinforcement learning","venue":null,"work_id":"56ce984c-6814-4ecc-b65a-fff7e99b9beb","year":2021},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:ae3ccb70e3a0a3ccdaf72a07a4b20bc25950e850aa502a55f75eb1d2055540eb","observation_id":"fe66291f-0461-4119-825e-f72ce8efdeba","resolution":{"observed_at":"2026-05-18T14:36:29.704463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delayed reinforcement learning by imitation","venue":null,"work_id":"f59d396d-92d5-4f2e-a309-3e8a6bc45ab5","year":2022},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:a1e002c202c77c2dfc1bb8d8f58b41e83d2fb97c79f874a59c3bc7b899c8d15c","observation_id":"ec3815fe-7798-4bc1-984f-757f1ab4db28","resolution":{"observed_at":"2026-05-18T14:36:29.659770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Particle filter recurrent neural networks","venue":null,"work_id":"1bace416-fbe5-48f5-908a-aa634fbb9e2f","year":2020},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:2344dbe4186bd617226e25f3939229085e4029566139834af0282c42f7eeca7a","observation_id":"bc6f3d72-ec48-4834-80fe-b06233236230","resolution":{"observed_at":"2026-05-18T14:36:29.701154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09884","last_updated":"2020-02-23T11:22:43Z","snapshot_observed_at":"2026-07-06T08:59:24.683668Z","submitted_at":"2020-02-23T11:22:43Z","title":"Discriminative Particle Filter Reinforcement Learning for Complex Partial Observations","version":1},"cited_work":{"arxiv_id":"2002.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.09884","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discriminative particle filter reinforcement learning for complex partial observations","venue":null,"work_id":"f3f4c60a-9448-4071-8f59-06c97389a8f4","year":2002},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2002.09884","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:e674f2bacbaf48fa34807a5d5323805e413fc451ad6e592ecf53766dd2e06c51","observation_id":"2b80e932-e12c-4774-8eac-8d5495f6be05","resolution":{"observed_at":"2026-05-18T14:36:28.686413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Setting up a reinforcement learning task with a real-world robot","venue":null,"work_id":"4bfb3277-9be3-47ad-9501-0ababfd17d21","year":2018},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:718820e67150694d3395e3fd641b3e05a096d9f4c2f2d7e2b0e187d8a67b9683","observation_id":"525a8490-4bcf-464d-89dd-97fffccd9277","resolution":{"observed_at":"2026-05-18T14:36:29.697647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-07-06T13:47:58.509110Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":"2209.00588","doi":"10.48550/arxiv.2209.00588","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transform- ers are sample-efficient world models.arXiv preprint arXiv:2209.00588","venue":"arXiv (Cornell University)","work_id":"388af2ed-cc43-48cc-92be-9fba2c20d9e3","year":2022},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:2b4047e89a4feed0fe5e1840f127ea2a080cf225307bc4f8a7d46732475f98fd","observation_id":"bd448093-7fd6-4800-8892-8cf16a760a76","resolution":{"observed_at":"2026-05-18T14:36:28.699389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Control delay in reinforcement learning for real-time dynamic systems: A memoryless approach","venue":null,"work_id":"9476f3f5-ad0d-4e8a-b1d4-8492aff4f3c5","year":2010},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:7e8e7276fce7e15e0b0ad2ed2628e7741157df39c50cbdc74e76791415ed3550","observation_id":"9c266cee-3908-4181-af7d-56d628e7cb3a","resolution":{"observed_at":"2026-05-18T14:36:29.690664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"2ce1572d-7bc6-46c3-9e1c-aa3562ef12b1","year":2012},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:fe6fe7ba8f8b56ffeec6f07c67dc051a3ef807b4342a2b9a4c8571bc4e8355ff","observation_id":"e38cf315-f0b9-4ad4-a4d1-91e9bcfd6fcc","resolution":{"observed_at":"2026-05-18T14:36:29.686816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05440","last_updated":"2024-04-08T12:19:04Z","snapshot_observed_at":"2026-08-05T11:21:22.836445Z","submitted_at":"2024-04-08T12:19:04Z","title":"Tree Search-Based Policy Optimization under Stochastic Execution Delay","version":1},"cited_work":{"arxiv_id":"2404.05440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05440","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tree search-based policy optimization under stochastic execution delay","venue":null,"work_id":"18b25888-fcd9-4c5a-be66-5f86d7b9e1a8","year":2024},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2404.05440","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:2640600aaafdd4a9d72b44257884183ff7324534cb4c014dfc717988ce9332b5","observation_id":"47ac839e-fa66-4f7c-9f3a-b135ebf7259a","resolution":{"observed_at":"2026-05-18T14:36:28.705749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planning and learning in environments with delayed feedback","venue":null,"work_id":"f6ff00e8-d3a7-4aa0-a875-10a18b7eff0c","year":2007},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:2b740ccc7d43870bd90d535b9fb1169b785aaca4f48b5d4c233d0d34df15da00","observation_id":"5860a670-62eb-4c3a-95b7-e0412edd8011","resolution":{"observed_at":"2026-05-18T14:36:29.681878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing signal delay in deep reinforcement learning","venue":null,"work_id":"c060fa71-2d03-4bd1-abd0-39ba35b3b47a","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:6414747b253a8efa24b13a16ebb59d5130aec800ffb144070c4b4eba6cfbe448","observation_id":"9bed5266-616d-44c8-aa8f-a47cb8b664df","resolution":{"observed_at":"2026-05-18T14:36:29.677607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational delayed policy optimization","venue":null,"work_id":"1b6f57eb-2763-4ab7-97eb-7dccdda8d3e4","year":2024},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:3e28b7b9d6327bcd6873012773bcfbfe2035af1936c03cb42f4772df7683b0cf","observation_id":"1d332628-6ea9-4567-8e3d-35524f4700cd","resolution":{"observed_at":"2026-05-18T14:36:29.673375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03141","last_updated":"2024-06-05T19:12:37Z","snapshot_observed_at":"2026-08-05T15:59:19.985354Z","submitted_at":"2024-02-05T16:11:03Z","title":"Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays","version":2},"cited_work":{"arxiv_id":"2402.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03141","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Boosting reinforcement learning with strongly delayed feedback through auxiliary short delays","venue":null,"work_id":"dc87719d-11cb-4b97-8818-fbd4543ff8b5","year":2024},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2402.03141","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:9605ba082d55892e804f6f4ade31625214466a0492e6a0df8d12d4a32eb5bc0c","observation_id":"a142d5f8-0ee1-4fae-a18e-213b632459bf","resolution":{"observed_at":"2026-05-18T14:36:28.680422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1910.10897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-07-04T14:09:52.691576Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"42b3081e-43bd-451c-b777-259c81be7953","year":2021},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:1640ee0a4587af14be04be7b4148a1b37c1a7a74a518fb9bf688f870f768a15a","observation_id":"b6fcf3af-f5b0-4693-8cf9-56201cff736d","resolution":{"observed_at":"2026-05-18T14:36:28.692263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Storm: Efficient stochastic transformer based world models for reinforcement learning","venue":null,"work_id":"e554300c-63cb-4169-8eb1-e1023fd0f382","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:30e2dc8a7b1fc771facca9a5f3a5d8ace677adce0e2cb4ac36a48006c4381cbe","observation_id":"972d2d93-31b7-41dc-ab81-7e9785bf1c06","resolution":{"observed_at":"2026-05-18T14:36:29.669270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:bcd9df5e9d105f06a8a19b34c9ad3bef08d6164015838079e6c02508a681aea4","observation_id":"3ea9858e-dd34-4c34-8177-f92a7c2eaa79","resolution":{"observed_at":"2026-05-18T14:36:29.664590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:66a5162fdbca99678e8b4fe87ee1b937aeaba113a012d4e78680219c0876caf7","observation_id":"fb5634f8-0d14-436a-a41e-bad2bc352143","resolution":{"observed_at":"2026-05-18T14:36:29.649750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":"2310.16828","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-07-08T02:04:26.234596Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","venue":"cs.LG","work_id":"360ec5fb-79fd-4490-bc73-3d161609c42d","year":2023},"citing_paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T14:35:04.201252Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2509.20869"},"observation_digest":"sha256:4bd5824436bb49e3522ea1e5aa0a0285f4ff32f2bde81a4b791d8e32fe96d3fd","observation_id":"4e0e15c9-4e47-4cb7-9b6e-aeddc37031be","resolution":{"observed_at":"2026-05-18T14:36:28.659427Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.20869","last_updated":"2026-04-15T19:40:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:01:13Z","title":"Model-Based Reinforcement Learning under Random Observation Delays"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":10,"verified_fuzzy":29},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2509.20869."}