{"as_of":"2026-08-15T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba8cc0afc4a513774cd245f64ba48a9289fd31073e11ffa710437527beff9b5c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:17:36.456856Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09891/citation-record","integrity":"/paper/2411.09891/integrity","json":"/paper/2411.09891/citation-record.json","paper":"/paper/2411.09891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.239478Z","title":"Deep rein- forcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"9123ddf5-7237-4087-87da-b715a73ef053","year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.247911Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:b5784859d21122e49c4c5f52ebec76cfdd56da4fad30da13fd2f388e30072775","observation_id":"5613138e-a2b7-4f09-b075-fa23f26b74ca","resolution":{"observed_at":"2026-08-12T20:17:37.243880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.252742Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.252742Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:c4f05dd85214c4e1339c32930b4f204d1e0dd4ef680ec6eaa01fa2878c6660e8","observation_id":"3ff031b4-4c2d-4c0a-9c54-4fa6922eb086","resolution":{"observed_at":"2026-08-12T20:17:36.252742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13916","last_updated":"2021-04-14T23:38:31Z","snapshot_observed_at":"2026-08-15T05:32:12.454205Z","submitted_at":"2020-06-24T17:47:37Z","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13916","snapshot_observed_at":"2026-08-12T20:17:36.257541Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.257541Z"},"links":{"cited_paper":"/paper/2006.13916","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5e56b8b593d695b8458d25f628b039689da7c0845b251a9fe18ffbe187680a25","observation_id":"4baa2b41-6a6a-4dce-8b3a-f3a1fef53fbd","resolution":{"observed_at":"2026-08-12T20:17:36.257541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.218624Z","title":"Sim-to-real interactive recommendation via off-dynamics reinforcement learning","venue":null,"work_id":"90f64f35-5ba9-4b11-a420-8be2a7eb46b8","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.261957Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:bc1f4afbe9d623aab7e1b8e2a161c71da02ca95c34405c4f0243ab6f63dd4a86","observation_id":"fa5f8d35-7bd6-4766-924c-660ddfb74b70","resolution":{"observed_at":"2026-08-12T20:17:37.222949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06662","last_updated":"2022-03-13T14:30:55Z","snapshot_observed_at":"2026-08-14T16:54:54.131349Z","submitted_at":"2022-03-13T14:30:55Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06662","snapshot_observed_at":"2026-08-12T20:17:36.266052Z","title":"Dara: Dynamics-aware reward augmentation in offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.266052Z"},"links":{"cited_paper":"/paper/2203.06662","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:1dda5900f4ba90af86592e9900118d1d049863fcd78df2e1fbb67dfdae4b00c4","observation_id":"dd32523b-2d57-48a7-a4f0-b2c20d772568","resolution":{"observed_at":"2026-08-12T20:17:36.266052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.207489Z","title":"Unsupervised domain adaptation with dynamics-aware rewards in reinforcement learning","venue":null,"work_id":"59b2ea04-2649-48cd-abf8-f2cd2a263b6b","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.269733Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:265192e950a09bce1aebe6996c1a9cdca74db91fb5603eb0735bac9394836bfc","observation_id":"3a913f97-f674-4ba4-9dce-f911e3608368","resolution":{"observed_at":"2026-08-12T20:17:37.211161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.273364Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.273364Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:70be3ff981be1dbafd35cfcf107f6b8c5de676fe9bf70fadad6ba6dfdef4d677","observation_id":"7499ddd5-1a1b-4f04-9a6f-ce7f3de53280","resolution":{"observed_at":"2026-08-12T20:17:36.273364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06158","last_updated":"2019-06-18T04:56:56Z","snapshot_observed_at":"2026-08-14T18:51:17.246400Z","submitted_at":"2018-07-17T00:25:15Z","title":"Generative Adversarial Imitation from Observation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06158","snapshot_observed_at":"2026-08-12T20:17:36.277182Z","title":"Generative adversarial imitation from observa- tion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.277182Z"},"links":{"cited_paper":"/paper/1807.06158","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:0d3246e7a6ee1d4347e4aa793bf43c9acb30471577c3075b83fdc2864b8d93ab","observation_id":"fd30c84c-8a34-4fd0-8d82-19e9a3177f5a","resolution":{"observed_at":"2026-08-12T20:17:36.277182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.188113Z","title":"Offline imitation learning with a misspecified simulator","venue":null,"work_id":"a6c605e5-5b35-4ee1-a930-87e394c423b7","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.280800Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:145398a977ca1f05cbdd22455f77e77b00c5facb9d6ee5ad564db5fd1e9d7f5e","observation_id":"67525ab4-c36a-43f7-ba45-e7263eda8d37","resolution":{"observed_at":"2026-08-12T20:17:37.192290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.174564Z","title":"An imitation from observation approach to transfer learning with dynamics mismatch","venue":null,"work_id":"f998a96d-dcb8-416d-9796-2c356d7f2ed0","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.284153Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:e13aa09ca6e61204aca6500a2c5b0f67a8b324cc40b1e9ab91ba40573d5202df","observation_id":"5fb528e4-6cfa-4290-a0b0-cef63400ccd0","resolution":{"observed_at":"2026-08-12T20:17:37.179110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11879","last_updated":"2020-02-27T02:27:46Z","snapshot_observed_at":"2026-08-12T23:18:00.134760Z","submitted_at":"2020-02-27T02:27:46Z","title":"State-only Imitation with Transition Dynamics Mismatch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11879","snapshot_observed_at":"2026-08-12T20:17:36.288161Z","title":"State-only imitation with transition dynamics mismatch","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.288161Z"},"links":{"cited_paper":"/paper/2002.11879","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:a0526651c50d0557bc73a0f2497bcbb817ad75533ffcb5c7a082d877e7ccef99","observation_id":"2673544c-0942-4e83-b05d-3a617f6e9d54","resolution":{"observed_at":"2026-08-12T20:17:36.288161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-15T04:51:29.366364Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-12T20:17:36.292286Z","title":"Doubly robust policy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.292286Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:9906970bae6c4f1158915c373f4be6610ba5a1d6da0511f0cf75f473d888cb55","observation_id":"81241666-5130-4ff8-9e30-5624202aeeea","resolution":{"observed_at":"2026-08-12T20:17:36.292286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.160956Z","title":"Doubly robust off-policy value evaluation for reinforcement learning","venue":null,"work_id":"d8491043-c309-4b8f-bafd-9969b0d30a56","year":2016},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.296742Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:2a284e2c2266cbbf45a426dc6b0b18e6d827e2f8fc69466b5da7e780be9e5cb2","observation_id":"5ff84bb0-e52e-42df-8718-052153b1fb00","resolution":{"observed_at":"2026-08-12T20:17:37.164640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.147988Z","title":"Doubly robust off-policy evaluation with shrinkage","venue":null,"work_id":"9a85c50d-d5d8-4c68-aa82-086188f1d352","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.301670Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:c79ec02aff038cea90f3841b507d4c3863a03c45023f363d3271e0b7c1998f96","observation_id":"3fa4eb3f-6143-4c6c-b60b-5c3ca1ec149c","resolution":{"observed_at":"2026-08-12T20:17:37.153092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.135169Z","title":"Doubly robust off-policy actor-critic: Convergence and optimality","venue":null,"work_id":"e48b2e8b-5024-4067-bc8b-84147db7446b","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.305848Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:eb010488c67881ad4fb5a5d2b5df20591652eaa7493eba1ff24fddbf2e622139","observation_id":"93013354-fb64-4f17-a28a-0693ab6bfc36","resolution":{"observed_at":"2026-08-12T20:17:37.139372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.122727Z","title":"Doubly robust distribu- tionally robust off-policy evaluation and learning","venue":null,"work_id":"292278ef-45ed-48f7-9bce-1a21112e42f0","year":2022},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.309412Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:d4d6de033f1b1e6b8d606c5293265c5eab54bbcf6e45bdd61398edd62a06e53e","observation_id":"a67cd4fa-e58b-40a3-a2ee-0b12438c2009","resolution":{"observed_at":"2026-08-12T20:17:37.127030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.313407Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.313407Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:705ee73b0a4df29a4756cb35108d5e4a779518b55e41eefdbb6034d969eba046","observation_id":"838e9822-b528-4ded-88ef-3632000b9f7e","resolution":{"observed_at":"2026-08-12T20:17:36.313407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.102189Z","title":"On the off-dynamics approach to reinforcement learning","venue":null,"work_id":"882c7619-edaa-4cbd-8b5c-5baa0dabb647","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.316877Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:8cd1bfe506d33f802676d0927bc5a9f2ec987756c9323d883fd2376811461d02","observation_id":"b521f84e-07f0-4a70-bd00-a9afb35559db","resolution":{"observed_at":"2026-08-12T20:17:37.106346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.088582Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"901d381a-3184-4720-8056-5b8b2dc59bae","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.320568Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:7857eedada26ce285125a3903152622bff0e671262a87eb2c02857018a7f28ae","observation_id":"983a1df7-5f2d-4b03-b13b-48f96b33386d","resolution":{"observed_at":"2026-08-12T20:17:37.093026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.075806Z","title":"Mutual alignment transfer learning","venue":null,"work_id":"c28aaec1-027c-453a-9580-db56230c72ba","year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.323875Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:617dbbe2ee093b6e0036d620a64107fa7421164b4b21d93185e483253260390e","observation_id":"2322f4d4-362a-4411-b663-48c7abd51685","resolution":{"observed_at":"2026-08-12T20:17:37.080478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07452","last_updated":"2018-12-18T16:08:57Z","snapshot_observed_at":"2026-08-14T17:41:48.712304Z","submitted_at":"2018-12-18T16:08:57Z","title":"Domain Adaptation for Reinforcement Learning on the Atari","version":1},"cited_work":{"arxiv_id":"1812.07452","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.07452","snapshot_observed_at":"2026-08-12T20:17:36.573526Z","title":"Domain Adaptation for Reinforcement Learning on the Atari","venue":"cs.LG","work_id":"4be8544f-5642-45f1-901d-6215c1a9a12d","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.327207Z"},"links":{"cited_paper":"/paper/1812.07452","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:07327d35c0434429e8dbc7a777eec6bb73f406b74c9772c18b97f7b798272f3d","observation_id":"859041a9-8267-4a5a-b3cc-e5099afa6451","resolution":{"observed_at":"2026-08-12T20:17:36.578965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.063143Z","title":"Domain adaptation in reinforcement learning via latent unified state representation","venue":null,"work_id":"78df07de-f7ca-431b-a713-0dc2b8ca8358","year":2021},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.331292Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:393163a78b0bcaf1ead773434efac913b8eaf915afdcbc3f87302f693b9721be","observation_id":"c9e7c01a-2133-406d-a598-39bc065876a7","resolution":{"observed_at":"2026-08-12T20:17:37.066843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.051298Z","title":"Transfer learning in deep reinforce- ment learning: A survey","venue":null,"work_id":"b38ee26c-db00-43ff-aa64-59a823efb769","year":2023},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.335280Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:c66d8cc50550aa2a63888eaabdcc560cbad329b5b212e934c8c34119a746174c","observation_id":"8df7979f-e2dd-4bd4-bc39-b81e5579f731","resolution":{"observed_at":"2026-08-12T20:17:37.055530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-12T20:17:36.339277Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.339277Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:73754126dc81da95aeba440d8e9ddad1f4c87b2e43375d590a3f05d8c2daef78","observation_id":"40b228c3-039a-44d7-b42e-dd51a0522d74","resolution":{"observed_at":"2026-08-12T20:17:36.339277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.039471Z","title":"State regularized policy optimization on data with dynamics shift","venue":null,"work_id":"4020fca7-4ad7-4843-9ec1-ceb7754719b5","year":2024},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.343376Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:31784a6bffaf7a338a439bcb9c32434066f489fe7245598c53d917203c1a192f","observation_id":"1a0e4323-7e16-45d5-a78e-8ab3d648c68b","resolution":{"observed_at":"2026-08-12T20:17:37.043346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.347569Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.347569Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:57f0792a4a660b3fa38591029fd4ba81a4da00c84a5c0cafaf81897c69b74e30","observation_id":"3cc6b026-d4f9-4812-b364-efe5a0e14d5b","resolution":{"observed_at":"2026-08-12T20:17:36.347569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.016622Z","title":"Distributionally robust off-dynamics reinforcement learning: Prov- able efficiency with linear function approximation","venue":null,"work_id":"83fe3bed-c5a3-4525-a09b-21beaaab0792","year":2024},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.351975Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:f6d96383baea5b7de2184b0e598e6504a9ad528ffb4b9db3ea29397b77d5b048","observation_id":"68384332-9525-40be-9946-9bd08d26d87c","resolution":{"observed_at":"2026-08-12T20:17:37.021172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-08-14T20:18:41.596978Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-12T20:17:36.355560Z","title":"Learning robust rewards with adversarial inverse reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.355560Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5c6c758ea358e430dad47256ee59f48dea0aa49aaae8c528ad2cc6cce349e940","observation_id":"41eaee32-c7f3-45e9-b0c1-aaa0782819e2","resolution":{"observed_at":"2026-08-12T20:17:36.355560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:37.002683Z","title":"Imitation learning via kernel mean embedding","venue":null,"work_id":"f74b43fc-c11c-4ea8-ba5c-83d05e339640","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.360166Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:403a059e4ebe3256560474ab72004d704f5cd22bff9116ad2092c86e22c008b5","observation_id":"a118e89a-86dd-401d-bf96-580d44b86363","resolution":{"observed_at":"2026-08-12T20:17:37.007973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00821","last_updated":"2020-08-25T02:41:11Z","snapshot_observed_at":"2026-08-14T18:21:02.097256Z","submitted_at":"2018-10-01T17:02:24Z","title":"Variational Discriminator Bottleneck: Improving Imitation Learning, Inverse RL, and GANs by Constraining Information Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00821","snapshot_observed_at":"2026-08-12T20:17:36.364226Z","title":"Variational discriminator bottleneck: Improving imitation learning, inverse rl, and gans by constraining information flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.364226Z"},"links":{"cited_paper":"/paper/1810.00821","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:3bfccca500e1a73e6f772b45b5672d797e10bb6e803c03072450f97410ea6c39","observation_id":"8eb1bf54-3c9e-42ae-a0e2-dbb200a85835","resolution":{"observed_at":"2026-08-12T20:17:36.364226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.989300Z","title":"Task transfer by preference-based cost learning","venue":null,"work_id":"4334ca57-1711-4032-91fd-99b68ab6d372","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.368737Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:923bc803fa4edf078c5cd56192bd6a25af31691260be72128b3ba122803d8fda","observation_id":"6f4a63f3-1e08-4d69-9b0b-6e5b06b5f65b","resolution":{"observed_at":"2026-08-12T20:17:36.994200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09335","last_updated":"2019-06-19T03:59:10Z","snapshot_observed_at":"2026-08-14T16:28:11.375721Z","submitted_at":"2019-05-22T19:21:05Z","title":"Imitation Learning from Video by Leveraging Proprioception","version":2},"cited_work":{"arxiv_id":"1905.09335","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.09335","snapshot_observed_at":"2026-08-12T20:17:36.517563Z","title":"Imitation Learning from Video by Leveraging Proprioception","venue":"cs.LG","work_id":"15027eae-051a-4c18-b890-c3b76506e584","year":2019},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.372938Z"},"links":{"cited_paper":"/paper/1905.09335","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:a998e415983558f1129e15624401e341caaf48e48ef7e46c6ed0e1b79cfe5192","observation_id":"c26186d0-e667-49f6-8204-4dc139411b68","resolution":{"observed_at":"2026-08-12T20:17:36.524377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.977266Z","title":"Imitation from observation: Learning to imitate behaviors from raw video via context translation","venue":null,"work_id":"b5df0ff4-ca90-4841-b46a-3f43ee576f8f","year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.376193Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:0889b69843e2160ffcb1c995c8c7fc5b1ddae7db529e1871f16631f4d2719f5d","observation_id":"16e2bad1-a861-4f73-a727-725b0cec41eb","resolution":{"observed_at":"2026-08-12T20:17:36.981041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01954","last_updated":"2018-05-11T21:48:52Z","snapshot_observed_at":"2026-08-14T19:18:37.366856Z","submitted_at":"2018-05-04T22:36:58Z","title":"Behavioral Cloning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.01954","snapshot_observed_at":"2026-08-12T20:17:36.379282Z","title":"Behavioral cloning from observation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.379282Z"},"links":{"cited_paper":"/paper/1805.01954","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:206f3295ce8e65352af85ef4a71001d0eca69fa854fb7836e97af80de1ba1634","observation_id":"e3e99ab7-cf1f-401e-ade8-3e44214fb1a7","resolution":{"observed_at":"2026-08-12T20:17:36.379282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13566","last_updated":"2019-06-19T03:55:09Z","snapshot_observed_at":"2026-08-14T16:23:58.145615Z","submitted_at":"2019-05-30T05:54:30Z","title":"Recent Advances in Imitation Learning from Observation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13566","snapshot_observed_at":"2026-08-12T20:17:36.383384Z","title":"Recent advances in imitation learning from observation","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.383384Z"},"links":{"cited_paper":"/paper/1905.13566","citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:7c980856bca6ea371013bd283dff3638151e6d5dc2531dcd5066afcc0e322223","observation_id":"cd31525b-a218-4e47-b5c5-196c1eb8eb77","resolution":{"observed_at":"2026-08-12T20:17:36.383384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.387268Z","title":"Domain adaptive imitation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.387268Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:55cd9235c104be9543c3a22a2c6b7606e66cc7e7f79130b8ef190a0acc155799","observation_id":"b555e714-d3e7-4ea0-92ec-8fa8f3e60266","resolution":{"observed_at":"2026-08-12T20:17:36.387268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.390932Z","title":"Generalization and equilibrium in generative adversarial nets (gans)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.390932Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:903d440580b79c3bc47bd27a20802a4ec849f57766ecacd022dbe120a027b78b","observation_id":"99553806-6256-4bc9-89a8-cd82d7a4e646","resolution":{"observed_at":"2026-08-12T20:17:36.390932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.949791Z","title":"vf+MOWCXlXkD7CB/Zj9tqm3hyT0=","venue":null,"work_id":"7856eaf8-97af-4e4a-b7c0-2434434a72a9","year":2020},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.394593Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:b314f878af400bade162258e06a11d61dc58ffefdae3689ef550ee8210e326ce","observation_id":"961c3012-d6c7-4f41-ab91-36a32d94b33b","resolution":{"observed_at":"2026-08-12T20:17:36.954194Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.937416Z","title":"And in the introduc- tion section, we have a contribution list","venue":null,"work_id":"4f773e20-30f7-4815-a6b2-d6bde4a11305","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.399572Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:1c47abb0f0b58748b07fe443d3da35701ffc96b5cb91c55787d2e8e58e476960","observation_id":"d54b067f-39d8-4ab1-bdba-831510ef0bcf","resolution":{"observed_at":"2026-08-12T20:17:36.941654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.926502Z","title":"Limitations","venue":null,"work_id":"3fe11164-5c30-410f-9690-7d2de5bd5715","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.403904Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:69d3862e0e9db844e9e6af0109bbc0617db1f828525304ec3b062e04d99d7bfe","observation_id":"a1a4d7ba-c253-4094-ab40-5eb181ccc063","resolution":{"observed_at":"2026-08-12T20:17:36.930341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.915302Z","title":"We present our theoretical result in Section 4 and the proof is in Appendix B","venue":null,"work_id":"4b3231f9-e613-403e-aa71-629e6538b335","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.407613Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5c7877c66becca134a7b4b1bcae4d7e06a8517fcda0122148804c74fb3adaf69","observation_id":"0155ba99-1d8a-4638-aa00-a973529a342e","resolution":{"observed_at":"2026-08-12T20:17:36.919164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.903610Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"bb6150a0-fe16-4c27-a8f9-6da7bea2c336","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.412052Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:1c9131192b1ef7568d4e040407746b0ccd620030d94eb7306b70aa2fbce65e95","observation_id":"b0cdfb74-91ad-4fcd-9254-ad5b9abc7f1f","resolution":{"observed_at":"2026-08-12T20:17:36.907775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.891623Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"78d576d8-f456-4747-ab39-b45b7de25f82","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.416059Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5323d7192eeab4d9ed54b7f7f3db1b773ad93d01b130ae800708955bf6e0acd4","observation_id":"33486d2d-81cc-46f8-985c-89e0480a87b9","resolution":{"observed_at":"2026-08-12T20:17:36.895880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.880642Z","title":"We also describe the hyperparameter tuning in the Appendix D.4","venue":null,"work_id":"32f3c1cd-7945-4f8e-96f5-5526517161fc","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.420974Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:12f66cb60aaab120fbb78f185f66a84814344bb08208e1ad236db6bee9e60d07","observation_id":"7601504f-19b7-48d6-abc1-8400b07369ed","resolution":{"observed_at":"2026-08-12T20:17:36.884247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.869345Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"0ba8ea0c-1f83-4a9a-a12a-ab3862ad8169","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.425518Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:d152855fc27f21a983ff85cbee7aa55b4511fe9e3a85662a1362e5f7cb38142f","observation_id":"e3f0739b-d912-422c-815e-64f036c38ccd","resolution":{"observed_at":"2026-08-12T20:17:36.872996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.856739Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"82fec0d7-0d91-46f3-8c11-70fa3bc5c736","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.429220Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:f1d9f93a8c4c8de245821555e75bf2a7ef85ec0059600b0b6a9f7a3dbcac9fc0","observation_id":"6c8fae34-bc3a-4d87-8a50-d06a4c9b1a9b","resolution":{"observed_at":"2026-08-12T20:17:36.861005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.844457Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"571fbd10-3423-4fba-9e0c-9c194aee080b","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.433498Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:64d478572392a710054184f3f98346e3e2b65ed716f8b812a0e9ae0854550806","observation_id":"03c7ca5f-168a-4789-8b6d-8373cf47c48e","resolution":{"observed_at":"2026-08-12T20:17:36.848492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.831338Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"93e47756-1c0e-4197-a6d6-e111f4cd2317","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.437415Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:c89e022b4833dded037d0c55c32851a37613457f07150be3355efccf92b3ff9c","observation_id":"9398912b-84f5-473b-8888-9b4764310394","resolution":{"observed_at":"2026-08-12T20:17:36.836178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.818822Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"437eb07a-b9a7-4d91-91bf-563d98300921","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.441482Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:5289fda256a8a6a48d18f5b43b6fe101f2cfc0caea1ab58b6f33ffa3a652b4c6","observation_id":"9b412b4b-d424-486a-b262-bf11491823fe","resolution":{"observed_at":"2026-08-12T20:17:36.822673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.806661Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"35855dae-db36-4e21-930c-4b454d23fde8","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.445554Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:fc7718ca528d3f85a05a57a846bf641be729807b462da48636c79dbdb7bf7981","observation_id":"eccf6cce-6e09-4549-8514-24227f4aff22","resolution":{"observed_at":"2026-08-12T20:17:36.810650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.794851Z","title":"Also, details about the implementation are included in the paper","venue":null,"work_id":"fdc2f4e0-1ed2-43a5-bc81-5821a33f7b57","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.449898Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:f3398419ec1c8e47241602d6818aebac1f7ee3dbca42495d0f0d89a80f89f89d","observation_id":"aadab1a8-e210-4843-bc9d-b1dcb1ae1500","resolution":{"observed_at":"2026-08-12T20:17:36.798768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.782207Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"79bb6589-fb78-4af3-abdf-541a24ce17e9","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.453463Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:e63a33ba989fd43acec37a33df8d0b978b55f3502b8e3c80db6d230dc6b29f18","observation_id":"44774b8e-2c5d-4bd7-b370-8cea819e8347","resolution":{"observed_at":"2026-08-12T20:17:36.786580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:17:36.646475Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"5a7eb5c5-55e7-4e3c-bbe9-cd2e325ca2bf","year":null},"citing_paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T20:17:36.456856Z"},"links":{"citing_paper":"/paper/2411.09891"},"observation_digest":"sha256:eabbcdb633917c9df403cf321728a381a5044759f0cd7c2b72f1757c2af052e2","observation_id":"c3afa81f-16bb-4e33-b2b4-90db56f1ed3d","resolution":{"observed_at":"2026-08-12T20:17:36.773313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09891","last_updated":"2024-11-15T02:35:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T23:18:20.981076Z","submitted_at":"2024-11-15T02:35:20Z","title":"Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2411.09891."}