{"as_of":"2026-08-08T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f25d1b66512f592c32cee6aa172402fc3e5bacd5b5460cc156d9c1cdc5a4a609","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:03:56.760781Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23003/citation-record","integrity":"/paper/2505.23003/integrity","json":"/paper/2505.23003/citation-record.json","paper":"/paper/2505.23003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.835095Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"6ad794ad-536a-4de3-afb3-a8db41b49a7e","year":2015},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.710833Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:258a488454a7e69d1e1018c4f9f0f593599f5af68c908b9cd9b1c703eae46c95","observation_id":"87394822-1158-4e2a-87a6-348b9e263bd9","resolution":{"observed_at":"2026-08-07T13:04:06.986317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.525444Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":"744d8215-fef0-4add-8392-e0b38701f7c9","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.743162Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fc0a9c0857e058d8dbab4b6afa3a0b98b29d2ea0d381964ab0a19c4802e63d74","observation_id":"8a273763-11b3-472c-952a-ba77d63aa8ee","resolution":{"observed_at":"2026-08-07T13:04:06.678932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:06.195518Z","title":"The limits and potentials of deep learning for robotics,","venue":null,"work_id":"43cae2ad-5a6b-4910-8fc4-a5355e7cbe98","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.816316Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:79b82c2642c97b0b038f36bef3eccbde95955690d8a75bdb9189973888639927","observation_id":"2fd1546c-ea6e-4d82-8626-dde48f253588","resolution":{"observed_at":"2026-08-07T13:04:06.349343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:03:51.926044Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.926044Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fb5784e65ea5658393b58f875fc48852b0574149e1b3c9afae108bbf18225190","observation_id":"002a37b1-83d8-4b53-81ad-d11512796553","resolution":{"observed_at":"2026-08-07T13:03:51.926044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.999879Z","title":"Mildly conservative q-learning for offline reinforcement learning,","venue":null,"work_id":"2680eed3-b8c5-4518-b585-1e5707ae5c3d","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:51.980942Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:dc7e85bb5d76289d4366e37601e8eae09d570c7aac4a23788c40ccd65254d1dc","observation_id":"48e32230-1d57-44db-b425-10a9c96f24d9","resolution":{"observed_at":"2026-08-07T13:04:06.072621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.911984Z","title":"Morel: Model-based offline reinforcement learning,","venue":null,"work_id":"0ee791b0-008b-40b8-b1df-a89bf30795fb","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.046563Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2efd0f59845dd2004312f8cc513b548298656c09d636d8c4e7f0abdd1ee30984","observation_id":"367462c2-33ff-4703-b988-82980a9bc3ba","resolution":{"observed_at":"2026-08-07T13:04:05.968363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.746615Z","title":"A Conservative Approach for Few-Shot Transfer in Off- Dynamics Reinforcement Learning,","venue":null,"work_id":"43964c5e-f566-4e60-b065-146971bf4d16","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.133369Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:b7074e6f4ac4f40891dfd2774fd3ee5c433a67ad7fc5b92a90cb478565b84add","observation_id":"affdc510-2133-4651-982d-fd29ce0e93f1","resolution":{"observed_at":"2026-08-07T13:04:05.834644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.550744Z","title":"A Comprehensive Survey of Cross-Domain Policy Transfer for Embodied Agents,","venue":null,"work_id":"c20cfccc-82d4-4711-8e7f-bbe404da4464","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.254160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:d48641e4379ef5adeb96c7911cbe4e0c38968522632dbba6fbb68380ee5e95dc","observation_id":"09fd12e4-4552-42df-8036-c29b447f1380","resolution":{"observed_at":"2026-08-07T13:04:05.656151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.373399Z","title":"OCEAN-MBRL: Offline Conservative Exploration for Model-Based Offline Reinforcement Learning,","venue":null,"work_id":"7c501c24-107c-456e-b625-3dca639e2948","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.315486Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:7f2595f780a381a44e9a52d2f439abc86fa6472e9bbba239834ec3e0c35e7a60","observation_id":"e7d05e23-4de3-44f3-900e-bc388edabed5","resolution":{"observed_at":"2026-08-07T13:04:05.463189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.215743Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning,","venue":null,"work_id":"15f0947a-ca42-4b58-8ca5-9e96c0cbca2e","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.439479Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:cc53b67f948b5d507e56bfd509e1c7b7175cac5f2c35b8f9e32648794e3fcedf","observation_id":"c4838456-3f8f-40b5-8859-c6eb7ffa252a","resolution":{"observed_at":"2026-08-07T13:04:05.277973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12716","last_updated":"2025-04-16T06:03:43Z","snapshot_observed_at":"2026-07-06T16:22:18.049829Z","submitted_at":"2023-09-22T08:58:22Z","title":"H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12716","snapshot_observed_at":"2026-08-07T13:03:52.498739Z","title":"H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.498739Z"},"links":{"cited_paper":"/paper/2309.12716","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:b6c6b5198ca6da7eaf6890d865b6eb65c29815530286473ab2863a836d78604f","observation_id":"5fde591e-9809-4b8e-ad12-2313ea00fd07","resolution":{"observed_at":"2026-08-07T13:03:52.498739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:05.057106Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning,","venue":null,"work_id":"c9579982-0328-4cfe-830d-74c86ee4302e","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.536485Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:73bc4dd9100c4591039423f5d980d52af813090e6450e64de719dc8566374fcc","observation_id":"30a34d6f-bd9f-48d5-9f3d-c40f5d21773b","resolution":{"observed_at":"2026-08-07T13:04:05.143507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.938288Z","title":"Beyond ood state actions: Supported cross-domain offline reinforcement learning,","venue":null,"work_id":"4a83fd54-2859-4eb7-ab51-09bf3275fcdd","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.636075Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:69911a68fe4c6897d662e99a61094e629748e435b1cbc2939a11d1ee47b30be2","observation_id":"9863a988-28be-49ba-85bb-7bd9587d266e","resolution":{"observed_at":"2026-08-07T13:04:04.992162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.783445Z","title":"Contrastive Rep- resentation for Data Filtering in Cross-Domain Offline Reinforcement Learning,","venue":null,"work_id":"3a311f34-f205-4167-8688-7d2ab4b29136","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.683004Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:22b8968dc1a668f0b803610b1c8280d3d3d4f2c8e2c53c511769c9eca88b62f0","observation_id":"148637c7-3901-48ea-a4e7-b42781ba9324","resolution":{"observed_at":"2026-08-07T13:04:04.872205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.632830Z","title":"Off- Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers,","venue":null,"work_id":"333badb8-1547-4a8c-a324-4430cc58ebe5","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.755958Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:5163ec493b83fb87cda7733d6fe01f5a6329ec49a25fc769cdf5ba966d562cf7","observation_id":"dd89e5db-4dc4-4870-8fa0-e7c3a389cd44","resolution":{"observed_at":"2026-08-07T13:04:04.684468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.435888Z","title":"Policy Learning for Off-Dynamics RL with Deficient Support,","venue":null,"work_id":"d45afcf6-a6aa-4f40-8aac-8ff3f0ebef8e","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.822622Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:286144f71a498e0add432fb9d503da795fd7ad18a500544f1956beb9fded3f45","observation_id":"a76b4118-69e9-4131-85c0-7b2e7cad8f5f","resolution":{"observed_at":"2026-08-07T13:04:04.555221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:04.160031Z","title":"Cross- domain policy adaptation via value-guided data filtering,","venue":null,"work_id":"b7178ec5-70e9-497f-a961-2189f08b4a86","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.875747Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:ffb1d40e352f2ef1c6ab116b28faa5ef910e71c32717d7982dbe42f5035604fb","observation_id":"3ad239e2-1cd4-45ff-9689-fa26d57387e1","resolution":{"observed_at":"2026-08-07T13:04:04.311896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.981002Z","title":"Cross-Domain Policy Adaptation by Capturing Representation Mismatch,","venue":null,"work_id":"085248d4-3705-4617-a051-74777ee63923","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:52.993127Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:4f4303fbc8ed66879f89eca1d45da0fc50090c3680c9c23a210b5403eebb8c78","observation_id":"02d113a7-65a0-41ba-ae77-7c7499ad273f","resolution":{"observed_at":"2026-08-07T13:04:04.044759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.827104Z","title":"Sim-to-real transfer of robotic control with dynamics randomization,","venue":null,"work_id":"a4c344f0-0702-4713-9963-f9e332f2b62c","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.042357Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:4500a8623feebe92656961c9c5d74a962337058aa227842f99ef8a1f5d866707","observation_id":"7da39e0c-304f-4272-994f-29a4ef906acb","resolution":{"observed_at":"2026-08-07T13:04:03.882049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.585628Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world,","venue":null,"work_id":"ab6f2d8a-b717-4248-9399-0454ddebf100","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.111229Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:01222f577e95790ac21d99b95e5f849488bb0d6460d0ff65181b6e4371d20d62","observation_id":"145cbc1a-6d94-4d4b-b850-8b08b5f3167e","resolution":{"observed_at":"2026-08-07T13:04:03.661930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.285183Z","title":"CAD2RL: Real Single-Image Flight Without a Single Real Image,","venue":null,"work_id":"bed43791-bdd3-45ba-a8a4-5378679a9eee","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.189497Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:8817e5da6603b9bcee8b914d58a9f56ec882b5591f78ef0816562fcc24855359","observation_id":"32e376c8-f2e8-44c5-b9de-45dcffe9276f","resolution":{"observed_at":"2026-08-07T13:04:03.454026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:03.037592Z","title":"Neural networks for control and system identification,","venue":null,"work_id":"397bfe3b-1f47-4f97-a1cd-e9516c638e8e","year":1989},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.285895Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f7adb21e58a5d25770d529483026a4ed1bdd4c6bb7a7c8f3f98d8c2c90e92f93","observation_id":"c9fb2cf2-adc1-4e99-9760-fa4483dbd27a","resolution":{"observed_at":"2026-08-07T13:04:03.193874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.844915Z","title":"Fast model identification via physics engines for data-efficient policy search,","venue":null,"work_id":"dfbf3cd8-160c-47b2-b01c-112d192dd144","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.372933Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:546caedbd7ee2e6317a23393ca85ac8e66f6f83a5fd2b62568a62d49c63b69db","observation_id":"9c911f14-a743-456c-a728-989bd090d3d9","resolution":{"observed_at":"2026-08-07T13:04:02.922280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.557221Z","title":"Closing the sim-to-real loop: Adapting simulation randomization with real world experience,","venue":null,"work_id":"17ddd398-bced-45f6-b23c-aa9488a9def3","year":2019},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.422518Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:daba56e42b8d9ee0ecc136fdd01ef493b57ff4e031ee62c5a3699d54ca7dd54e","observation_id":"1a20c7f0-0000-405a-9f1a-227ddeb4d42f","resolution":{"observed_at":"2026-08-07T13:04:02.690470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.325714Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks,","venue":null,"work_id":"e963f337-9333-4228-b18a-14198576243a","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.516978Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:9d2130083f8b571bec13144104d14c5af11b810cbed3a925a86b1416b9c09436","observation_id":"6eea4444-5e06-4c27-92c9-c004d784e2b6","resolution":{"observed_at":"2026-08-07T13:04:02.419331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:02.169100Z","title":"Learning to Adapt in Dynamic, Real-World Environments through Meta- Reinforcement Learning,","venue":null,"work_id":"5ed5f73a-0e8d-467a-9965-e5e21a897192","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.596714Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:c487c5ac35bb78c2e5ea18706dee971b553b0378d704e142c0035c98f0ad9386","observation_id":"580266bb-4c62-4cdf-846c-8794ae4b81a2","resolution":{"observed_at":"2026-08-07T13:04:02.249818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.945718Z","title":"Zero-shot policy transfer with disentangled task representation of meta- reinforcement learning,","venue":null,"work_id":"d9cd7463-b605-4eed-97f8-cddc7fced962","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.634400Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:d706ab3579f80b011376cafa2ae53b9b1ef0611fec388ec0d7fa1c8ac17cfc2e","observation_id":"5ce9a842-9c91-4969-b833-f743813ed8bd","resolution":{"observed_at":"2026-08-07T13:04:02.040841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.732571Z","title":"Provably good batch off- policy reinforcement learning without great exploration,","venue":null,"work_id":"561b72dd-d493-4d5b-bdf7-910d7470fd1c","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.694525Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:124f3890391128ac8a16146ce6adb4e8fbfcaa16644d4b2dd1f09decd99febb5","observation_id":"c68b46a9-de9d-43a5-ac8d-94f6ba9bd43d","resolution":{"observed_at":"2026-08-07T13:04:01.814857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.476895Z","title":"Conservative q-learning for offline re- inforcement learning,","venue":null,"work_id":"651aebc0-b54f-4b14-9aa2-ff8b7192467e","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.799782Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:898cd70626265463a2b719e140668377973465d610fc972983cd40e2fd03b10b","observation_id":"59de49a2-ba08-4b3b-9e75-fa038ee6f5aa","resolution":{"observed_at":"2026-08-07T13:04:01.591693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.239298Z","title":"Rambo-rl: Robust adversarial model-based offline reinforcement learning,","venue":null,"work_id":"c6649f0b-4d21-4a33-96b6-4010220cc19b","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.855773Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:e94b47fa48826665bf13ad54c12df21f82725d19b203228a0d09282974c1182e","observation_id":"3c564a64-660a-468b-84fb-8d5875d12b02","resolution":{"observed_at":"2026-08-07T13:04:01.376539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:01.025003Z","title":"Robust dynamic programming,","venue":null,"work_id":"252620e0-8297-4111-9df2-56ececd70ba3","year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:53.936953Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:e30ed193e0215a310b45bf0d4d1857d05fb47d6cf20bd2a1f2b04d2ef59aedf5","observation_id":"b13760c2-771e-4d62-a5a2-2f8a37e9708c","resolution":{"observed_at":"2026-08-07T13:04:01.119170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.811696Z","title":"Robust control of Markov decision processes with uncer- tain transition matrices,","venue":null,"work_id":"5ffced36-5f9d-4039-acf7-1feb91a7d480","year":2005},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.010480Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:2c0bc2c350e8598a8d3ca27aa14ad4606f71947c06c5bcd27b420d6fb4f8424d","observation_id":"26094e38-8cbf-4fdd-b247-a7c846d25e51","resolution":{"observed_at":"2026-08-07T13:04:00.898945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.585977Z","title":"Distributionally robust Markov decision processes,","venue":null,"work_id":"b20c4496-034b-458c-b148-36244eeaf3e0","year":2010},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.110255Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:9235563854dee7846d4474dd0bd068f718cc4cd41c8e1925a88a281dcac6cf15","observation_id":"e86b3880-c6eb-41b1-95b6-9a4b3ac32919","resolution":{"observed_at":"2026-08-07T13:04:00.673085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.393500Z","title":"Policy gradient method for robust reinforcement learning,","venue":null,"work_id":"8aea64f9-14fe-4b8c-96b3-0aa87e1d71f6","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.242757Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:e14a1a20fab62278ae6ce163fc15478e0cae298c66de6a5723d9843256df3c1c","observation_id":"873468c7-91db-4ae5-9636-29fed1e512db","resolution":{"observed_at":"2026-08-07T13:04:00.460610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10439","last_updated":"2023-06-07T12:20:17Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T17:14:14Z","title":"Policy Gradient in Robust MDPs with Global Convergence Guarantee","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10439","snapshot_observed_at":"2026-08-07T13:03:54.312568Z","title":"On the convergence of policy gradient in robust mdps,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.312568Z"},"links":{"cited_paper":"/paper/2212.10439","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:a8a151a4a8d6238d2845ef7873281bd0efab64cf2040a1cfe5701682cc39dfdc","observation_id":"6f1da6b5-b889-49a8-8390-6e3e00541838","resolution":{"observed_at":"2026-08-07T13:03:54.312568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.216400Z","title":"Toward theoretical understandings of robust markov decision processes: Sample complexity and asymptotics,","venue":null,"work_id":"742c2353-db84-44a6-b48e-0dc83c4bca15","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.394415Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:97db15d554d6a96192f6c587d72e4d5b49d91e0fca700fd4cea83ee371c9a281","observation_id":"3495fd71-931c-4174-9809-1c43c14856cf","resolution":{"observed_at":"2026-08-07T13:04:00.292564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:04:00.041102Z","title":"Improved sample complexity bounds for distri- butionally robust reinforcement learning,","venue":null,"work_id":"0577e686-e77c-4db5-b540-64afc8706206","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.478229Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:5809c09db0839adc1266d2a1c26e6e51ce5ca7a5273caff24fdb7aa9dd8625b5","observation_id":"a645f45b-6780-4488-b6bc-314e8be9efa1","resolution":{"observed_at":"2026-08-07T13:04:00.108759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.861373Z","title":"Online robust reinforcement learning with model uncertainty,","venue":null,"work_id":"30e1fcef-905b-4e42-ba13-8e1ec8fe31ce","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.549558Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:12fbc8a067ed7b4b36f6fa6ec19b19ce2d145af01089175baf119cbf44a51cfe","observation_id":"369eb0e5-810c-41d8-9b61-7a9e48e8c098","resolution":{"observed_at":"2026-08-07T13:03:59.946253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13841","last_updated":"2022-09-28T05:18:20Z","snapshot_observed_at":"2026-07-06T13:57:09.095338Z","submitted_at":"2022-09-28T05:18:20Z","title":"Online Policy Optimization for Robust MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13841","snapshot_observed_at":"2026-08-07T13:03:54.632287Z","title":"Online policy optimization for robust mdp,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.632287Z"},"links":{"cited_paper":"/paper/2209.13841","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:10cbe250fe3b9e26f054fe92b3a8bdcd22531a29b6a3e650c3105ed048d461d4","observation_id":"49f95e52-ae19-4839-b84e-00120c6e8c93","resolution":{"observed_at":"2026-08-07T13:03:54.632287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.657871Z","title":"Finite-sample re- gret bound for distributionally robust offline tabular reinforcement learning,","venue":null,"work_id":"707ec533-dfc1-4657-9949-141e2d3ddd95","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.736585Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:317cde02269d4418907808854cd0b1a6a6dac48174f6dd1636095ccad3739ad1","observation_id":"1d4a5a95-50c4-4cc0-9296-6ae259515ffb","resolution":{"observed_at":"2026-08-07T13:03:59.744758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.540289Z","title":"Robust reinforcement learning using offline data,","venue":null,"work_id":"a31574c2-99d6-4507-ba4c-f55c1c8fab97","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.815160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:62dda88cd94512377cbdf2d58be7360aee16049b74c7a9141fa09521ac2c476a","observation_id":"03022763-18cb-4a4d-9113-1f771d41a8e7","resolution":{"observed_at":"2026-08-07T13:03:59.635353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.396118Z","title":"Learning models with uniform performance via distri- butionally robust optimization,","venue":null,"work_id":"5d6a62d7-6d82-4c84-8b6d-7a1e6377f1e9","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.881160Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:f752c0c76d7ff6bcf4537638ce6242bfa5439af0ca2d68f7c606238ccb87394e","observation_id":"56dad26c-385e-40dd-802d-5074168bff4a","resolution":{"observed_at":"2026-08-07T13:03:59.465546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05767","last_updated":"2023-12-28T20:16:50Z","snapshot_observed_at":"2026-07-06T13:40:55.365861Z","submitted_at":"2022-08-11T11:55:31Z","title":"Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05767","snapshot_observed_at":"2026-08-07T13:03:54.976956Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:54.976956Z"},"links":{"cited_paper":"/paper/2208.05767","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:df88c6ed58387a04cca590efc2a351e06cae151a82cc8630680212ec28db2c51","observation_id":"c8cd894a-0807-4521-b6a3-3d3e495534f1","resolution":{"observed_at":"2026-08-07T13:03:54.976956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06620","last_updated":"2023-01-27T14:08:06Z","snapshot_observed_at":"2026-08-05T08:00:27.753001Z","submitted_at":"2022-09-14T13:17:59Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","version":3},"cited_work":{"arxiv_id":"2209.06620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06620","snapshot_observed_at":"2026-08-07T13:03:56.941227Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","venue":"cs.LG","work_id":"28e6b3af-8e05-481b-a522-7738a30421e0","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.069175Z"},"links":{"cited_paper":"/paper/2209.06620","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:fece378acbabe665101d877942d2afb9d079064e66ef11dd29d43a61157e12a6","observation_id":"b34cba95-4416-4216-b7b1-bb5a0b928fc9","resolution":{"observed_at":"2026-08-07T13:03:57.022169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.285479Z","title":"Double pessimism is provably effi- cient for distributionally robust offline reinforcement learning: Generic algorithm and robust partial coverage,","venue":null,"work_id":"874bf8d2-c3e8-4821-a4e6-3ef535187de6","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.166807Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:68d1deeea13963826a60fead8d5929a42b334c068251509f7eef9eba36700268","observation_id":"41e46250-17b2-4f09-b02c-d4b8c80b38e7","resolution":{"observed_at":"2026-08-07T13:03:59.332299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.131917Z","title":"Using simulation and domain adaptation to improve efficiency of deep robotic grasping,","venue":null,"work_id":"fdcea957-fdb5-46eb-abf1-b97cf86e85ed","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.260086Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:47fb1dde569c4aa3a9380d1150f135b477cdaaa8d00fcada496fb5942e9b5007","observation_id":"48ea1df1-0783-4823-a819-bd7e56b38e09","resolution":{"observed_at":"2026-08-07T13:03:59.209500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:59.028135Z","title":"Darla: Improving zero-shot transfer in reinforcement learning,","venue":null,"work_id":"ab44a340-15e5-4035-a6d3-3d39c62488a9","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.384899Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:cad0e6e6a5d2f32085a1d4ccaa07914dea5d3b7ae0f57158f1d86551302880d9","observation_id":"a4b886d6-de1f-4d63-bf24-368515875f3c","resolution":{"observed_at":"2026-08-07T13:03:59.063394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T13:03:55.466436Z","title":"D4rl: Datasets for deep data-driven reinforcement learning,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.466436Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:adfcd065a1144d5bb1e55bd652d64dd6510508397bfd9b6a43e32f2415fac31e","observation_id":"8e15cec3-3307-469b-9806-3a2877d65008","resolution":{"observed_at":"2026-08-07T13:03:55.466436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.929243Z","title":"Mopo: Model-based offline policy optimization,","venue":null,"work_id":"6c1536f2-c7be-451e-9df5-99c03f9a9d59","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.540687Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:483092c2c91f71c7b10d926b71c475cd340c368e44aacdf186279e4e153528c3","observation_id":"c59f9d8e-47e3-4e64-afad-b54722738100","resolution":{"observed_at":"2026-08-07T13:03:58.973425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.786993Z","title":"Robust adversarial reinforce- ment learning,","venue":null,"work_id":"712d5bd0-d7fd-4045-a0c0-cd0ef9251eb5","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.636939Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:773bcab83ccf336bf2d77cb385db53f89a888f9848f6ad09372a30c3a57441a5","observation_id":"afe29559-3ad9-4b6b-a139-6719ce0d4608","resolution":{"observed_at":"2026-08-07T13:03:58.835115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.655016Z","title":"Exponential bellman equation and im- proved regret bounds for risk-sensitive reinforcement learning,","venue":null,"work_id":"0bb17389-66ec-4983-9027-7b61724dcecd","year":2021},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.672126Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:790cfa88fe77c319112b3e980c087ad80f48b8c2c693da1b455ec5bf31a98e3f","observation_id":"81d67441-b454-4d96-a0e1-162ab450fdb3","resolution":{"observed_at":"2026-08-07T13:03:58.699419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.544497Z","title":"One risk to rule them all: A risk-sensitive perspective on model-based offline reinforcement learning,","venue":null,"work_id":"6f984d19-9c21-4324-a682-e84ba89a120b","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.758678Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:7f556c6ed34c80568b38fe10fb25050b8c4a62890cc02403cc3ad4d04869ed17","observation_id":"50448d80-034c-4d4f-b16c-face20210058","resolution":{"observed_at":"2026-08-07T13:03:58.610582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.413993Z","title":"Corruption-robust offline reinforcement learning,","venue":null,"work_id":"70b16d62-e446-455c-8303-5cb6f49dafa4","year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.913745Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:8d4a0233a6f350e215a8c966c5800a630ce0c96425b3c551ff1f86aa48077c14","observation_id":"435bff98-ffe5-417d-90ea-eb3073ccf41d","resolution":{"observed_at":"2026-08-07T13:03:58.451377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.273380Z","title":"Corruption-robust offline reinforcement learning with general function approximation,","venue":null,"work_id":"b5db8aaa-30e3-4eb5-ba08-35044d9d7a43","year":2024},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:55.982637Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:74541f3a3ab960dafdd7f7df500aff2eae0a10459f19ad17d4998138286815c1","observation_id":"c21a02b3-c07a-4a0d-9b38-4d1252472888","resolution":{"observed_at":"2026-08-07T13:03:58.317081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.168787Z","title":"Distributionally robust stochastic programming,","venue":null,"work_id":"c09c1808-1afa-4890-8463-22feec40ac06","year":2017},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.038538Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:32cb44d8d9263bc7963f8ebc42ad8f64a66d05f874d1de23785be05fb12bd25b","observation_id":"a2d6c9af-417d-42bc-b9ff-29439b77f3f2","resolution":{"observed_at":"2026-08-07T13:03:58.215785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:58.063657Z","title":"Algorithmic Framework for Model-based Deep Reinforcement Learning with Theoretical Guarantees,","venue":null,"work_id":"5d47959b-e7fb-431c-b20a-bb8623369de9","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.144266Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:b09c8554ef395efb7f95195e3dc0b717aa8c56aacbd732bc44e109065ef74374","observation_id":"0af4f2ac-0178-4c0c-ba3b-b66a8bc1d4f7","resolution":{"observed_at":"2026-08-07T13:03:58.100122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.847717Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models,","venue":null,"work_id":"57e965a6-3be4-43a6-abed-306150de9427","year":2018},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.272869Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:df29c699e5ee5771f110f9c8713d6123bd9336c178435fd1e53f2180986c4a17","observation_id":"f8fd7989-8a91-4d0f-8422-8aeaca0fd5e8","resolution":{"observed_at":"2026-08-07T13:03:57.940029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.670500Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning,","venue":null,"work_id":"33011060-d31c-49b6-b8ff-d5b75f3aa737","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.341894Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:648c9bae385711c906034804925d5c9b176be3f9c46324d19af6c5f9b08f6d95","observation_id":"71c50236-d4b2-4e64-9896-da802303d253","resolution":{"observed_at":"2026-08-07T13:03:57.745498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.510448Z","title":"Uncertainty-driven trajectory truncation for data augmentation in offline reinforcement learning,","venue":null,"work_id":"7b22f59e-dbf9-4575-81aa-38816d180776","year":2023},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.426774Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:b85d23650590821ea85fd2a666fe1c1d8b1244cbdc08e0685235ca8f30a5eeaa","observation_id":"698b2d49-2b42-478f-a274-f2f6dd91adf3","resolution":{"observed_at":"2026-08-07T13:03:57.606895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-07T13:03:56.555963Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.555963Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:192d67d00d0240cf72f31b359b2821c2eaf5cb2f65dffd0d00492375d1dc86f5","observation_id":"ac45104f-9f24-472f-b7e2-db601b000a2b","resolution":{"observed_at":"2026-08-07T13:03:56.555963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.343821Z","title":"labml.ai Annotated Paper Implementations,","venue":null,"work_id":"e8c66e09-9f8b-4e91-ae2e-ebba93cf46c7","year":2020},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.620245Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:d0632fc716bdcb636c194a9cda7b7d80aedae49c10f1417b3dc82646dae4ad48","observation_id":"e63780ca-5c5c-49d7-966c-9d136d33e92a","resolution":{"observed_at":"2026-08-07T13:03:57.446148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05244","last_updated":"2022-06-21T13:52:30Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:50:25Z","title":"REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05244","snapshot_observed_at":"2026-08-07T13:03:56.703511Z","title":"Revolver: Continuous evolutionary models for robot-to-robot policy transfer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.703511Z"},"links":{"cited_paper":"/paper/2202.05244","citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:c8d46b651fe90386508926c71e6849aa740e6659fa10e4810ccdb34b7081fefe","observation_id":"37130817-48e1-4fa4-8085-b305024b6914","resolution":{"observed_at":"2026-08-07T13:03:56.703511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:03:57.171160Z","title":"-m\": multi comp, “-s","venue":null,"work_id":"1f3a3880-eec2-4e11-8410-8b6faf01c625","year":2000},"citing_paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:03:56.760781Z"},"links":{"citing_paper":"/paper/2505.23003"},"observation_digest":"sha256:36477297607e972fcfc2eb763d4a506bc5c546b69ad2cb9f9a89f2da72d1010c","observation_id":"0a77678a-1738-4910-8d0f-efec2c3f7d5a","resolution":{"observed_at":"2026-08-07T13:03:57.237850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23003","last_updated":"2025-05-29T02:25:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:53:14.202052Z","submitted_at":"2025-05-29T02:25:13Z","title":"Hybrid Cross-domain Robust Reinforcement Learning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":54},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2505.23003."}