{"as_of":"2026-08-07T19:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87db71e0acdec4cf1b2fb90dafcaff64aa6f0118a25059409a6ab84979c4b497","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:19:29.466784Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:51:20.005562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:52:44.957699Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"cited_work":{"arxiv_id":"2507.06111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06111","snapshot_observed_at":"2026-06-28T22:52:44.957699Z","title":"Safe domain randomization via uncertainty-aware out-of-distribution detection and policy adaptation","venue":null,"work_id":"2a13e45b-f5b4-40ca-99d0-da23ab69497c","year":2025},"citing_paper":{"arxiv_id":"2604.08780","last_updated":"2026-04-09T21:31:24Z","snapshot_observed_at":"2026-07-06T22:57:50.266735Z","submitted_at":"2026-04-09T21:31:24Z","title":"Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:48.187942Z"},"links":{"cited_paper":"/paper/2507.06111","citing_paper":"/paper/2604.08780"},"observation_digest":"sha256:9b9c7aa3563f5fabfcfa714a8dd63c1768a2d55f4708660b7c42916aaec524d2","observation_id":"574d3609-1717-4005-9922-f229e73f6ee2","resolution":{"observed_at":"2026-05-11T07:56:00.604939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"cited_work":{"arxiv_id":"2507.06111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06111","snapshot_observed_at":"2026-06-28T22:52:44.957699Z","title":"Safe domain randomization via uncertainty-aware out-of-distribution detection and policy adaptation","venue":null,"work_id":"2a13e45b-f5b4-40ca-99d0-da23ab69497c","year":2025},"citing_paper":{"arxiv_id":"2606.00350","last_updated":"2026-05-29T20:42:30Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T20:42:30Z","title":"Drift Q-Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T22:51:20.005562Z"},"links":{"cited_paper":"/paper/2507.06111","citing_paper":"/paper/2606.00350"},"observation_digest":"sha256:d4ab330729fb0d402de81e21e4a94d6d4b664b77a086177d4ac01a9863f6c9c1","observation_id":"3d2a5ce3-47b7-41ea-91ad-ee34b05327d8","resolution":{"observed_at":"2026-06-28T22:52:44.959420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06111/citation-record","integrity":"/paper/2507.06111/integrity","json":"/paper/2507.06111/citation-record.json","paper":"/paper/2507.06111"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.268005Z","title":"MIT press, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.268005Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9b9624c1515cf05d6326ad4b5abc38e18ab08b21fc17290d3dcbd868d530409f","observation_id":"1526371c-a675-4c97-814b-746330775ae9","resolution":{"observed_at":"2026-08-06T19:19:29.268005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T19:19:29.270830Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.270830Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:88f63cb0c508358a8cf7dc54b7d793cecc01ad3b1ca8ab32f53586c497359b10","observation_id":"4bf1724f-2714-4f22-86e8-f3e3a134e07f","resolution":{"observed_at":"2026-08-06T19:19:29.270830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.273775Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.273775Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9abfa23021430c76db783d27de72b57c1e50f8ed7069c17668c981a8baf9a792","observation_id":"ba244a59-48ea-448b-a35c-4ea07b740dff","resolution":{"observed_at":"2026-08-06T19:19:29.273775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.276094Z","title":"Toward self-driving processes: A deep reinforcement learning approach to control.AIChE journal, 65(10):e16689, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.276094Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d227dba5c209905f3bc7082adf951f82f9784a560c6824da4e8f387ce4ab7a43","observation_id":"56859d3c-2cd0-4236-95af-df70614d7519","resolution":{"observed_at":"2026-08-06T19:19:29.276094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.278337Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.278337Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4e6ea60b3b7801734252a506c25806fd8fa67083dae7f51f3be16b3df1d5ebcf","observation_id":"5073135a-bf34-45ec-9085-8493b5d7d39f","resolution":{"observed_at":"2026-08-06T19:19:29.278337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04982","last_updated":"2022-05-24T06:22:12Z","snapshot_observed_at":"2026-08-05T16:48:46.665556Z","submitted_at":"2021-07-11T06:40:02Z","title":"Out-of-Distribution Dynamics Detection: RL-Relevant Benchmarks and Results","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04982","snapshot_observed_at":"2026-08-06T19:19:29.280573Z","title":"Out-of-distribution dynamics detection: Rl-relevant benchmarks and results.arXiv preprint arXiv:2107.04982, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.280573Z"},"links":{"cited_paper":"/paper/2107.04982","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:cf11dc8eac4976b2f06eb631a782d8576c64ed9e78981dd24547f975448cb123","observation_id":"15a92a1b-465b-48e0-bb1d-e67a041c145d","resolution":{"observed_at":"2026-08-06T19:19:29.280573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.283011Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.283011Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:ebfe2678ba8e6b280c9865787b9dac8b56dddf474bf3d929445ca989e1c8a493","observation_id":"21553616-b72f-42f5-9ff6-d9b1a9d7554f","resolution":{"observed_at":"2026-08-06T19:19:29.283011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.285338Z","title":"Robust dynamic programming.Mathematics of Operations Research, 30(2):257–280, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.285338Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a1de76162dbaee3f7e7c5031b16fe1c72f99bdabfe0f669fb1b67e1f0110d170","observation_id":"dbbeceac-cdb8-4aa8-9620-a67d693c4e8a","resolution":{"observed_at":"2026-08-06T19:19:29.285338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.287354Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.287354Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b134bb50379eaa58571bb01e3ef8ac7db54be8496d64397a3ca4174bf95a6048","observation_id":"028831bd-968d-4d86-babd-2a5893be2385","resolution":{"observed_at":"2026-08-06T19:19:29.287354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.289344Z","title":"Adaptive policy learning for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.289344Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4c05882d15d0484a4abad1aebc1733a913afbc80880d43b4bd75dbf06337ccfd","observation_id":"2da0939b-9d49-4471-b2dc-9fccee67e3ac","resolution":{"observed_at":"2026-08-06T19:19:29.289344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.291520Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.291520Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:916f638eac6f6df452ef789fbc6f9790c841f4960440d9170cba7e8b279fc2f8","observation_id":"22ed0b8b-7e03-4621-a290-1cf07f5008e1","resolution":{"observed_at":"2026-08-06T19:19:29.291520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.293612Z","title":"Pal, and Liam Paull","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.293612Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f4fbd0614df6fb143a1e34c4c7a452bdb4056d095e34f394cbcf8d51a7f47ae9","observation_id":"0b98c3b2-914a-4c4f-a18a-98557b79b8e0","resolution":{"observed_at":"2026-08-06T19:19:29.293612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.296109Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.296109Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:22c10765099179c2d5280c9ee4fe09bd7464248fac650f28d1f2871a8b8d855d","observation_id":"52067f97-ed3b-4a8f-9b0a-32e2eed5252f","resolution":{"observed_at":"2026-08-06T19:19:29.296109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.298094Z","title":"Towards a generic solution for inspection of industrial sites","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.298094Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:fc0670c0c3364faae211edbfaa062d5bf6f00fbd06395eaccd63866d60e03269","observation_id":"2db63577-4955-4e25-b994-5b2c2564a860","resolution":{"observed_at":"2026-08-06T19:19:29.298094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.300018Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.300018Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:de0c364c55a0ac0845b594c5a1ea188e8fa43d43aa9c2ec36c6cc94c3c85dc45","observation_id":"bc1b65b0-5a98-4c53-8587-fff94163a914","resolution":{"observed_at":"2026-08-06T19:19:29.300018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-06T19:19:29.301981Z","title":"Way off-policy batch deep reinforcement learning of implicit human preferences in dialog.arXiv preprint arXiv:1907.00456, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.301981Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9e6c15c3b878ca5669215381dbdfe4993c3f3fda3a255dd1d7e3df3fc7d4a3a1","observation_id":"5bb02de6-6422-450c-8a4b-b8bf88b0c20b","resolution":{"observed_at":"2026-08-06T19:19:29.301981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.304679Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.304679Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:2265bfb022b5b457f5ab253bb11c7181f3bc31f6aec0301a1209abe7b5b0482b","observation_id":"ee08bffa-b9a0-4338-8422-6d1c195222ae","resolution":{"observed_at":"2026-08-06T19:19:29.304679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.017396Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"dbe16f52-cff6-46f6-93ef-025e3035a1cd","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.306599Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c33d2f2d4d18673bb9521c64d7bcf59fc3766377e5a28b3158f558990ed84073","observation_id":"bee2bd30-27bc-4279-ae5d-b52113dc3e41","resolution":{"observed_at":"2026-08-06T19:19:30.019955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.010943Z","title":"Uncertainty-based of- fline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"b7707d72-4366-423b-be13-bd2a208bc21c","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.308508Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:856624cb4ffbf065c04d8af48792ec56b7cce6d53ab5bebf4300587073c17495","observation_id":"20eb6e39-95f7-43eb-a934-3d10f6fbe10b","resolution":{"observed_at":"2026-08-06T19:19:30.013214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:30.004499Z","title":"Iteratively refined behavior regularization for offline reinforcement learning","venue":null,"work_id":"d2d3e2ac-7cb0-4180-a757-eb02444c19f0","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.310529Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:363c81fb16acace0b031a1c48ec7eb2f48a0b14e299ca7274ab4a1eab3b48b90","observation_id":"c53f3ea2-6348-499e-a952-2eb398ca4f21","resolution":{"observed_at":"2026-08-06T19:19:30.006861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.998215Z","title":"Offline reinforcement learning with OOD state correction and OOD action suppression","venue":null,"work_id":"cdf8c950-f6f1-410b-bd27-bacd94a4c96b","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.312460Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:82fc325478dd8eb085294e4b73f0687957810696739f68472cf2faee4a959d82","observation_id":"ee8242d5-9d9d-4fff-a90a-9e4cc5f1d450","resolution":{"observed_at":"2026-08-06T19:19:30.000520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.314345Z","title":"Model-Bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.314345Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f1a522351836774733929f4f3a3a3d445bdf125c7cb99f925c3913924d697493","observation_id":"0a9c719c-02dd-45dd-879a-57eafe701b56","resolution":{"observed_at":"2026-08-06T19:19:29.314345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.986677Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":"21ab6044-6e0f-4efd-b82a-3750c7ac9d72","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.316417Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:04e401842a7014a49571f502399c051e35110c785814929eab9738570d17dd12","observation_id":"8048c12b-3fb2-4016-9c99-9a59bc06f200","resolution":{"observed_at":"2026-08-06T19:19:29.988956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.979157Z","title":"Rorl: Ro- bust offline reinforcement learning via conservative smoothing.Advances in neural information processing systems, 35:23851–23866, 2022","venue":null,"work_id":"0f6011af-d119-407f-bf60-a5e918dec4e7","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.318638Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9987481154eaae731cc9440e0ffd30216daec29f1758a5ed827b8fb21d237c84","observation_id":"6d05255c-a63e-4185-8418-3899e31904ee","resolution":{"observed_at":"2026-08-06T19:19:29.982313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.972037Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning","venue":null,"work_id":"7318f941-aa49-4c3b-aa8b-0673ed9c87b5","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.320703Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:5eaf23bfa0987ee77030df47ce3096663f9061989dc6438d68a7cedcd2acccc0","observation_id":"0021822e-187f-4dc2-aa2a-15414400336e","resolution":{"observed_at":"2026-08-06T19:19:29.974736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.965238Z","title":"Cross-domain policy adaptation via value-guided data filtering","venue":null,"work_id":"23c5bb8e-7c71-447e-ad62-79b3d269b695","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.322700Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6bd932c24f8cc3dc883b4a1ab31adfb12fd0788a657e841c0bb3f594d421d002","observation_id":"1648d827-69cd-4abd-866e-707f3e859cda","resolution":{"observed_at":"2026-08-06T19:19:29.967484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.957155Z","title":"Cross-domain policy adaptation by capturing representation mismatch","venue":null,"work_id":"6e2a147f-0441-48d6-8de9-bcbc9175a76e","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.324779Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:298150217c6f6542129520ef85a6e80f5855fd718cbfa60bd406d5b79b698895","observation_id":"5cad286d-7c02-4cb0-a929-756ec34e37be","resolution":{"observed_at":"2026-08-06T19:19:29.959892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-06T19:19:29.326782Z","title":"Unsolved problems in ml safety.arXiv preprint arXiv:2109.13916, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.326782Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:14525d8bb4858f78eedd30060397711261106e12bb818d7512d2b8960a3e38d0","observation_id":"b8338a00-9f6c-41d4-b8ef-7e2fa00fc332","resolution":{"observed_at":"2026-08-06T19:19:29.326782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.329102Z","title":"Learning dexterous in-hand manipulation.The International Journal of Robotics Research, 39(1):3–20, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.329102Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:34c8ba00c75fdc1a288e0122eb36f7a88f8cd628ff4812e9a1278ed13a48c110","observation_id":"20628592-55e8-4951-a6f7-9e72589de342","resolution":{"observed_at":"2026-08-06T19:19:29.329102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.944871Z","title":"Network randomization: A simple technique for generalization in deep reinforcement learning","venue":null,"work_id":"a83723f0-3ad2-4ceb-955b-3236356ad36d","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.331474Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7ee7000d161be5f3b692b83406fd700a25738810fc9aecdde19af813b9fae602","observation_id":"ff54dac0-ddf8-4970-a069-6a11f9a2fc24","resolution":{"observed_at":"2026-08-06T19:19:29.947243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.936821Z","title":"Learning domain randomization distributions for training robust locomotion policies","venue":null,"work_id":"7e5ea26c-551c-45a0-a7e3-8c29f863acfa","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.333446Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:bd6a7def3b130813231bab3ca0704180ea20c216a15fbcda4ac206ab00261391","observation_id":"135a6683-631b-424c-98a9-34fcc6649337","resolution":{"observed_at":"2026-08-06T19:19:29.939417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.928474Z","title":"A Markovian Decision Process.Indiana University Mathematics Journal, 6(4):679–684, 1957","venue":null,"work_id":"44ab1d30-3243-4bf2-8f0b-eb770f872723","year":1957},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.335350Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a0e076b5187d45d4a76afa7f92eac6948630e377094df6f93a2bd63582462fed","observation_id":"a7568781-4dda-4914-a03b-96015ec8da77","resolution":{"observed_at":"2026-08-06T19:19:29.931379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.921276Z","title":"Handling black swan events in deep learning with diversely extrapolated neural networks","venue":null,"work_id":"e3171e11-acbd-4aa9-aae8-3cafe84faa6f","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.337048Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9855df3454d82a609be20835bc6bad14a34330c622fe1dc3dbcfc53c0c9a1b88","observation_id":"6ea5ee09-e2c6-453c-abae-4c239af013f0","resolution":{"observed_at":"2026-08-06T19:19:29.924225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.914956Z","title":"Cal-QL: Calibrated offline RL pre-training for efficient online fine-tuning","venue":null,"work_id":"cbe327be-71a2-436e-ae98-09147517afef","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.338908Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a751ef290e69b9c026fee38aa783ab10ab7239f5fcf3211ce623dffb85dbe43d","observation_id":"3d72acdb-e36d-42a2-ab81-a9edbd72c976","resolution":{"observed_at":"2026-08-06T19:19:29.917160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T19:19:29.341183Z","title":"Awac: Accelerating online reinforcement learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.341183Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:1a32ace10524ca739e2ff261a7beaa4797c2dcf4ba890eed89485609ffdf35dd","observation_id":"89de8493-1f4e-4a75-a416-b3beae587f0d","resolution":{"observed_at":"2026-08-06T19:19:29.341183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T19:19:29.343626Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.343626Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b365a618b966fa1d266036b80064e278e29970577c4347933d2787f50899d05b","observation_id":"465d13c9-be27-4ae0-88e8-a76087b78458","resolution":{"observed_at":"2026-08-06T19:19:29.343626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.907857Z","title":"Terry, Ariel Kwiatkowski, John U","venue":null,"work_id":"3eaef437-6c76-48ea-b2f6-28c6d99e3103","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.346020Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b6934390c79fe2238618ba9b64f24a2d8ddcfd7b382e5e0292663be4e4b0b584","observation_id":"9b219c75-4ffa-4510-a637-a87ed8da06a3","resolution":{"observed_at":"2026-08-06T19:19:29.910184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.900401Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"84f6b29f-ea37-4dc4-bf21-356e9670d978","year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.347835Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e18d5c7bdca495c6540929d1fc9952e5ba8345c123e2d453d26d2ef455b7acef","observation_id":"e0d11664-5751-476a-9d5d-27ba11d0f71b","resolution":{"observed_at":"2026-08-06T19:19:29.903281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.349772Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.349772Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:8606f5626ab33d62a5ab76a2011a0328e8ad3807f08cd64bc3730363f6ad1427","observation_id":"d9b9f682-7946-44a3-9028-18bc64fda4c4","resolution":{"observed_at":"2026-08-06T19:19:29.349772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.887893Z","title":"Corl: Research-oriented deep offline reinforcement learning library","venue":null,"work_id":"6f7d38d3-2d48-4f51-9720-b1d01f711878","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.352078Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9742fb135170a6281b40980dee2f72600e2cc39015c20599a42572d4c309ae0c","observation_id":"b1d777a0-3c31-41ae-9faa-2890d9c51f4f","resolution":{"observed_at":"2026-08-06T19:19:29.890616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.354009Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.354009Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6cbdf9e645781cf4eaebb0f6b8f75e4fb8791fc4a0e0049d432eb6a999467387","observation_id":"752d14ce-4484-46ae-bca1-90b40391f100","resolution":{"observed_at":"2026-08-06T19:19:29.354009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.875142Z","title":"Odrl: A benchmark for off-dynamics reinforcement learning","venue":null,"work_id":"1f378fe7-7444-4e90-9d6f-1e2e9949373b","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.356302Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:346696d263581440acbb28e421873c82511b01abec75373109f9357fb802efc9","observation_id":"7a3f1e80-44d1-4aec-bad1-b6334b7b664a","resolution":{"observed_at":"2026-08-06T19:19:29.877656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.867371Z","title":"Darl: distance-aware uncertainty estimation for offline reinforcement learning","venue":null,"work_id":"f3635d08-bbb1-4dba-b91b-6dae70f1e864","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.358703Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e575bb34a42172239d56febeb60f423bbf1859b1c757a365ede35f776107c52d","observation_id":"cb7d1f36-c7fa-42cf-87d0-45e79e5fbf57","resolution":{"observed_at":"2026-08-06T19:19:29.870256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03046","last_updated":"2024-02-05T14:32:00Z","snapshot_observed_at":"2026-07-06T17:25:31.223077Z","submitted_at":"2024-02-05T14:32:00Z","title":"Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03046","snapshot_observed_at":"2026-08-06T19:19:29.360678Z","title":"Open rl benchmark: Comprehensive tracked experiments for reinforcement learning.arXiv preprint arXiv:2402.03046, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.360678Z"},"links":{"cited_paper":"/paper/2402.03046","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e08f021a2d3b73282411b83bff92cff1f553fd0066002f1f5ab2880bf980ccc0","observation_id":"f625135f-81d6-4579-9c72-d976d15e5d46","resolution":{"observed_at":"2026-08-06T19:19:29.360678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.859853Z","title":"Dario Bellicoso, Vassilios Tsounis, Jemin Hwangbo, Karen Bodie, Peter Fankhauser, Michael Bloesch, Remo Diethelm, Samuel Bachmann, Amir Melzer, and Mark Hoepflinger","venue":null,"work_id":"98c8803c-a438-47bd-af57-680b3b8c9db0","year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.362912Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:279bc31665ac66e8471b027c5989dd4fdf5b07bdd8909261521c6ab6594cf36b","observation_id":"c4ce109d-cc73-4469-8485-8f5f7a86c5a1","resolution":{"observed_at":"2026-08-06T19:19:29.862493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.851684Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"2787674f-6cda-445e-8d4a-1cee30c834ef","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.364973Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:8c3ffc75ef8e92d113a4374d7a0ec383cc79e0f82e0e530e4e148c4c4f30903a","observation_id":"50084dd9-436a-4881-bbcc-a0a01590d0ff","resolution":{"observed_at":"2026-08-06T19:19:29.854150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.366871Z","title":"Learning agile and dynamic motor skills for legged robots.Science Robotics, 4(26):eaau5872, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.366871Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4ab363a37fabbb4e7623275dec1099e76e076fd40e6685b492f49ce02d0cba50","observation_id":"d4297451-6beb-4138-ba31-b904e8cbec12","resolution":{"observed_at":"2026-08-06T19:19:29.366871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.839358Z","title":"REvolveR: Continuous evolutionary models for robot-to-robot policy transfer","venue":null,"work_id":"c2450f0c-b5fc-4ce8-b759-a19a7fa207d0","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.368958Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:9b4d9bc06b5e4c2daa3e02120f4ccbb102439c41f4802e9f52a0006e776a509d","observation_id":"9aaf98a9-3769-4d8f-abf7-4fa1ce272a68","resolution":{"observed_at":"2026-08-06T19:19:29.841571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-06T02:09:22.567502Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-06T19:19:29.370866Z","title":"Proto: Iterative policy regularized offline-to-online reinforcement learning.arXiv preprint arXiv:2305.15669, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.370866Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:cef1866dc5763fe04d3814ca2da4f88a2543d11b6a30744010323ea69918f6d6","observation_id":"a8f851a0-5087-40e1-879a-1118306b0361","resolution":{"observed_at":"2026-08-06T19:19:29.370866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.832369Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"ecec27ef-1c90-40f8-b45a-d84e3af31ed7","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.373327Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f2b0a906a8978754add3d9a821c1270f938ac0cd3297d795b3b36c5a27b45302","observation_id":"819b9590-101f-4542-b17c-1bcf0a29a9bd","resolution":{"observed_at":"2026-08-06T19:19:29.835110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.824865Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"90357662-9c43-4a15-9494-64a978141db4","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.375266Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:63f14d56a371ffe8721fa4a6d0bc2899f7120d9d5c9d8c99a45de47702515c3e","observation_id":"f0f42879-8418-4202-aa5e-d81b0f110029","resolution":{"observed_at":"2026-08-06T19:19:29.827539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.817870Z","title":"Tree-based batch mode reinforcement learning.Journal of Machine Learning Research, 6, 2005","venue":null,"work_id":"bc0a59f4-2055-4156-bcd3-84a2e30e716d","year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.377557Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e11c7465ff66e14f9c0d617e170f094ca10b17325cc7fac1cad8251cec9e1c12","observation_id":"29ac67b7-ce28-40b4-8b7b-21d4cd3a7124","resolution":{"observed_at":"2026-08-06T19:19:29.820340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.810681Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"8ca7a341-60a3-46e7-8bff-96dea7087487","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.379882Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:230e63b19db1f44729e3fb40adbfa46c26041d57ae92e0461543cde68550479f","observation_id":"8dfcd02c-6f0d-40ba-add7-c9cfdb0124d1","resolution":{"observed_at":"2026-08-06T19:19:29.813522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.804002Z","title":"Batch reinforcement learning","venue":null,"work_id":"d125a5c2-e668-411f-a878-b0d8e0b09b7e","year":2012},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.382002Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:27a445cc35d37ad25efb4cd3ebccab57a37d43898f4fd72f3a991696b14f4b97","observation_id":"55874838-495d-4e38-bb63-cfb272151dc6","resolution":{"observed_at":"2026-08-06T19:19:29.806240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.796276Z","title":"Critic regularized regression.Advances in Neural Information Processing Systems, 33:7768–7778, 2020","venue":null,"work_id":"df1c5b3a-9778-416b-9ac3-42c768971abc","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.384096Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:db82834d7bf131cc6500482c06ca0ea31f440403f249ed8039caa308a0713b27","observation_id":"e0640f26-8c90-42d9-bbf1-2ffbe8ff7bd0","resolution":{"observed_at":"2026-08-06T19:19:29.799074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.788868Z","title":"Revisiting the minimalist approach to offline reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"2d63df69-0012-418e-b8c2-e7a36ba1e05f","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.386007Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:2504a704e8ea8634e3154a3d063435a52b8b4dc8bae80d7c51ede6f62e94ab50","observation_id":"f78f2176-cf11-4722-8aea-42ac0e26f1ad","resolution":{"observed_at":"2026-08-06T19:19:29.791474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-06T19:19:29.387854Z","title":"Behavior regularized offline reinforcement learning.arXiv preprint arXiv:1911.11361, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.387854Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b21500b17e2b6207df5aa49ed31e2f8cdd353c79db865aef6ffa65da44e0f98d","observation_id":"f2b04cf0-7311-4c3e-92b0-5e76903e2726","resolution":{"observed_at":"2026-08-06T19:19:29.387854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.781563Z","title":"Keep doing what worked: Behavior modelling priors for offline reinforcement learning","venue":null,"work_id":"9b992940-fd33-4d5d-aaa5-7de8258e86d3","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.390019Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a1766771e6f6dd40973f678b80f41564db2441af316510d2c548dc5db306dfdf","observation_id":"1b2f9574-4016-42a6-bb3e-120b67be6ac6","resolution":{"observed_at":"2026-08-06T19:19:29.783948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.773948Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"e0eeec28-3cb8-4088-95f4-3454352c9a18","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.392283Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f481b0de4037af7acabc69ce1d2e8b3d8a29685978f9f58efc223929001ec4dc","observation_id":"bd2927dd-016b-4e78-aed0-376aab5293fa","resolution":{"observed_at":"2026-08-06T19:19:29.776341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.765839Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning","venue":null,"work_id":"7a36f84f-2062-4ef2-a0a3-42c218e85173","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.394549Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6884fd9c687c15d4cd69f40db15a2881af3ce2d567142cf28cee655151fc348f","observation_id":"ccdaffb5-16a9-467c-9476-671ed0365b51","resolution":{"observed_at":"2026-08-06T19:19:29.768826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.758027Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":"89ba8657-879f-4ced-8eb4-12868dc09333","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.396578Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:bbc269b7d8b162687b40c75f1c99646edbac3094949c5fdd2e7eab63535084d7","observation_id":"89e1fb23-82cc-48ab-8963-ad7587a9de85","resolution":{"observed_at":"2026-08-06T19:19:29.760539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.750136Z","title":"Enoto: Improving offline-to-online reinforcement learning with q-ensembles","venue":null,"work_id":"c2c19bd2-f5fa-4754-bde9-4607807d9ba6","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.398569Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b3a1d220353468ab2a392dec583acd859bac5916833822a5c0a9f339c13fe4ec","observation_id":"963958b2-a71a-488e-8987-d9889d18be8f","resolution":{"observed_at":"2026-08-06T19:19:29.753191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.742149Z","title":"Online decision transformer","venue":null,"work_id":"91152a4a-3769-4ccd-b4bb-6bd806acca6a","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.400451Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:71ed005a4923cf09ba75f82961be4b2bf60b4b7e4e748d5b8a1a8d62d225d165","observation_id":"ab3132ae-9778-49a4-84b9-319bea955ec4","resolution":{"observed_at":"2026-08-06T19:19:29.744916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.734940Z","title":"Actor-critic alignment for offline-to-online reinforcement learning","venue":null,"work_id":"34a5b496-6d05-4404-ae39-7e7a540835a3","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.402324Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:6c5e2f8efa2dec54236c16855419ca47054e42a7e2c7aa08a68b95cfb2007901","observation_id":"fb53cca9-2672-4a72-bd95-01c21239d0cb","resolution":{"observed_at":"2026-08-06T19:19:29.737615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.727557Z","title":"Train once, get a family: State-adaptive balances for offline-to-online reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"4ec8f0fd-e901-47f7-b9bc-e36d994448db","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.404627Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7e3f4e922d57459970c14a7486d304bba9cf8484d642ceca2cbba6d8e88f62dc","observation_id":"1df1ff13-ab37-47fc-b576-1c1c66aaeb7e","resolution":{"observed_at":"2026-08-06T19:19:29.730169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.720152Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":"c296da03-def6-42ac-a0cd-5fa3a63ae00b","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.406945Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f2f1a2ae8a85f7213000629a39b007fef950bd4c37eaaea4227b6d2a3c830f57","observation_id":"6e2dcd07-f1b7-45e6-b59d-b4f3974fbdbc","resolution":{"observed_at":"2026-08-06T19:19:29.722584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.713044Z","title":"Albrecht, and Amos Storkey","venue":null,"work_id":"b7974e25-306d-476c-a126-7cbcb92ebf4c","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.409073Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:0f84ff85083565f52e189d68f93e8e16a14b8dd4f736075f389a923e3fdddf39","observation_id":"9faaf102-b410-4ae3-bf10-5977dcb8ff12","resolution":{"observed_at":"2026-08-06T19:19:29.715340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.410801Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.410801Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d4e40d90a857749cd9aceaa4e56cdb4b9e2678ac25029a394c3049e4af08e2b2","observation_id":"aeff3033-7800-4f74-a7f8-cfbab583a70e","resolution":{"observed_at":"2026-08-06T19:19:29.410801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.700892Z","title":"Consideration of risk in reinforcement learning","venue":null,"work_id":"b96f8dc9-e879-4169-92c7-1c59a97a0d85","year":1994},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.412546Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c9e275343c53f5da694b0a16c8fc111c9490c1e7568aadf773cc6d1b5ba3c6b3","observation_id":"866b0f2c-0144-4aa1-857d-504538951ec7","resolution":{"observed_at":"2026-08-06T19:19:29.703434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.414793Z","title":"Robust control of markov decision processes with uncertain transition matrices.Operations Research, 53(5):780–798, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.414793Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:37c8e8d797455bf0cf81ea294d8bd85cdd55b519a7a4db23be763e67fdf0e58c","observation_id":"ad5a7b7e-cd11-4111-a7a1-b6e87ac55b02","resolution":{"observed_at":"2026-08-06T19:19:29.414793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.416648Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.416648Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:2b4588a33598b616e1cb7b0c4a03d66b8f2d4422f93c621cf16175cfae4ec10a","observation_id":"b541c8e6-7200-49c9-8b4e-0ae5f1afcb13","resolution":{"observed_at":"2026-08-06T19:19:29.416648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.418498Z","title":"Enhancing efficiency of safe reinforcement learning via sample manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.418498Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:d68ef722994202c5dca873c5e50dfa29e37e3cff2f3777a43a41a7e88c706b7b","observation_id":"c5de7a59-d088-434c-bc24-6fa26922873b","resolution":{"observed_at":"2026-08-06T19:19:29.418498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.420529Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey.Journal of Machine Learning Research, 21(181):1–50, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.420529Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:196a61ca9f46c2f4379dfcefea50bd19ecdb7f01f89ef76d5cb1caa1b80d90fa","observation_id":"46eeeb28-8e94-4f3c-80ea-c5952b29cf04","resolution":{"observed_at":"2026-08-06T19:19:29.420529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.673363Z","title":"Causally aligned curriculum learning","venue":null,"work_id":"ea0b8d43-a3cf-4be8-baff-a2fd09eccf77","year":2024},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.422499Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4ceebe92d58627ef62d93839cd13cc7d83c62d407b496e9b31b0b9a0c923423c","observation_id":"26abd769-ff08-447c-97a1-4a6cacf296d7","resolution":{"observed_at":"2026-08-06T19:19:29.675926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.424889Z","title":"Au- tomated curriculum learning for neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.424889Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:dd89bb8dc9ce7f37e0868182f3a2b25d35798a62039c70ab055590f8feb5f1d4","observation_id":"44dea0fa-db63-40bf-b85a-0142e4bb4af6","resolution":{"observed_at":"2026-08-06T19:19:29.424889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.426837Z","title":"MIT press, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.426837Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:10c6b47befa0f8e61f22eee1a6a10a068a6f4866d6898d14b47de055ef91074d","observation_id":"7f211236-c2b5-42f5-a24d-baed0cfe0a8c","resolution":{"observed_at":"2026-08-06T19:19:29.426837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.654963Z","title":"Robust training with ensemble consensus","venue":null,"work_id":"e4dc483f-cd02-4f19-9821-4b397a2661fc","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.429055Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e412e251789ad737efbfdc384776b22f0c461e597e38c3706c7f7d8c65038a48","observation_id":"0b4402a7-9aa9-4766-b59a-a16ba0b5de03","resolution":{"observed_at":"2026-08-06T19:19:29.657694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.647648Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":"af93c346-1ee9-40f0-8ca8-58cbbb1678e4","year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.430924Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a88718312cb299cd0bc81e2761969e1120e820033610307fe55c91e24c9bb3bc","observation_id":"3cb9dd47-d8f6-4661-b75f-d620146f0dda","resolution":{"observed_at":"2026-08-06T19:19:29.649950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.639675Z","title":"Improving robustness and calibration in ensembles with diversity regularization","venue":null,"work_id":"f7b31604-6322-4125-af60-239842b87b7e","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.432775Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:e58f1a829bbc9288f6ecb454cfb0d9674038d08d59098d5a75238e37511742da","observation_id":"08ad4517-5379-48f5-a9bb-e9a489d45773","resolution":{"observed_at":"2026-08-06T19:19:29.642590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.632689Z","title":"Maximizing overall diversity for improved uncertainty estimates in deep ensembles.Proceedings of the AAAI Conference on Artificial Intelligence, 34(04):4264–4271, Apr","venue":null,"work_id":"c1c8ec21-01ba-4a27-9c75-97db3801316d","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.434936Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:c3b7f13657968cb0c2b88bc6bb5b206b49d1822d65990b8b854c7ebc48296325","observation_id":"8e4c9760-98c5-4ea7-bce9-973c718bbc77","resolution":{"observed_at":"2026-08-06T19:19:29.635115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.625811Z","title":"Improving adversarial robustness via promoting ensemble diversity","venue":null,"work_id":"a7697a5a-003f-4c43-a1a5-fc809659b022","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.437314Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:beb702e641f3feb44780972ff12cb456f252e08e6190dda47b78bbfa5aab8a1c","observation_id":"497e7924-326b-42e8-856f-d687b10c2d4b","resolution":{"observed_at":"2026-08-06T19:19:29.628329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.618865Z","title":"Webb, Henry W","venue":null,"work_id":"c0a74bc8-91c0-4090-acc3-aad23298a97f","year":2023},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.439174Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:7ef61cde096c71bc5a12accf428b3cbe4c86a71a163f14b8cbabc7afae3ff458","observation_id":"98359dcb-0d9c-4d54-9794-f517139dcc7e","resolution":{"observed_at":"2026-08-06T19:19:29.621218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.611914Z","title":"Ensemble of averages: Improv- ing model selection and boosting performance in domain generalization","venue":null,"work_id":"39075043-2089-48bf-92b1-1d1a1fe2b4ff","year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.441207Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:dcd009541dc7dcd78224e86547f7c1d189394ac3f0c69f9a520b1ec1260a24ce","observation_id":"710834d2-13ba-415a-b6bd-246eb2e3a249","resolution":{"observed_at":"2026-08-06T19:19:29.614250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.604386Z","title":"Noise contrastive priors for functional uncertainty","venue":null,"work_id":"6100757b-2864-4b4a-ac10-5fec6f1fceef","year":2020},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.443024Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:836e3c17cf722641f390c50f03fd83557f27916d91e22fe857591f4a8ce9704e","observation_id":"e261abd3-e9c6-43c6-ac43-171884808c09","resolution":{"observed_at":"2026-08-06T19:19:29.606681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.445060Z","title":"Deep exploration via bootstrapped dqn.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.445060Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:1a06cdfcbf12bee58d5f85edc47bd8b536ff3e6f46a1214e7331063d93c64778","observation_id":"7818270d-e5f4-46ad-8d86-1c2645b3c400","resolution":{"observed_at":"2026-08-06T19:19:29.445060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.591719Z","title":"Sunrise: A simple unified framework for ensemble learning in deep reinforcement learning","venue":null,"work_id":"42acbb43-7b74-491e-a4bb-3c9caa213c8f","year":2021},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.447135Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f24e0ece786a357fa000cad76a8595802aa3684c814da99c786630158f48e5da","observation_id":"684f6ff6-8c3c-4228-81b9-26cf183d0e63","resolution":{"observed_at":"2026-08-06T19:19:29.594053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.584755Z","title":"Accurate uncertainty estimation and decomposition in ensemble learning.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"eb19e7f8-626f-4243-933f-68398708d00a","year":2019},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.449288Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f11f0355fe23ccb3f0b4105fa6e94b077dd4676e30daec1ebe8db298bdd6a442","observation_id":"80a9eb5b-5761-4b2e-85d1-a21f6b0d1547","resolution":{"observed_at":"2026-08-06T19:19:29.587160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01558","last_updated":"2022-06-03T13:20:16Z","snapshot_observed_at":"2026-07-06T13:17:08.463007Z","submitted_at":"2022-06-03T13:20:16Z","title":"Disentangling Epistemic and Aleatoric Uncertainty in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01558","snapshot_observed_at":"2026-08-06T19:19:29.451527Z","title":"Disentangling epistemic and aleatoric uncertainty in reinforcement learning.arXiv preprint arXiv:2206.01558, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.451527Z"},"links":{"cited_paper":"/paper/2206.01558","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:97bb5fe59fc838c344ede01ca4fa728a9526d7eab86010f554babaef1b1a037b","observation_id":"941e3176-5522-4b1d-aa8a-c91731d50bd6","resolution":{"observed_at":"2026-08-06T19:19:29.451527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.453605Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.453605Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f64f238ba0f25129fe3e1076b5df8c123d57bcb4fdee075557f39fb86eb8c24c","observation_id":"42e34f71-1de2-4658-8ed3-6accdde04c70","resolution":{"observed_at":"2026-08-06T19:19:29.453605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T19:19:29.455963Z","title":"Robustness","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.455963Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:4948d5a61c553aa6ad9366665abd3c52a8bb0ad1052a3b433553e8e4f43ff233","observation_id":"8901a11e-c7fc-4d12-85bd-d8f69a797d87","resolution":{"observed_at":"2026-08-06T19:19:29.455963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.573797Z","title":"|R(s, a)−R(s′, a′)| ≤LR (s, a)−(s′, a′) ,∀(s, a),(s ′, a′)∈S×A,(19) and satisfies|R(s, a)| ≤Rmax","venue":null,"work_id":"055e98ff-f69b-4cf1-ba24-17c11558769a","year":null},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.458862Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:5e67397c7e730c118f7fb6d258ff837d6be88438f6d0727c4451d39cda8622d8","observation_id":"1b431425-3d5f-451c-b414-ff3fe25fd0c5","resolution":{"observed_at":"2026-08-06T19:19:29.576167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.566832Z","title":"We acknowledge that real-world contact dynamics can violate global Lipschitz continuity","venue":null,"work_id":"04dface9-6e6c-432d-ba02-b363ca2bf3d6","year":null},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.461201Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:b0df6f5d302ff78e10e681502061ef6c19d09ed6ae118c9745747cf3b9516a78","observation_id":"e0c46e7f-3d9e-44d3-a648-8c53cd3bca6c","resolution":{"observed_at":"2026-08-06T19:19:29.569443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.560266Z","title":"distance","venue":null,"work_id":"a79f78e4-35b7-4030-a61b-fae70adaebaf","year":2000},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.463669Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:f97b77ca2297ef138e395923c5cb0828ef93a8c40b98fb6544be0b3e5cb1e213","observation_id":"dd71c4ac-e2c6-459b-bc1e-a08fa2317c59","resolution":{"observed_at":"2026-08-06T19:19:29.562216Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:19:29.551362Z","title":"• Depending on the country in which research is conducted, IRB approval (or equivalent) may be required for any human subjects research","venue":null,"work_id":"7485250f-794a-4df7-827d-de78ac9dbc33","year":2025},"citing_paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:29.466784Z"},"links":{"citing_paper":"/paper/2507.06111"},"observation_digest":"sha256:a58b801d1bb58c664bc11c92b623f143a8fb330216b0ac0df3056bf2fe9b85d6","observation_id":"b8dd2bd5-6ccc-44d8-8534-bf3960160fc3","resolution":{"observed_at":"2026-08-06T19:19:29.555116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06111","last_updated":"2025-07-08T15:51:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:08:35.359052Z","submitted_at":"2025-07-08T15:51:57Z","title":"Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 2 inbound Pith citation observations for arXiv:2507.06111."}