{"as_of":"2026-08-08T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91c8f5a18603377b115a6644a02b78d94e5f987152b165803fb2740985957c83","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:55:54.416203Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:15.443445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:01:17.482077Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.23871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23871","snapshot_observed_at":"2026-08-07T05:01:17.482077Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","venue":"cs.LG","work_id":"4ce78cd7-6afd-40bd-b4d2-4d6a118e5a08","year":2025},"citing_paper":{"arxiv_id":"2506.10038","last_updated":"2025-06-10T22:37:39Z","snapshot_observed_at":"2026-08-08T07:43:39.610396Z","submitted_at":"2025-06-10T22:37:39Z","title":"Ambient Diffusion Omni: Training Good Models with Bad Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:15.443445Z"},"links":{"cited_paper":"/paper/2505.23871","citing_paper":"/paper/2506.10038"},"observation_digest":"sha256:d067ff5318048a094487f26e527259894ba423f5534ce854ffb5d6451da39fca","observation_id":"a4d3b03d-0631-4e30-a768-51c4b3a89431","resolution":{"observed_at":"2026-08-07T05:01:17.604728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23871/citation-record","integrity":"/paper/2505.23871/integrity","json":"/paper/2505.23871/citation-record.json","paper":"/paper/2505.23871"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.08728","last_updated":"2025-04-21T23:33:05Z","snapshot_observed_at":"2026-07-06T17:44:04.908253Z","submitted_at":"2024-03-13T17:28:20Z","title":"Ambient Diffusion Posterior Sampling: Solving Inverse Problems with Diffusion Models Trained on Corrupted Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08728","snapshot_observed_at":"2026-08-07T12:55:49.402174Z","title":"Ambient diffusion posterior sampling: Solving inverse problems with diffusion models trained on corrupted data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.402174Z"},"links":{"cited_paper":"/paper/2403.08728","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:a159283f2ea80a5ff76e188546a6ca657ee3f0f59fd8a7ce3118b14d215bf189","observation_id":"f07df930-7dab-4be3-9ff6-a941c0221bf2","resolution":{"observed_at":"2026-08-07T12:55:49.402174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14114","last_updated":"2024-05-28T03:11:52Z","snapshot_observed_at":"2026-08-07T15:34:09.926842Z","submitted_at":"2024-05-23T02:41:36Z","title":"Offline Reinforcement Learning from Datasets with Structured Non-Stationarity","version":2},"cited_work":{"arxiv_id":"2405.14114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14114","snapshot_observed_at":"2026-08-07T12:55:54.806488Z","title":"Offline Reinforcement Learning from Datasets with Structured Non-Stationarity","venue":"cs.LG","work_id":"6ec4b832-d114-4c49-a280-4cea7129c487","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.514880Z"},"links":{"cited_paper":"/paper/2405.14114","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5766c5b3a4a1850b5fe3fa06605282c5f2f52b3c1fd2d429032d2b230f78f3ad","observation_id":"6806c56b-80d0-4f93-bbda-f07b6239954e","resolution":{"observed_at":"2026-08-07T12:55:54.927932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.404883Z","title":"Is conditional generative modeling all you need for decision making? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"61073bb9-ade5-4858-bc44-671d0cdf933b","year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.626930Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:7404541f26a54fa70c17817daa98678be8e1a64bbdae4ecdb348973bea65eb28","observation_id":"ae3d6006-5349-4ead-8aad-7106da10dd1f","resolution":{"observed_at":"2026-08-07T12:55:58.447137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.278042Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"943d328f-ce96-4e9a-bee8-4f071bfd40fc","year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.772302Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:71b9b38aed9eff74bcd7b8ccb90dc2094a794a8c1613e3f74b44630d7db99160","observation_id":"4193ddd7-63bf-4de2-b501-5cff4344046b","resolution":{"observed_at":"2026-08-07T12:55:58.320673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-07T08:10:41.731546Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-07T12:55:49.886568Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learn- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:49.886568Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:e8ec28fce6d519b32eb5ae2c4b7c8a9c05b10daf1c4587306d55c2ee52e7e1f9","observation_id":"8fc1e53c-519f-4b0e-996e-c04cbfd6fe86","resolution":{"observed_at":"2026-08-07T12:55:49.886568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:50.011227Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.011227Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:58c51956cd07e376b3b81aa6f0671c6a970bf80c5871673b1218b604b06f7b73","observation_id":"0419cc4f-e479-4089-883d-e7c0c1657164","resolution":{"observed_at":"2026-08-07T12:55:50.011227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:58.127012Z","title":"Exact policy recovery in offline rl with both heavy-tailed rewards and data corruption","venue":null,"work_id":"1a703881-500a-4429-ba08-b78499552681","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.170867Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:79b09bb9f9d570c9c0b2c647f121d3274fa0899ce3f7ab5732a5749a60ea6a82","observation_id":"8b641ced-b476-4710-bf8c-e9cf78a61c58","resolution":{"observed_at":"2026-08-07T12:55:58.188635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.980730Z","title":"Consistent diffusion meets tweedie: Training exact ambient diffusion models with noisy data","venue":null,"work_id":"95f6897a-83d5-42c6-b09d-22874b84e6b9","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.323136Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:83c010ed52308c5ecc7d944f49043dbd390a04f9039c09d9c50bd421dbab81de","observation_id":"901b35f6-a897-4991-b54a-fedcaa433656","resolution":{"observed_at":"2026-08-07T12:55:58.059697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:55:50.472027Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.472027Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:a9974829df04fca294cbb995f9986c1e854ccb917173adfcf4057a3b77588d15","observation_id":"bf4502ff-5025-487b-8de7-5dd4ed9c70ca","resolution":{"observed_at":"2026-08-07T12:55:50.472027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:50.601518Z","title":"A minimalist approach to offline reinforcement learn- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.601518Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:e43fa15b03639256a18341927d133f17e7447749803ac7faba0205d75f24ef9d","observation_id":"c858ef78-624f-42f4-acee-de67074b791c","resolution":{"observed_at":"2026-08-07T12:55:50.601518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.912274Z","title":"Off-policy deep reinforcement learning with- out exploration","venue":null,"work_id":"7e97719b-a210-47e5-9437-822e772e6983","year":2019},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.751884Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:29764b6625bc6aed47c48b8da63c343405ef2ca1aed9ec99beae82e2651599db","observation_id":"70525bd3-df61-4f38-8570-38c8e52a4f78","resolution":{"observed_at":"2026-08-07T12:55:57.948906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.760561Z","title":"Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters","venue":null,"work_id":"66332db5-41e7-4545-bf34-5a6277ae2d54","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:50.996427Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:c379f29eaefafc5ea41e4f223796f8ac50c6c305b2e17f4bce751e074b84dc67","observation_id":"ce47875b-e531-4665-b6ec-30fae9c7a8db","resolution":{"observed_at":"2026-08-07T12:55:57.837287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-07T12:55:51.086548Z","title":"IDQL: Implicit Q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.086548Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:42fd164a760c9f82a3b4e5dec94e350194b13239abf100014052bfe3b1833d92","observation_id":"7bb711e0-81f2-4b51-8742-16ae564a9b2c","resolution":{"observed_at":"2026-08-07T12:55:51.086548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.603645Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"1e6a3c01-0030-4591-a9d0-0810373648d8","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.167694Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:dbc6de3d0f1f814acda2d7de35218d3df2c510e5815e996a41365c5831bc0dd7","observation_id":"044294f5-e2f2-4677-a284-ce6e4a52f95d","resolution":{"observed_at":"2026-08-07T12:55:57.670545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.427295Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"dbfd86ab-e1e4-4a5a-9cce-5ba4f9481ada","year":null},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.268766Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5e13585f532435b0d4489c40a36b5fbc673bc772e6fb1ba420bc2f19f963e025","observation_id":"71b1811b-c4c7-46d2-ad04-06838da71daf","resolution":{"observed_at":"2026-08-07T12:55:57.509450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:51.378863Z","title":"Offline reinforcement learning as one big sequence modeling problem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.378863Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b0d2f9632e6a6d3c3a4c8eb7a80f66229f7f8c6f411d6476ae1dcc46ef7e425c","observation_id":"9dedea89-7914-4726-8c53-7e240630a2fd","resolution":{"observed_at":"2026-08-07T12:55:51.378863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.235478Z","title":"Neural stochastic differential equations for uncertainty-aware offline rl","venue":null,"work_id":"d9e28517-f268-451f-805d-f907bad6705c","year":null},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.479404Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:f9a512da80c05f74adbe7016fcee1a8a1e51757ad7920af7c43151c35390ca9c","observation_id":"e84a4cd2-cafa-47e9-bfc4-3cb71585a727","resolution":{"observed_at":"2026-08-07T12:55:57.302674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:55:51.589000Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.589000Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b2e1da332d47b2a6ae49275aeb256d18cc9d30fd15ec8b0d00fe1e99e262ca5a","observation_id":"c4d21d72-cb97-4cb4-8a73-bdef2ef490e0","resolution":{"observed_at":"2026-08-07T12:55:51.589000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:57.120191Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"493ba833-d490-4262-a366-f88384cb935b","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.696488Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:ae10b0e3ef162162f48295b6779239e9455238091e7f7351d2f4d5199d34cda2","observation_id":"51bdfcb9-5299-48f8-92cf-56ca80169906","resolution":{"observed_at":"2026-08-07T12:55:57.162259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:51.841469Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.841469Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:cc0b0d25f77c0b3463719312ffaf7c186b6237a25e62038ce78f1e9163391de5","observation_id":"506ed5af-a7b9-447f-ab85-59acdc70cfa7","resolution":{"observed_at":"2026-08-07T12:55:51.841469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.979135Z","title":"Survival instinct in offline reinforcement learning","venue":null,"work_id":"c2c94085-51e8-45fc-9251-3c8a30da082a","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:51.953347Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b6d3754a967016600a9d70308d7a82b3fd5fd5b220c77d554e2f1f0ddc625b35","observation_id":"20eb3195-e3be-45c8-8419-0ff7be9c8d52","resolution":{"observed_at":"2026-08-07T12:55:57.021913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04102","last_updated":"2024-05-28T17:11:53Z","snapshot_observed_at":"2026-07-06T17:56:06.438303Z","submitted_at":"2024-04-05T13:58:51Z","title":"ROPO: Robust Preference Optimization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04102","snapshot_observed_at":"2026-08-07T12:55:52.060026Z","title":"Robust preference optimization with provable noise tolerance for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.060026Z"},"links":{"cited_paper":"/paper/2404.04102","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:2d13dfb303a8df98ba7d2ecc1ecd0ba337768c4956e48275252cc37760cc9607","observation_id":"e1eb5478-0d2b-4072-9b61-e5f6d10d193a","resolution":{"observed_at":"2026-08-07T12:55:52.060026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.899825Z","title":"Adapt- diffuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":"52a9416d-84c9-47b1-bf45-2bfeae23c080","year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.171683Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:ec23cbf15b364933b577967868d0f75490330c51a6095fe2b193c250f5054a31","observation_id":"0d4f3c54-dde8-45f3-bd3a-d8f6fc392673","resolution":{"observed_at":"2026-08-07T12:55:56.910769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19909","last_updated":"2024-07-15T10:55:57Z","snapshot_observed_at":"2026-08-01T17:37:51.295130Z","submitted_at":"2024-05-30T10:20:55Z","title":"Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19909","snapshot_observed_at":"2026-08-07T12:55:52.250621Z","title":"Adaptive advantage-guided policy regularization for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.250621Z"},"links":{"cited_paper":"/paper/2405.19909","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:1ba304221c2a522a134dce0ae75f4ffbc635664a1253feed4e9607943b10aeb1","observation_id":"81d71945-2dc4-486e-8ea6-8491f145900c","resolution":{"observed_at":"2026-08-07T12:55:52.250621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-07T12:55:52.349876Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.349876Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:7ec8997fb9a49281b543d5ee966c6b3ddb847ae8010b0074c1ff4fa5ba20ce02","observation_id":"f2c5b186-0fa7-42c0-9625-32b4df67b044","resolution":{"observed_at":"2026-08-07T12:55:52.349876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.724057Z","title":"Robust re- inforcement learning using offline data","venue":null,"work_id":"c7d9ac83-8c7d-4566-92b3-043aba5fdc67","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.492092Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:e91ba374c95e7695c4b7c577303c679e14960897151ee86e7fa364f234688bda","observation_id":"edc02cc5-db76-450b-8169-b5808703197b","resolution":{"observed_at":"2026-08-07T12:55:56.832793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:52.603920Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.603920Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5d7be6788c18c1df8d970628268f4b1704f60567dfae1667c9336fa6583a4756","observation_id":"a4fc0fb9-2b0a-4640-86f5-4b5c9827f731","resolution":{"observed_at":"2026-08-07T12:55:52.603920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.559109Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity","venue":null,"work_id":"02889fff-3944-4086-951a-5c1b3b64542d","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.715087Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:0af9382105000e0c5a5e77aed1c97fcabeecc181a05528513adbff8783001fdd","observation_id":"1d7ba50d-9111-434f-bda0-5b5d009993a2","resolution":{"observed_at":"2026-08-07T12:55:56.620400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20587","last_updated":"2024-12-17T15:59:44Z","snapshot_observed_at":"2026-07-06T16:41:15.446251Z","submitted_at":"2023-10-31T16:24:17Z","title":"Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20587","snapshot_observed_at":"2026-08-07T12:55:52.772925Z","title":"Unleashing the power of pre- trained language models for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.772925Z"},"links":{"cited_paper":"/paper/2310.20587","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:264aec4dc84975a55b9a0bcdc801a9c7da0db9fe22a9db269e595ab660400492","observation_id":"fa6ae2c6-7739-44b5-a371-55c774d36064","resolution":{"observed_at":"2026-08-07T12:55:52.772925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.418369Z","title":"Deep un- supervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"ecdf1b0b-2c46-4a3d-a11f-395a4e1b13f5","year":2015},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:52.882565Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:981a715808f4347fa257a21643b15608775dd1e918dcd39f2b42df81b5c01c05","observation_id":"03cb4af2-56f5-4eba-9fd3-1e8bf8881c8c","resolution":{"observed_at":"2026-08-07T12:55:56.475138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:53.023971Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.023971Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:0ddb5784a4972fed0a24f4b017699cd6fa01a3fac114b2f9276ff87625ce07d8","observation_id":"d95c7342-e74a-4a3f-9126-2545d5b18d35","resolution":{"observed_at":"2026-08-07T12:55:53.023971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.369889Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"41ec4a70-b7b2-414d-adbe-b63c340cb381","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.157210Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:863b48379c29f9bfbb534b41aea52c2610f4daba14135fa5013b072c51d9be55","observation_id":"e72e98e9-8ea3-4648-9020-99c453556ca2","resolution":{"observed_at":"2026-08-07T12:55:56.382385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08398","last_updated":"2022-03-16T05:02:47Z","snapshot_observed_at":"2026-07-06T12:48:23.739370Z","submitted_at":"2022-03-16T05:02:47Z","title":"COPA: Certifying Robust Policies for Offline Reinforcement Learning against Poisoning Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08398","snapshot_observed_at":"2026-08-07T12:55:53.257474Z","title":"Copa: Certifying robust policies for offline reinforcement learning against poisoning attacks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.257474Z"},"links":{"cited_paper":"/paper/2203.08398","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:5df2874897928db77db4a4cbfa4b383970327ccd7bfa6199f0b3a88bb972ef20","observation_id":"397d09de-2df4-4cfc-b15f-04cefe7ba833","resolution":{"observed_at":"2026-08-07T12:55:53.257474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.223817Z","title":"Tackling data corruption in offline reinforcement learning via sequence modeling","venue":null,"work_id":"fa754750-cd35-427f-b0de-4798b08fd720","year":2025},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.375177Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:0eb997d1007872eb13a30e340d1604d7bcbd62b93d28f13e2b1986e7c76ec96f","observation_id":"ae603eeb-7d7a-43b2-86bc-6f252b7d7d6a","resolution":{"observed_at":"2026-08-07T12:55:56.317012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:56.045082Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":"4ac05d0b-fabc-48ea-9639-4bd983e72149","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.461873Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:91e476c139f6fba19e4287b059849300621164eee5a6f0c8a449d9a9243e95bb","observation_id":"bec7e5bc-db01-4841-ab8d-ae899f31e0dc","resolution":{"observed_at":"2026-08-07T12:55:56.126296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-07T12:55:53.556785Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.556785Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:b3a788f29ce6a16a6f8a8af5a4f374a2840a577285b4097cc8488d1cbce6c1dc","observation_id":"c2be624d-9675-487d-92de-65d134ad6429","resolution":{"observed_at":"2026-08-07T12:55:53.556785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.901864Z","title":"Towards robust offline reinforcement learning under diverse data corruption","venue":null,"work_id":"4b17ba38-a363-42c6-bcae-c98ac123084e","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.638459Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:937f375c5a32609d05d253183bc8e59b111edb1a5c50bdf4e3a0821775848d43","observation_id":"dc6e40a4-8c22-499d-916f-38b0606a70ab","resolution":{"observed_at":"2026-08-07T12:55:55.958959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.695650Z","title":"Dmbp: Diffusion model-based predictor for robust offline rein- forcement learning against state observation perturbations","venue":null,"work_id":"d3d7151b-b3ea-45b2-9c52-f304e5be3ba4","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.766842Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:392bb12bc36a7b864a63528ec2de04a53d1aa53bfe59d6a41f08b51f7490eb66","observation_id":"c23335ab-2839-49a6-ba43-d10898ab60cb","resolution":{"observed_at":"2026-08-07T12:55:55.796509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08991","last_updated":"2024-07-20T15:23:25Z","snapshot_observed_at":"2026-08-07T00:44:56.876662Z","submitted_at":"2024-02-14T07:27:30Z","title":"Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08991","snapshot_observed_at":"2026-08-07T12:55:53.920438Z","title":"Towards robust model-based reinforce- ment learning against adversarial corruption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:53.920438Z"},"links":{"cited_paper":"/paper/2402.08991","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:c07f0f1310e4991a52a87a0f554dc268250363cf490dd0c4ecddf9320661bccd","observation_id":"942f13a5-48d8-4637-8b4e-3dcb9e0b5a7a","resolution":{"observed_at":"2026-08-07T12:55:53.920438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.535476Z","title":"Corruption-robust offline reinforcement learning with general function approximation","venue":null,"work_id":"5082c3dd-fd8a-430e-9bec-f74ce6c360ac","year":2024},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.057000Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:9fc055ebbee0e6f71c20b6b776c4eab94a0e4064614b13800ea908e5695fb136","observation_id":"02a95ecd-77eb-4bc1-9265-743cc4e120cc","resolution":{"observed_at":"2026-08-07T12:55:55.607965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08452","last_updated":"2021-01-21T05:38:52Z","snapshot_observed_at":"2026-07-06T10:34:16.058281Z","submitted_at":"2021-01-21T05:38:52Z","title":"Robust Reinforcement Learning on State Observations with Learned Optimal Adversary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08452","snapshot_observed_at":"2026-08-07T12:55:54.213230Z","title":"Robust reinforcement learning on state observations with learned optimal adversary","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.213230Z"},"links":{"cited_paper":"/paper/2101.08452","citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:d80a51974d9d106370cc7b6390c2ee561a16d2209ae5a638b455638be94caea9","observation_id":"b9ecdb87-ee50-4795-8257-fb15e3942fd9","resolution":{"observed_at":"2026-08-07T12:55:54.213230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.326218Z","title":"Robust deep reinforcement learning against adversarial perturbations on state observa- tions","venue":null,"work_id":"0bcc201e-018f-4f47-b38b-9369abb0e0bb","year":2020},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.309588Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:9c6c56beef05b5bd83e87436e4378c8e93d9704f7da945337f9f5c7d4c88ea12","observation_id":"5871579f-6a8d-4d36-901e-99fe7a7e3c0c","resolution":{"observed_at":"2026-08-07T12:55:55.473965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:55:55.101762Z","title":"medium-replay- v2","venue":null,"work_id":"b8850552-48b7-415a-a746-0e84307be060","year":2022},"citing_paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:55:54.416203Z"},"links":{"citing_paper":"/paper/2505.23871"},"observation_digest":"sha256:9bed400f0d8868047318aa4905913f79ca42b51359b6803c187a58afd3e05020","observation_id":"3eac0b00-c5a7-4c4f-bb3a-438918897dbf","resolution":{"observed_at":"2026-08-07T12:55:55.236937Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23871","last_updated":"2025-06-05T03:54:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:45:19.674170Z","submitted_at":"2025-05-29T11:36:41Z","title":"ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.23871."}