{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93acb0c275bd7d49ff7dd1d8c98cc802eb8e4d6f5e5903a5cdeacb03675b4eb9","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:35.725134Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02356/citation-record","integrity":"/paper/2507.02356/integrity","json":"/paper/2507.02356/citation-record.json","paper":"/paper/2507.02356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:38.388315Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":"a9822e4d-0890-4f6b-8e94-e2c0f4e443dc","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.737091Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:d22c9fa409c321bb4b138c5aee2bd4a8cbe6aff91cbec265ebf1686063560ba0","observation_id":"1da2545c-de84-4043-9793-2d18e1ffe030","resolution":{"observed_at":"2026-08-06T20:38:38.434048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T20:38:31.842375Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.842375Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:cc48a0ac96942a6428ab55e67be838921acec72a459a9cb22d362edad17caf7a","observation_id":"3e5d8264-1aa1-4027-9faf-c087bdbf7e9a","resolution":{"observed_at":"2026-08-06T20:38:31.842375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-07-06T13:57:36.100400Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-06T20:38:31.961205Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:31.961205Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:15aef92020125e252c4a158aa8e9ec8f8c47afaf485830b2e0651de04377d163","observation_id":"dede0fb2-7726-4036-bc49-c3a9da87a142","resolution":{"observed_at":"2026-08-06T20:38:31.961205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07297","last_updated":"2024-03-15T03:42:03Z","snapshot_observed_at":"2026-07-06T16:31:03.559653Z","submitted_at":"2023-10-11T08:31:26Z","title":"Score Regularized Policy Optimization through Diffusion Behavior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07297","snapshot_observed_at":"2026-08-06T20:38:32.067287Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.067287Z"},"links":{"cited_paper":"/paper/2310.07297","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:cb2f6a791985caef6ac2baf836bfb20ebb9e4922d3c48d948d43ac446588f70d","observation_id":"f7d77ab3-7008-4262-a7e8-eb0341d5621b","resolution":{"observed_at":"2026-08-06T20:38:32.067287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19690","last_updated":"2024-10-31T18:09:38Z","snapshot_observed_at":"2026-08-02T14:04:10.719542Z","submitted_at":"2024-05-30T05:04:33Z","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19690","snapshot_observed_at":"2026-08-06T20:38:32.141102Z","title":"Diffusion policies creating a trust region for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.141102Z"},"links":{"cited_paper":"/paper/2405.19690","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:1b70b46a5ddc93617bea695d9d8aa3a1de9e48a62de72ea19e2f958ba9f64720","observation_id":"30bc8fe0-d178-4f77-ac42-81ce3fe4e4d5","resolution":{"observed_at":"2026-08-06T20:38:32.141102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09788","last_updated":"2022-04-12T10:54:53Z","snapshot_observed_at":"2026-08-05T09:25:47.669710Z","submitted_at":"2021-12-17T22:04:55Z","title":"Heavy-tailed denoising score matching","version":2},"cited_work":{"arxiv_id":"2112.09788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09788","snapshot_observed_at":"2026-08-06T20:38:35.958263Z","title":"Heavy-tailed denoising score matching","venue":"cs.LG","work_id":"32ba7ac9-352e-454f-8ba4-a5edec96ff3b","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.216742Z"},"links":{"cited_paper":"/paper/2112.09788","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:1d1a272d6e630abeecdcb137226051a074b9f422d1f725348c3017b665af5770","observation_id":"270e3281-3349-405a-be63-20c824aff9ab","resolution":{"observed_at":"2026-08-06T20:38:36.017010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T20:38:32.343671Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.343671Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:10123c65941473cb3d8bc6058338a7b9a04483adfdf06b6ea9e90910ef3efa18","observation_id":"cfd8ec7d-c3f3-4b95-a8e1-9eed79c10ea8","resolution":{"observed_at":"2026-08-06T20:38:32.343671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.427027Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.427027Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:c37edd34a49e2dddaf9618077cc23cb0dc3ba483eabc78a0d52f302ab92a53d9","observation_id":"2458abd8-0a18-49dc-8f1e-74484648aefc","resolution":{"observed_at":"2026-08-06T20:38:32.427027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.494366Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.494366Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:4ff4415ae9d9d6c2129776b9c20c85bb0c0e2d28b26f86380ce2ae5064881c5b","observation_id":"fe4cf0f3-adb7-45c5-9de0-b0f5b52e3330","resolution":{"observed_at":"2026-08-06T20:38:32.494366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.621106Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.621106Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:0dacf84f8c76733f18917ccc07a70e81bf39fd2b181421bc647313aaa3efc830","observation_id":"3b8f0a35-73b2-4bb6-91b2-d81f6d6e16cc","resolution":{"observed_at":"2026-08-06T20:38:32.621106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.743577Z","title":"Calculus of variations","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.743577Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:4404dc377dcf05e46bbae5895d912a9566c8c76a7e5dda1770389423bfcd3d7f","observation_id":"0bdfee5c-e361-4565-82e3-156ebaf484f5","resolution":{"observed_at":"2026-08-06T20:38:32.743577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-06T20:38:32.861799Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.861799Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:0910d43b4f82e29214e7462f6a35e4ec4d6e44c510bca945f3f2c032c3c9a4ab","observation_id":"44a5caa0-2ef4-435c-bf9d-d4675b8f5884","resolution":{"observed_at":"2026-08-06T20:38:32.861799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:32.978532Z","title":"Estimation of non-normalized statistical models by score matching","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:32.978532Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:2fbacbc0f3e15f5c53797f60300af16f1d8258012e250297440a2fe062ac2307","observation_id":"3fd83fcf-0547-4a0b-9dc1-ecabbe7bc4a1","resolution":{"observed_at":"2026-08-06T20:38:32.978532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:38.130569Z","title":"Understanding diffusion objectives as the elbo with simple data augmentation","venue":null,"work_id":"9cdff22a-e327-4dfb-ba09-7cba9ab9f019","year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.074290Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:0f45f6321eae5207ed7d1ff6334e47d24ff0d77975f0b5351be2d5fd543cdb62","observation_id":"23d6c552-6feb-46af-97a5-0fbb323cb07f","resolution":{"observed_at":"2026-08-06T20:38:38.232042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T20:38:33.201984Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.201984Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:4b8beed47bcbc6299827906c1011e90138acd314b0a8ccffb86b8fc62fddb2d9","observation_id":"0601121a-7f5e-46fb-ab8b-600e70a417b3","resolution":{"observed_at":"2026-08-06T20:38:33.201984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T20:38:33.288918Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.288918Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:5c3aeb38420c1e31b3119835b6a335c8cbd9b3cdfee67826c172a80b4bddcd3f","observation_id":"8dcf4a96-1f10-4f7d-8c6b-853a671b92f4","resolution":{"observed_at":"2026-08-06T20:38:33.288918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:33.405392Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.405392Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:7c4c26c3a0da480cdbf92ea66b3146f9b4a475f77ced8c3f6c45c7bd411dde70","observation_id":"09e7a1eb-a7a6-4c39-b6e4-c53cf57c1574","resolution":{"observed_at":"2026-08-06T20:38:33.405392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.980405Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"61cff2e7-58d6-4134-9fc5-1fb7b8f35549","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.524554Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:7501b625e66d7ef5bab9507d1a3214ae21acd0b388ddbb3a08780804d82df6ee","observation_id":"bcf8ceda-bcaa-428f-bb39-bc5937405986","resolution":{"observed_at":"2026-08-06T20:38:38.059986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.786529Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":"c1410aac-2df8-4dbf-ae58-4a4a4382deaf","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.627961Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:d6454af5281ed632c33c9e071e468be600a04e1849b809ae991a7d965ca26109","observation_id":"41b9557a-32c3-4a56-ba75-368c9b45e136","resolution":{"observed_at":"2026-08-06T20:38:37.879872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.629124Z","title":"Batch reinforcement learning with hyperparameter gradients","venue":null,"work_id":"82bff7e2-f044-4ae0-b24c-cc2e0b3da907","year":2020},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.739155Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:bf4cb5b4bcfc16c30591741581511dcc7e74b6e79d73ae874761a26205d33b0d","observation_id":"55ec212d-70ea-418b-a4dd-af6133addaaa","resolution":{"observed_at":"2026-08-06T20:38:37.675965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.389012Z","title":"Learning energy-based models in high-dimensional spaces with multiscale denoising-score matching","venue":null,"work_id":"d18aaf50-7538-453d-9979-4f697fb45f21","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.848855Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:19b7369d3fd5df8e5e0d3cf38e4ac2cd23eb6d9bf4564bde607859c76fe66a72","observation_id":"ec0ef95b-8d50-4a57-abaf-d3cabbd5cc84","resolution":{"observed_at":"2026-08-06T20:38:37.521833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:37.145981Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"554f8292-d161-498c-8709-4ea3745e5800","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:33.985104Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:c7085d9cd13f33a21e8aa12dc23e236f2d2cb0765d37f6d3f30ae828cd0ec8af","observation_id":"d3ce1b0b-1a87-4a90-96ad-568a994fe870","resolution":{"observed_at":"2026-08-06T20:38:37.258953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-06T20:38:34.078884Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.078884Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:7c8a8244e79a21c3ee93c0e2df104cbd2474ee3f88f35b50be7d70416af11509","observation_id":"51d92faf-a390-4ba8-9e6e-a0c6d0d6d8af","resolution":{"observed_at":"2026-08-06T20:38:34.078884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.999984Z","title":"Anti-exploration by random network distillation","venue":null,"work_id":"60ec76c5-b946-481a-8a8f-dec687c3728f","year":2023},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.197168Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:5a9db27c6c949d4029f96fda985b63672d688f8949c649f786e9e96a448121c2","observation_id":"baf425d1-58da-4a6f-bb21-d574dbcd88a6","resolution":{"observed_at":"2026-08-06T20:38:37.079058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14171","last_updated":"2024-10-29T09:59:22Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T04:29:46Z","title":"Heavy-Tailed Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14171","snapshot_observed_at":"2026-08-06T20:38:34.311608Z","title":"Heavy-tailed diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.311608Z"},"links":{"cited_paper":"/paper/2410.14171","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:11722bcbcedd9abcc5998a6a699161f0a64267ceeb9f3c4f34d90693bd6082be","observation_id":"b65795e4-72c4-4282-bfeb-70a1979aaa5b","resolution":{"observed_at":"2026-08-06T20:38:34.311608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-06T20:38:34.429681Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.429681Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:93bacbb188bfd207e04700ec3d493abbae37263634a5a94c36415cd78b9b69e6","observation_id":"78e68a9c-3574-42a0-8af4-e66fd739dad3","resolution":{"observed_at":"2026-08-06T20:38:34.429681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.852200Z","title":"Efficient differentiable simulation of articulated bodies","venue":null,"work_id":"fae755c7-5137-44af-b349-77ab751e3dca","year":2021},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.550267Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:87cb965dc7652b16eac062f8e62dfecb4d84a9f4a3c7545d5faae81bbb5f506d","observation_id":"c922708f-0235-4672-9a6f-680c9919918d","resolution":{"observed_at":"2026-08-06T20:38:36.915029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.665040Z","title":"Offline reinforcement learning as anti-exploration","venue":null,"work_id":"973efc45-461e-4a27-b6d2-ee39cc07da43","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.671019Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:3c2962ead49666abe21aa2b3357c57ce4c2892a967c6f82871ac0f2b9c0437ee","observation_id":"995cbc0a-a10c-42ba-8e3e-cbb70fa0c5ac","resolution":{"observed_at":"2026-08-06T20:38:36.743353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.489331Z","title":"S4rl: Surprisingly simple self-supervision for offline reinforcement learning in robotics","venue":null,"work_id":"f3d05c68-4b04-4cdd-99fb-c7d3d518c165","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.772132Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:e60829e5817feaf00c05fab0d8a83a39a42c5ed7f90b6873c9fece64de2bff71","observation_id":"de5bffb6-547d-4f2c-a9f5-e3254fbdfef1","resolution":{"observed_at":"2026-08-06T20:38:36.568452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:34.862757Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.862757Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:23d5d91f86b42c28c910cf779589ff75adb439f66853312b4b947812b6f32ea5","observation_id":"bb38a4bf-2c58-4375-80ea-5a4aa65b7b1e","resolution":{"observed_at":"2026-08-06T20:38:34.862757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T20:38:34.981272Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:34.981272Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:5a5933795686906f102e96abef0671dc7525e12d41dd5b9a24536468ca530c63","observation_id":"8a2cce95-1e29-4969-ab39-8b4baee2e0c2","resolution":{"observed_at":"2026-08-06T20:38:34.981272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.087356Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.087356Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:26f25bbfc195c1e6afe53e636591b78fd9d55503ab98d6fa9f59d0910f4ed9cd","observation_id":"af1d8a34-686b-4d5f-8006-e3459a95c306","resolution":{"observed_at":"2026-08-06T20:38:35.087356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:35.208587Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.208587Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:31cae1119d44079b5c80e93800e9cb55cac4c1bd685b189c82e921a5c734c4e2","observation_id":"78e6b11b-7441-4184-b72d-1864ae3d9c6f","resolution":{"observed_at":"2026-08-06T20:38:35.208587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-06T20:38:35.366704Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.366704Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:cc5a9ca045c3087592ddbe074d71584eac6f100bd98263a99e3f6c9bab6f9c9d","observation_id":"95dc4f19-86d8-4674-8e21-89a853191561","resolution":{"observed_at":"2026-08-06T20:38:35.366704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.283703Z","title":"On scale mixtures of normal distributions","venue":null,"work_id":"501ccfc0-493c-4a15-8a92-20d1aefb798c","year":1987},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.479265Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:caa5a3926f5e7a31b82a7fd31d4a6ccad6a44cf71c70038e56164eccf31012ed","observation_id":"0cfadee7-393b-42d9-8e70-a045f47d28c7","resolution":{"observed_at":"2026-08-06T20:38:36.366574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09750","last_updated":"2024-05-20T02:12:21Z","snapshot_observed_at":"2026-07-06T17:17:11.535092Z","submitted_at":"2024-01-18T06:32:53Z","title":"Exploration and Anti-Exploration with Distributional Random Network Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09750","snapshot_observed_at":"2026-08-06T20:38:35.625180Z","title":"Exploration and anti-exploration with distributional random network distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.625180Z"},"links":{"cited_paper":"/paper/2401.09750","citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:3ba80ee4990b42bf2c2fadc5dec0e43ad4d5b7417791e60c5c3c19dc4267319e","observation_id":"993d3e30-6b2c-4ac3-b75d-ea23486c921c","resolution":{"observed_at":"2026-08-06T20:38:35.625180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:38:36.106433Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":"2d03ac04-4a27-4890-a228-841b28824769","year":2022},"citing_paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:35.725134Z"},"links":{"citing_paper":"/paper/2507.02356"},"observation_digest":"sha256:1a6cc83f325dd5c6db8c1f52a8b63a22c0ca17359ca1c9c2405bc2543bb88ff8","observation_id":"bea9b73e-a826-4506-ab75-db014269a869","resolution":{"observed_at":"2026-08-06T20:38:36.183894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02356","last_updated":"2025-07-03T06:41:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:29:15.590198Z","submitted_at":"2025-07-03T06:41:03Z","title":"Offline Reinforcement Learning with Penalized Action Noise Injection"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.02356."}