{"as_of":"2026-08-08T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca7ddd5a14675e82a656aa57006945bc7f4349086aae1048710efe3fbc18e23e","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:39:25.695375Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:37.619351Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T07:35:29.370333Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-08-07T14:20:37.619351Z","title":"Behavior-regularized diffusion policy optimization for offline reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20350","last_updated":"2025-05-26T03:42:20Z","snapshot_observed_at":"2026-08-08T01:01:01.114971Z","submitted_at":"2025-05-26T03:42:20Z","title":"Decision Flow Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:37.619351Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2505.20350"},"observation_digest":"sha256:56ac72c727a83e0118453ef18ddfacfdae3007f2aa74b931b819c89368de6383","observation_id":"2dff5418-ebe0-492d-be11-b3819b4cd23c","resolution":{"observed_at":"2026-08-07T14:20:37.619351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.04778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Behavior- regularized diffusion policy optimization for offline reinforcement learning.arXiv preprint arXiv:2502.04778","venue":null,"work_id":"47822a5b-9a48-4dd2-baeb-1dfe7efa14e5","year":null},"citing_paper":{"arxiv_id":"2510.03508","last_updated":"2026-05-22T04:10:55Z","snapshot_observed_at":"2026-08-02T14:15:10.091088Z","submitted_at":"2025-10-03T20:47:24Z","title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T07:31:27.330951Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2510.03508"},"observation_digest":"sha256:dca766e6c0ed0d18b8a4e001303cfc2c3f48f7decfa154a544689079222eae75","observation_id":"64bb61ce-4e78-461e-abf5-ab87c39ae074","resolution":{"observed_at":"2026-05-25T07:35:29.373696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2502.04778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Behavior- regularized diffusion policy optimization for offline reinforcement learning.arXiv preprint arXiv:2502.04778","venue":null,"work_id":"47822a5b-9a48-4dd2-baeb-1dfe7efa14e5","year":null},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:e4ea6897adff38caa5afca5e070b5f11f5b1b63bc5b7fb811fb279b8d4efd938","observation_id":"0223a517-9a63-446c-864c-802982f50c09","resolution":{"observed_at":"2026-05-11T08:56:00.695725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04778","snapshot_observed_at":"2026-08-06T00:32:46.502554Z","title":"arXiv preprint arXiv:2502.04778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01205","last_updated":"2026-08-02T12:42:20Z","snapshot_observed_at":"2026-08-08T14:31:26.602348Z","submitted_at":"2026-08-02T12:42:20Z","title":"ReBRAC-v2: The Return of the King","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T00:32:46.502554Z"},"links":{"cited_paper":"/paper/2502.04778","citing_paper":"/paper/2608.01205"},"observation_digest":"sha256:3e83a249690654be2c8021cedd066a392fafb02c5e3eca2162d28190cf206783","observation_id":"aeb489c3-3cea-402c-9aba-b3e92b38eb51","resolution":{"observed_at":"2026-08-06T00:32:46.502554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04778/citation-record","integrity":"/paper/2502.04778/integrity","json":"/paper/2502.04778/citation-record.json","paper":"/paper/2502.04778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.474805Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.474805Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:db5d5a757308a028b8b19f2d1efccf649eabf8c531e81e44cb840f9f3e59d52a","observation_id":"bc0f9384-b69d-47e5-8df9-e3e8431593a4","resolution":{"observed_at":"2026-08-08T21:39:25.474805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.341135Z","title":"B., Jaakkola, T","venue":null,"work_id":"6b06245d-6232-40a2-8f4b-641001cd8001","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.480286Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:2bce5458ba1cf3443065ee86050d9d1bb7c38727a1315c86008c7d4c5abac3c1","observation_id":"b84becd1-6a52-45f9-9b6b-daf926ec93b4","resolution":{"observed_at":"2026-08-08T21:39:26.344765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.330201Z","title":"J., Mittal, S., Lemos, P., Liu, C., Sendera, M., Ravanbakhsh, S., Gidel, G., Bengio, Y., Malkin, N., and Tong, A","venue":null,"work_id":"5b913561-8bd4-4a39-9f00-e443744c2640","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.486379Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:28b3ddf37ce0203b8d9e68c6888383690e1cf8b7e01424bbefac2d114469d7ee","observation_id":"dfa42f6d-da44-4b8a-bfdd-2a3b22071f04","resolution":{"observed_at":"2026-08-08T21:39:26.334319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12399","last_updated":"2024-10-30T14:34:49Z","snapshot_observed_at":"2026-07-06T18:16:59.602510Z","submitted_at":"2024-05-20T22:51:05Z","title":"Diffusion for World Modeling: Visual Details Matter in Atari","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12399","snapshot_observed_at":"2026-08-08T21:39:25.490636Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.490636Z"},"links":{"cited_paper":"/paper/2405.12399","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:612ff109aded9ca53028b0827e2ed831b5df014a9fd698e2d20f6e091c5cec2e","observation_id":"6c35250c-f24c-4a6b-861f-18c5d50c6d09","resolution":{"observed_at":"2026-08-08T21:39:25.490636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.319016Z","title":null,"venue":null,"work_id":"93e56b8d-b14b-49ab-96de-423b1a405f0d","year":2021},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.495286Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:40744386e1848c68e88379d29faa959307f884f7f33e7e2cdaa81db03cbb8c70","observation_id":"1072c14c-59e1-4a7b-aae5-296ffb35572e","resolution":{"observed_at":"2026-08-08T21:39:26.323208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.307692Z","title":"Pessimistic bootstrapping for uncertainty-driven offline reinforcement learning","venue":null,"work_id":"953eaa00-52e5-4ce0-b832-fb8cc8fb240d","year":2022},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.500394Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:e767ae45033822e71931b3b2edd992adb0fee385fdbc8e420231d51e8d968c62","observation_id":"1d150672-ea73-487e-b447-673d493ea98c","resolution":{"observed_at":"2026-08-08T21:39:26.311997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-08T21:39:25.504501Z","title":"Open AI gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.504501Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:77e7f8d5a9e1e860abc79483e572ab82d7fb699143bb5058ba00590bc1bd9de0","observation_id":"fc0daf05-356a-41eb-bb0a-c85c74093eef","resolution":{"observed_at":"2026-08-08T21:39:25.504501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.296096Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"97f9a5a0-974a-40aa-b111-eb58e17d4af7","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.509341Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:395569f6d47efd642a10af4e696624a86924c3cbf56e51aed78e885caf4ee101","observation_id":"ea94de36-52cd-4a73-bfc4-c66da9fa4931","resolution":{"observed_at":"2026-08-08T21:39:26.300746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.284748Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":"1219b5e0-0cfa-4b9e-acf4-fd217e496c18","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.513147Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:ad59973eeeaef8920a6841ea40928cd1b12d4ac3ebd1f20c36920084379a59cf","observation_id":"a6a68adb-37a2-41b2-9119-71d28b172b20","resolution":{"observed_at":"2026-08-08T21:39:26.289147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.273645Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"35afd27a-979d-4c65-9a98-c8b9fa060644","year":2021},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.517080Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:08989de8884c5dfb0e4f23cadb115802441dcb31ad0f2aa5d62d3e42c4081b2b","observation_id":"57e40425-0256-4553-a9b5-24acb4847201","resolution":{"observed_at":"2026-08-08T21:39:26.277563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19690","last_updated":"2024-10-31T18:09:38Z","snapshot_observed_at":"2026-08-02T14:04:10.719542Z","submitted_at":"2024-05-30T05:04:33Z","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19690","snapshot_observed_at":"2026-08-08T21:39:25.521307Z","title":"Diffusion policies creating a trust region for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.521307Z"},"links":{"cited_paper":"/paper/2405.19690","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:f96d4d9be9fe0a1d472fdd05661a3985a132e21c2c199858ce805cf880ea552e","observation_id":"8cfc379a-7beb-4dde-b478-966e54f3f4e9","resolution":{"observed_at":"2026-08-08T21:39:25.521307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-06T11:56:09.577967Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-08T21:39:25.525912Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.525912Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:830d500d2f1da4b45a843064f104dbfd993b11dc6d3195e664883178c2b17f65","observation_id":"297a5d88-0833-4fa6-9b98-c16ed13bda4e","resolution":{"observed_at":"2026-08-08T21:39:25.525912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20555","last_updated":"2025-02-25T06:33:21Z","snapshot_observed_at":"2026-07-06T18:23:05.893052Z","submitted_at":"2024-05-31T00:41:04Z","title":"Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20555","snapshot_observed_at":"2026-08-08T21:39:25.530151Z","title":"Diffusion actor-critic: Formulating constrained policy iteration as diffusion noise regression for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.530151Z"},"links":{"cited_paper":"/paper/2405.20555","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:77d607ef6feb36f203732f4799f4a12a489be0771c4358764d20ca23315d9ac4","observation_id":"c8cfc308-5b73-4999-aa3f-40b86b9361f0","resolution":{"observed_at":"2026-08-08T21:39:25.530151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.262651Z","title":"MINDE : Mutual information neural diffusion estimation","venue":null,"work_id":"4b1fea01-bfa8-426f-8e6a-c346b596202e","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.534070Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:05f6a2d91bf217806f123dddd3633beacaa1a84aa4811ebff50040084ee93168","observation_id":"a9fcfcbd-3dc5-46d7-b40b-d39d6be4305c","resolution":{"observed_at":"2026-08-08T21:39:26.266493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-08T21:39:25.537582Z","title":"D4RL: D atasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.537582Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:a21166d35f4093f75038226b84894dfc64d097cd7a99d23506d80f74ff009b65","observation_id":"3b526906-b1df-4430-b892-c4c171b50159","resolution":{"observed_at":"2026-08-08T21:39:25.537582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.251195Z","title":"and Gu, S","venue":null,"work_id":"b7f4d3dc-a432-42af-a9cc-b81e668f908a","year":2021},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.542267Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:ae5c8bc67d914b2fb492d046aa7d3beccc68d1c216be1b96ab45981c9dbf40de","observation_id":"3ea32e31-4370-48a4-ad60-17dc9e5f4b71","resolution":{"observed_at":"2026-08-08T21:39:26.255012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.239319Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"4a5b40fa-db2d-439c-ac59-2f221768c179","year":2019},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.545894Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:14ac4bcceddac0327e42250e7e3d2e4ebd873a73e8002f9a06b1816a054df37c","observation_id":"893e10de-8379-4a77-932b-41609f15d7ff","resolution":{"observed_at":"2026-08-08T21:39:26.243172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.228258Z","title":"ACT: E mpowering decision transformer with dynamic programming via advantage conditioning","venue":null,"work_id":"83d7d4db-7afc-4d71-b878-aff9932d00d8","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.549400Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:9ec204c721f80a9ba1d137ccdc2839b420abc5f04daf70d02efd36d1f92b7255","observation_id":"a131e68b-d2ef-4822-a1c2-b4092ef812dd","resolution":{"observed_at":"2026-08-08T21:39:26.232056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.215801Z","title":"Extreme Q -learning: Maxent RL without entropy","venue":null,"work_id":"1827f5ba-82d8-4686-8f03-2ab483a0b49d","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.553170Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:ab7328025ec1b47e1f3738c57d08203b1d2d47879b49bd68da22d2fddb486906","observation_id":"8933c0cb-1265-4429-b3d7-9d991727cf07","resolution":{"observed_at":"2026-08-08T21:39:26.220737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.204664Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"e0b531b6-b431-404e-af68-6ae08dd6adb6","year":2017},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.556765Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:2276efd022dc1c43759a5984abdd49e41c72eadc2caeb39010a19936a0527f5c","observation_id":"87d3c4e6-a48c-449e-b1d5-e2e91eac6880","resolution":{"observed_at":"2026-08-08T21:39:26.208420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.192645Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"d674ee53-195a-4086-9d52-703dc6b273e4","year":2018},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.560459Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:9d855c604d531e21072267fb31f4e2ed8989805376ba3e1ebae152635dbc7b17","observation_id":"9b6aa253-7da0-41f9-9064-cd530f39284c","resolution":{"observed_at":"2026-08-08T21:39:26.196891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-08T21:39:25.563951Z","title":"G., and Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.563951Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:a0719ebe19e10b28e95437aa0797fcaaa255dd45164c921f05cfcbcf7b193ac2","observation_id":"0476a32b-af66-463f-af83-439ae49335d6","resolution":{"observed_at":"2026-08-08T21:39:25.563951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.567961Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.567961Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:bee153bfa31ced194169be6dd7c8c3efff85544a7eac5d7b371f4a6b058563f4","observation_id":"6f0af461-0752-476d-bdfa-b509f9389e1e","resolution":{"observed_at":"2026-08-08T21:39:25.567961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.173244Z","title":"B., and Levine, S","venue":null,"work_id":"edd85b1e-be6f-448e-bdb2-13c05a03e39c","year":2022},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.571512Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:6a2dcd014b3af744f67430cee382da19d4dd7fa432359b2ef5cdc9280c1ebcbb","observation_id":"d1f7e17c-4996-46bc-9512-482ef435367c","resolution":{"observed_at":"2026-08-08T21:39:26.177193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.161537Z","title":"Policy rehearsing: Training generalizable policies for reinforcement learning","venue":null,"work_id":"31b42f7a-b5f6-49de-97c3-b0990d660343","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.574956Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:1814f5bdd47752cb55fa595e57032f7219e984a003e19d30be6ad7b19f9c6cd9","observation_id":"4d1e9c04-eff5-42b4-a217-0cf0ab6ceb2f","resolution":{"observed_at":"2026-08-08T21:39:26.165466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.149814Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":"657c6e50-45f7-4b0f-a1fb-fc88ddaeba97","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.578415Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:03afd314dc45af992f79b73f1c336bfe0384c73275f94a5393bb957f7510e252","observation_id":"781b595f-004c-4a9d-bc45-b95e4325d212","resolution":{"observed_at":"2026-08-08T21:39:26.153787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.582232Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.582232Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:8e0fd2142302da7675a6c926aafbb3fb8aa2a99e80dfb3d9a116e1de9b56b8a5","observation_id":"71e36e3d-fac0-4ae3-9b70-1028d8767e87","resolution":{"observed_at":"2026-08-08T21:39:25.582232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.132113Z","title":"Offline reinforcement learning with implicit Q -learning","venue":null,"work_id":"b2be229e-018c-4fb6-b021-eedebabdb2db","year":2022},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.585841Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:79ac716930f1567d73365bd64dc7f8ac706a0ff499b69ecd27d240286b810565","observation_id":"53b6fac2-9a12-4da2-84f8-57e5944d8ce5","resolution":{"observed_at":"2026-08-08T21:39:26.136104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.120526Z","title":"Stabilizing off-policy Q -learning via bootstrapping error reduction","venue":null,"work_id":"a2d5f01e-ba30-451c-b25c-87645a5979e5","year":2019},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.589399Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:6616670c30f81880b42f6cc94500b31eaf639bae3f6fca6f0076a2aad8848aee","observation_id":"e1cc3d49-6392-4708-a46f-affeae9f22d7","resolution":{"observed_at":"2026-08-08T21:39:26.124689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.109343Z","title":"Discor: Corrective feedback in reinforcement learning via distribution correction","venue":null,"work_id":"3ff067ff-5abd-485d-bf40-4648410a2c69","year":2020},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.593156Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:8dd8bab87cdccd0bfc59891b3a46ca05857e15c1683d1653f34f021c5c5fb0cd","observation_id":"c641b95e-c5ad-4fd7-9544-3517bf70f663","resolution":{"observed_at":"2026-08-08T21:39:26.113331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.097918Z","title":"Conservative Q -learning for offline reinforcement learning","venue":null,"work_id":"9707c3aa-b4f2-4371-9c15-d355e2c7e9a6","year":2020},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.596808Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:394a85e2bfb31b33636f5ec2f04b90af00635ac4379243a31cc9d7d425b9dd3a","observation_id":"51ce740c-7409-4a4b-8255-9c6e1161580a","resolution":{"observed_at":"2026-08-08T21:39:26.101697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.087446Z","title":"A workflow for offline model-free robotic reinforcement learning","venue":null,"work_id":"6062708e-8012-4159-97a5-1a9d51f7df60","year":2021},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.600674Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:2dec6b604da3bd5e3ad6f8c5c4820161270772448d580ea3d20655ad26001a39","observation_id":"c7815ea6-a682-41b0-b5c0-036d49b26259","resolution":{"observed_at":"2026-08-08T21:39:26.091194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-08T21:39:25.604336Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.604336Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:d8031fd753563cea68e3a9d0f4c7dcb0ec6687135a721bf2b1921784601d3097","observation_id":"1cde2db5-16d8-4f35-a57f-9e96c3e2716b","resolution":{"observed_at":"2026-08-08T21:39:25.604336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.076079Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"d8a44ea1-0b5b-4cd2-b737-38d3610a84c0","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.608204Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:c682fd9ae1ce7beab1229f64cd603535282be329341e7a48530b3edf92aa2696","observation_id":"4b886aef-d99a-4b01-a54b-7142a95dcdad","resolution":{"observed_at":"2026-08-08T21:39:26.080529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.064241Z","title":"Reward-consistent dynamics models are strongly generalizable for offline reinforcement learning","venue":null,"work_id":"f991ef51-6785-43e0-916f-fcdda4b89db5","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.612219Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:7e3c9a9025390270fa3883cd11628bc04d5e3e6de0a8a988fcd317c829e39b8d","observation_id":"caacb572-96ff-4a65-8596-8579cef6728e","resolution":{"observed_at":"2026-08-08T21:39:26.068770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.052778Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":"c6e6d3f3-bffb-4b43-9606-0a6de167512b","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.616963Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:3c29d305c61dbb79bc5e083cf60b27bd59ca43de7a55b3b0c4c35edbf7d02b6c","observation_id":"8e866662-5be8-4814-b177-7f8278e0133f","resolution":{"observed_at":"2026-08-08T21:39:26.056675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.040703Z","title":"Transformers are sample-efficient world models","venue":null,"work_id":"82a85019-4608-423f-943b-cfe77fe6a572","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.620524Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:1da229384f18ff5a2d03b39bcf469a21d9a643498ba08515e801786bfb11c96a","observation_id":"624a65ae-f6a5-4d00-8c00-0d3b0a80d40c","resolution":{"observed_at":"2026-08-08T21:39:26.045165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-08T21:39:25.624076Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.624076Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:a9f433ed3dccbf26feaced41a6a7df81bf1ab88bae03df06a4a3b166f9402ce1","observation_id":"bae1b81e-f0e5-4c4f-bcd4-adb9db0a3eed","resolution":{"observed_at":"2026-08-08T21:39:25.624076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.029517Z","title":"Stochastic differential equations: A n introduction with applications","venue":null,"work_id":"ad5fea1e-bdb8-4f9c-b115-080e5912777d","year":2013},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.627908Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:92f2ca4185346de5b8135891e089e39af6a09594c9c8294cd21019d1e00f8d93","observation_id":"63eb818a-630c-4515-9603-25909c71aa45","resolution":{"observed_at":"2026-08-08T21:39:26.033192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.017107Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P","venue":null,"work_id":"c7483787-92c7-4c69-9ba7-fbae2e53bff0","year":2022},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.631693Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:f6704875bfcb6d19acd7941139df96a572957c3d2f31cb86142b5fb8bb6209a2","observation_id":"54f3f038-5cba-43ad-a08e-7609e51a2ef6","resolution":{"observed_at":"2026-08-08T21:39:26.021798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:26.005804Z","title":"Policy regularization with dataset constraint for offline reinforcement learning","venue":null,"work_id":"cd3fe780-67ff-46b6-9e61-af2f48d75428","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.635262Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:6be9ecf6298d45342dff61bef8f2567970d675d2b972c48b4a8c01a0e6bf1975","observation_id":"db07950d-e13d-4d47-ac38-983814958828","resolution":{"observed_at":"2026-08-08T21:39:26.009687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-08T21:39:25.638952Z","title":"Z., Lidard, J., Ankile, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.638952Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:930ffb781becd9e41724e69a730ea120485f3f4c7c3e01fd31b5060261516d25","observation_id":"93daa91e-f9c6-478f-8296-ae05603a3a57","resolution":{"observed_at":"2026-08-08T21:39:25.638952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T21:39:25.643121Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.643121Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:1b721a80fe428de227b10f228459ebf46527a0ad2a5c53a80c9e55be9e315455","observation_id":"0513c8f8-3910-405b-ac1f-b1a42b461c70","resolution":{"observed_at":"2026-08-08T21:39:25.643121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16121","last_updated":"2024-11-01T16:30:00Z","snapshot_observed_at":"2026-07-06T18:35:40.134423Z","submitted_at":"2024-06-23T14:24:14Z","title":"Diffusion Spectral Representation for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2406.16121","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16121","snapshot_observed_at":"2026-08-08T21:39:25.775566Z","title":"Diffusion Spectral Representation for Reinforcement Learning","venue":"cs.LG","work_id":"e20ffcf1-ebc5-472b-9baa-bc58c31958f2","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.648035Z"},"links":{"cited_paper":"/paper/2406.16121","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:0c0547672f8f6fb8465f82f760f6764ad701f5d74476875a688c2b79bfbfe7a1","observation_id":"6a4482d1-8038-4005-b420-c447c92c1d75","resolution":{"observed_at":"2026-08-08T21:39:25.781735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T21:39:25.651910Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.651910Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:0aaa04e2a369397fe42a0dcbd19948f239f61ccb56c93aa1eca4dff9d09c128d","observation_id":"e12cb928-d601-47a0-8011-eef6aedd7644","resolution":{"observed_at":"2026-08-08T21:39:25.651910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.992968Z","title":"P., Kumar, A., Ermon, S., and Poole, B","venue":null,"work_id":"f0923a93-bcdc-486c-9f07-a2345860b898","year":2021},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.655700Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:6a562ed8972684a2fdce573b001bf75416ae15644116c40b59abf653a4dfc1bb","observation_id":"12923003-e385-4b6f-bb55-d39e222c8c7f","resolution":{"observed_at":"2026-08-08T21:39:25.997912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.981100Z","title":"Model-bellman inconsistency for model-based offline reinforcement learning","venue":null,"work_id":"bc5bc54f-6ecf-417d-b506-6e193d977975","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.659464Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:33048efc6d933d1a278780e18acda8bde0faa0d18d92667d7f9eb525c3b0b95f","observation_id":"fc90ed53-9798-4f62-a359-115ab0b45735","resolution":{"observed_at":"2026-08-08T21:39:25.985090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.968458Z","title":"Revisiting the minimalist approach to offline reinforcement learning","venue":null,"work_id":"8237d345-c8b1-4a06-9182-0b4e1330394a","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.663380Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:5c1f3dc747dc53ac7b561c9d5c282ebc7250b4ce4d733c89494655b3df565dfa","observation_id":"0deb3fa4-a765-45e7-879c-5bb656c1ee06","resolution":{"observed_at":"2026-08-08T21:39:25.972769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.956135Z","title":"u l c ehre, C ., Wang, Z., Pfaff, T., Wu, Y., Ring, R., Yogatama, D., W \\","venue":null,"work_id":"2ad9c02c-0c9c-46a9-87bc-f5cbfece2d55","year":2019},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.668118Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:c5135c60a02c2f0fe51b408833dd0b81d319b38dfb4dbd9c1254576c630b936d","observation_id":"6a7b312c-2136-4f96-ac9f-92c5a6fa183b","resolution":{"observed_at":"2026-08-08T21:39:25.960325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15177","last_updated":"2024-12-21T02:23:41Z","snapshot_observed_at":"2026-07-06T18:19:04.614208Z","submitted_at":"2024-05-24T03:23:27Z","title":"Diffusion Actor-Critic with Entropy Regulator","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15177","snapshot_observed_at":"2026-08-08T21:39:25.671887Z","title":"Diffusion actor-critic with entropy regulator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.671887Z"},"links":{"cited_paper":"/paper/2405.15177","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:983c92384295fffa7e094f47b65aa25e2426f8981524ac428534d2944f8fa958","observation_id":"f74a3fc4-8742-46bf-a6c5-5fb2c9610789","resolution":{"observed_at":"2026-08-08T21:39:25.671887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.943800Z","title":"J., and Zhou, M","venue":null,"work_id":"f7bed610-62b5-487e-a713-3e26f679a185","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.675981Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:c7575b443879c1d8d0a6f856853aca7320b89f54895f2cdf1c6bbc7f12da8c9f","observation_id":"21811e2c-1b44-417b-964e-aabb3a8bcf9d","resolution":{"observed_at":"2026-08-08T21:39:25.948582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-08T21:39:25.679507Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.679507Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:d06af560f7623d2d946845ee1955e9c7206d029a6769bb8098cafd03e3dbd8e8","observation_id":"be9d06cb-4648-4afd-a9cc-bb7631d24d96","resolution":{"observed_at":"2026-08-08T21:39:25.679507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.932888Z","title":null,"venue":null,"work_id":"e537e982-eddb-4e9a-8691-83312b14c474","year":2023},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.684538Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:db32ebc0a54bc59e1b695004cfee4580b16b0752119e74240cee8b36b2776b53","observation_id":"b116c067-0d33-46ad-9624-7f6e1931f385","resolution":{"observed_at":"2026-08-08T21:39:25.936656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.921969Z","title":"Y., Levine, S., Finn, C., and Ma, T","venue":null,"work_id":"f9a1f07e-3572-4f7a-aaa4-9c4fcea642d8","year":2020},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.688330Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:448075ab5a658b59cfde7d3c791adb627f1bb050a91eec1e03a3029fa29ffc55","observation_id":"e7368061-06e8-4275-b81a-ebababd2b474","resolution":{"observed_at":"2026-08-08T21:39:25.925852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:39:25.910598Z","title":"o lund, J., Sch \\","venue":null,"work_id":"82bce41d-1060-4628-9f30-bbcd55f0d63f","year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.691914Z"},"links":{"citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:927e565df218491b47fd719319ee682111c189f08e2d9b5e057f7277ddc5150c","observation_id":"ac17730c-5f5d-4ade-a23c-c3ba71707d40","resolution":{"observed_at":"2026-08-08T21:39:25.914315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04080","last_updated":"2025-01-08T09:03:14Z","snapshot_observed_at":"2026-07-06T17:26:19.028623Z","submitted_at":"2024-02-06T15:34:30Z","title":"Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04080","snapshot_observed_at":"2026-08-08T21:39:25.695375Z","title":"o lund, J., Sch \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T21:39:25.695375Z"},"links":{"cited_paper":"/paper/2402.04080","citing_paper":"/paper/2502.04778"},"observation_digest":"sha256:3d55639946eab6e587eecb80ed99f3d8b3330f7900b3bef3f9091553888ab930","observation_id":"ca9867f4-94c7-4d95-ac1a-887376a72d61","resolution":{"observed_at":"2026-08-08T21:39:25.695375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04778","last_updated":"2025-05-29T09:14:17Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T21:28:04.522383Z","submitted_at":"2025-02-07T09:30:35Z","title":"Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 4 inbound Pith citation observations for arXiv:2502.04778."}