{"as_of":"2026-08-16T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80d0b3756bda8c77ed39966428af3b59e81d1605e98a5639b7ebfe34d43e21d5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:14:13.211566Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01822/citation-record","integrity":"/paper/2505.01822/integrity","json":"/paper/2505.01822/citation-record.json","paper":"/paper/2505.01822"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-16T04:14:13.020200Z","title":"Is conditional generative model- ing all you need for decision-making? arXiv preprint arXiv:2211.15657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.020200Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:0aaaa0d6f006825e7c693dacdbebad82396c47ea652e01b3b789d70fbf01b595","observation_id":"8dcf6893-c061-4143-bc9b-a6c463076e51","resolution":{"observed_at":"2026-08-16T04:14:13.020200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-16T14:29:42.154695Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-16T04:14:13.045485Z","title":"Simple hierarchical planning with diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.045485Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:4d0727e4b0f90850c311854655ca8de2dc128223074f0d58b7a9a49e0c0a01a5","observation_id":"ad36a7ee-568f-4f92-b66e-4968425fda92","resolution":{"observed_at":"2026-08-16T04:14:13.045485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-16T16:28:17.155889Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-16T04:14:13.050368Z","title":"Offline rein- forcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.050368Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:3664a1e1adb8b70c0170f8e72cc205cb5afcc5cea49de86c07b78efc8e55a605","observation_id":"30fd24d1-7af9-4837-94d3-7b3ee36d1b8a","resolution":{"observed_at":"2026-08-16T04:14:13.050368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07297","last_updated":"2024-03-15T03:42:03Z","snapshot_observed_at":"2026-08-16T14:53:09.808729Z","submitted_at":"2023-10-11T08:31:26Z","title":"Score Regularized Policy Optimization through Diffusion Behavior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07297","snapshot_observed_at":"2026-08-16T04:14:13.055631Z","title":"Score reg- ularized policy optimization through diffusion behavior","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.055631Z"},"links":{"cited_paper":"/paper/2310.07297","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:6e4da6bd8296e78ee5ddadb33ab99db197b3ba0bebb1b38f3b2b3a2e0e48a600","observation_id":"982f2737-c14c-4534-8d3d-e3a373842479","resolution":{"observed_at":"2026-08-16T04:14:13.055631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-16T13:09:47.913294Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-16T04:14:13.064735Z","title":"K., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.064735Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:cdaabf92727c1da26f4fc3fe46c2ebe093264f63b70db170e6f0fc66e9b7f4c9","observation_id":"f6318456-f369-4318-8854-ce008a14d020","resolution":{"observed_at":"2026-08-16T04:14:13.064735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16984","last_updated":"2024-03-14T19:28:48Z","snapshot_observed_at":"2026-08-16T14:56:38.212380Z","submitted_at":"2023-09-29T05:05:54Z","title":"Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16984","snapshot_observed_at":"2026-08-16T04:14:13.069509Z","title":"and Jin, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.069509Z"},"links":{"cited_paper":"/paper/2309.16984","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:b0578a6c17ff2a2863004098011d57c6de097f65cbcfa5cacbe0df16e76abd37","observation_id":"84a5276d-18db-45ba-9876-718e64de5dfd","resolution":{"observed_at":"2026-08-16T04:14:13.069509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15443","last_updated":"2024-10-25T03:36:07Z","snapshot_observed_at":"2026-08-16T14:24:00.775854Z","submitted_at":"2024-01-27T15:30:49Z","title":"DiffuserLite: Towards Real-time Diffusion Planning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15443","snapshot_observed_at":"2026-08-16T04:14:13.074349Z","title":"Diffuserlite: Towards real-time diffusion plan- ning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.074349Z"},"links":{"cited_paper":"/paper/2401.15443","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:14157865f44c9ec9ddeed0de93ff2d78c70f2386172c523eb14a50033f479f8b","observation_id":"ce4ae98c-402e-4a4b-a450-4ed634d2a836","resolution":{"observed_at":"2026-08-16T04:14:13.074349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-08-16T08:32:46.407746Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-16T04:14:13.079059Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.079059Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:0d0bde11bba5d45fba121524c1077a0d544df2ae73b14ec33b9c43d716998971","observation_id":"cc15e312-f07a-4704-87b7-dd52575fc264","resolution":{"observed_at":"2026-08-16T04:14:13.079059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:14:13.083950Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.083950Z"},"links":{"citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:3cff37020301377c9f1ada98fafd20ed97718c902bfd1483d2cc309fa375d088","observation_id":"56a1077f-580e-4005-a817-3fd8c6df95c3","resolution":{"observed_at":"2026-08-16T04:14:13.083950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T04:14:13.093775Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.093775Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:1944a61c7360b06f2b451fc2aa6c903ef9b752d0d2bd8eac91b35becf4c45b6e","observation_id":"c5061a44-ac69-4b1d-b2cd-2ab6a47a1ef2","resolution":{"observed_at":"2026-08-16T04:14:13.093775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04875","last_updated":"2023-06-08T02:12:26Z","snapshot_observed_at":"2026-08-16T15:25:38.828705Z","submitted_at":"2023-06-08T02:12:26Z","title":"Instructed Diffuser with Temporal Condition Guidance for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04875","snapshot_observed_at":"2026-08-16T04:14:13.099282Z","title":"Instructed diffuser with temporal condition guidance for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.099282Z"},"links":{"cited_paper":"/paper/2306.04875","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:ebe88ca548dc17e4f5feb3d9345ff39a7f515ed31cdbe66fd1ad44dd260fa245","observation_id":"f9a0adf8-d787-447b-b945-1f7c88646f52","resolution":{"observed_at":"2026-08-16T04:14:13.099282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-16T04:14:13.104738Z","title":"B., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.104738Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:2ee64e9be11754233c8d94011765f303f8f76a395361b4144390a334ae11091a","observation_id":"78996ee1-82fa-47d7-a7fe-34230cbdb9ee","resolution":{"observed_at":"2026-08-16T04:14:13.104738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10291","last_updated":"2023-01-24T11:09:30Z","snapshot_observed_at":"2026-08-16T16:37:43.972461Z","submitted_at":"2022-08-22T13:19:02Z","title":"Efficient Planning in a Compact Latent Action Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10291","snapshot_observed_at":"2026-08-16T04:14:13.110258Z","title":"Efficient planning in a com- pact latent action space.arXiv preprint arXiv:2208.10291,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.110258Z"},"links":{"cited_paper":"/paper/2208.10291","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:2d7713f401195ce7144d150349c6aca20f4696d46fede33a2a17a7f21fcee347","observation_id":"9a457421-76a3-46b6-a1cb-e485e6512608","resolution":{"observed_at":"2026-08-16T04:14:13.110258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-16T04:14:13.115339Z","title":"Offline reinforce- ment learning with implicit q-learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.115339Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:13948ef80a34b0d32cc1b03a10fbb7967cdafc09ea74384316d52daacce5e498","observation_id":"caa8d60b-4b7e-42ec-905b-8383eadf6f2c","resolution":{"observed_at":"2026-08-16T04:14:13.115339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-16T04:14:13.120625Z","title":"Offline rein- forcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.120625Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:c41129181be9f2a6bc27a2a1fb359bdfbf7a49dc7bb46ae35c8f7d5e0bdf6b29","observation_id":"575bf83d-c62a-4a00-97d6-a569a511c118","resolution":{"observed_at":"2026-08-16T04:14:13.120625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00681","last_updated":"2024-06-02T09:32:28Z","snapshot_observed_at":"2026-08-16T13:47:02.513221Z","submitted_at":"2024-06-02T09:32:28Z","title":"Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00681","snapshot_observed_at":"2026-08-16T04:14:13.125687Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.125687Z"},"links":{"cited_paper":"/paper/2406.00681","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:1da828ade0828c1d710a2cd3a940ef32e82be8377daba52930721b1212685ca5","observation_id":"122a880e-ecd1-4d9e-bba3-66c9e01ddebf","resolution":{"observed_at":"2026-08-16T04:14:13.125687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01877","last_updated":"2023-05-12T16:23:37Z","snapshot_observed_at":"2026-08-16T15:57:51.683015Z","submitted_at":"2023-02-03T17:28:59Z","title":"AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01877","snapshot_observed_at":"2026-08-16T04:14:13.130421Z","title":"Adaptdiffuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.130421Z"},"links":{"cited_paper":"/paper/2302.01877","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:1f9c27f6966f9967663396fa34fddcd51f61d19fa1e2fb2ad010b5ea833a70ee","observation_id":"cf8d91ea-2403-4f3a-a85f-aa8ced5cff7a","resolution":{"observed_at":"2026-08-16T04:14:13.130421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:14:13.135133Z","title":"Dataset distillation for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.135133Z"},"links":{"citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:269a99ae9a53986800ddfffb6f49f9d18d127c84b5158b48f58ff43a60d6a079","observation_id":"1362d0ab-6d02-4d6a-8e48-f7b35723de49","resolution":{"observed_at":"2026-08-16T04:14:13.135133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02165","last_updated":"2024-08-04T23:23:48Z","snapshot_observed_at":"2026-08-16T13:28:37.057542Z","submitted_at":"2024-08-04T23:23:48Z","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02165","snapshot_observed_at":"2026-08-16T04:14:13.139634Z","title":"Selfbc: Self behavior cloning for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.139634Z"},"links":{"cited_paper":"/paper/2408.02165","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:7a102efe73295f732fad6cc919776b509f076779bfb537d3cde252d0a72869c1","observation_id":"f4498687-d6b2-4d36-854e-131337c3ed16","resolution":{"observed_at":"2026-08-16T04:14:13.139634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-15T03:10:54.042099Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-16T04:14:13.144120Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.144120Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:39d7d61ed65b0bec397c33e2a1aa4147fcaac332113f2d8e9241cca4b991d545","observation_id":"cd79eee6-36f6-4f6d-838a-87c619519c2e","resolution":{"observed_at":"2026-08-16T04:14:13.144120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20109","last_updated":"2024-10-31T06:16:24Z","snapshot_observed_at":"2026-08-16T13:30:10.814353Z","submitted_at":"2024-07-29T15:36:42Z","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20109","snapshot_observed_at":"2026-08-16T04:14:13.148926Z","title":"Diffusion-dice: In-sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.148926Z"},"links":{"cited_paper":"/paper/2407.20109","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:2256b3f520146e79de8dce9aeb1719056f9a006d5b83ef99de644f745ae72ba2","observation_id":"9aa1c40a-8e07-496b-a5b6-f7f7688a99b2","resolution":{"observed_at":"2026-08-16T04:14:13.148926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-08-16T16:00:11.612905Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-08-16T04:14:13.158380Z","title":"V ., Tan, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.158380Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:9fb05c8dbf71775b1f56189675c483de7e18523ef097a1a92c7565ea333b0e7e","observation_id":"acfd29ad-a41a-4e7f-892c-d6de004d0b71","resolution":{"observed_at":"2026-08-16T04:14:13.158380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-16T04:14:13.163136Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.163136Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:83fba411562ff60d08369d536d294fcc95b3cf376eda887fa9c7f3ec5162163b","observation_id":"0cdfe3dd-1752-4a32-9211-e5ad453e69e2","resolution":{"observed_at":"2026-08-16T04:14:13.163136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T04:14:13.172718Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.172718Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:0b6e145db940b8084134e040d98d00bdd3bb7fb38d265bc78f2ffaf5753274f2","observation_id":"bee660c7-f656-43b8-9d7e-2fb974eff90c","resolution":{"observed_at":"2026-08-16T04:14:13.172718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-16T04:14:13.177242Z","title":"P., Kumar, A., Er- mon, S., and Poole, B","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.177242Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:72e959b0847d4a94d8bfd1d249420251791a09b94985ee1a1ce3b67c41caff53","observation_id":"99327e76-188e-4c29-ae8d-a38b163ab537","resolution":{"observed_at":"2026-08-16T04:14:13.177242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-08-16T13:06:31.710539Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-16T04:14:13.182696Z","title":"Wang, K., Zhao, H., Luo, X., Ren, K., Zhang, W., and Li, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.182696Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:d8c8a4b3bbc1b346332a5367138e95d59ba5f745a9303449b18890391068e529","observation_id":"17f925d4-7135-4220-b4df-94dcc911b718","resolution":{"observed_at":"2026-08-16T04:14:13.182696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-08-12T13:12:28.417467Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-16T04:14:13.187831Z","title":"J., and Zhou, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.187831Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:343a1086537ee98c6e0d973a8048747f8294738a6e5414c1157c2ee48368cbc2","observation_id":"59105646-ed47-4bfe-8a88-2d45689a7a89","resolution":{"observed_at":"2026-08-16T04:14:13.187831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-16T04:14:13.192823Z","title":"Behavior regu- larized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.192823Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:a2b8db373bc1926e05899c49bf1eba5df5be9f4dbb79810722d95798c601b0be","observation_id":"5cda9a2a-5adc-4989-825a-f4b167e0c425","resolution":{"observed_at":"2026-08-16T04:14:13.192823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09673","last_updated":"2022-10-07T23:57:50Z","snapshot_observed_at":"2026-08-16T17:20:05.494588Z","submitted_at":"2022-02-19T20:22:04Z","title":"A Behavior Regularized Implicit Policy for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09673","snapshot_observed_at":"2026-08-16T04:14:13.197566Z","title":"Improving diffusion-based image synthesis with context prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.197566Z"},"links":{"cited_paper":"/paper/2202.09673","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:97c284befd7e754dcfd9efb28a942bd85cda8204e7615de9417c3246b7636dea","observation_id":"804f1a39-2e9a-4f95-a3c3-352f10ff6ca9","resolution":{"observed_at":"2026-08-16T04:14:13.197566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01245","last_updated":"2024-12-02T08:06:07Z","snapshot_observed_at":"2026-08-16T10:58:07.336431Z","submitted_at":"2024-12-02T08:06:07Z","title":"Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective","version":1},"cited_work":{"arxiv_id":"2412.01245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01245","snapshot_observed_at":"2026-08-16T04:14:13.247801Z","title":"Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective","venue":"cs.LG","work_id":"ea3c819e-0c65-48ef-9166-0c4d2f10176b","year":2024},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.202400Z"},"links":{"cited_paper":"/paper/2412.01245","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:99383b3d0d065cc23b47e99eacb68ebbb610aab46eea49f2a60ad0e09383777c","observation_id":"ed647e00-263c-4e9f-8456-c82226888419","resolution":{"observed_at":"2026-08-16T04:14:13.255020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:14:13.924210Z","title":null,"venue":null,"work_id":"6296ea0c-95ec-41fd-afbb-61515504c89c","year":2017},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.207184Z"},"links":{"citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:c0843b64201579419b6b34e7e47ca637cefcb5cf26c8f86d8a602787b00baf5e","observation_id":"d27e6af0-5efa-45c3-b679-f42f8adda98e","resolution":{"observed_at":"2026-08-16T04:14:13.929059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:14:13.908991Z","title":"We use ˜µ0|t = Eµ0|t(a0|at,s)[a0] to derivate the third equation","venue":null,"work_id":"eed414c7-7b35-40d4-9923-d5ea00203c0b","year":2021},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.211566Z"},"links":{"citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:29d3e64b60b41de315d9ad78b3ad3097a521b2e6563519457cbbe7bffbda03e4","observation_id":"f0374a30-7323-41ec-88c4-40c75b1f39fb","resolution":{"observed_at":"2026-08-16T04:14:13.913582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-16T04:14:13.153488Z","title":"Awac: Accel- erating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.153488Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:8ba3619328f6ec0a780da5d6eae08830aea1c8312995862d10886555cad11661","observation_id":"3e260918-15fe-4c8d-855f-1907ee127c94","resolution":{"observed_at":"2026-08-16T04:14:13.153488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-16T04:14:13.088351Z","title":"G., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.088351Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:3b93da1c5fb728f3d5dc7d1f23838e0081680b193db5398f9e155e721cb60066","observation_id":"65635cb1-5106-4909-b21d-9d577f1c2e79","resolution":{"observed_at":"2026-08-16T04:14:13.088351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-16T04:14:13.167977Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.167977Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:5ebfda8fa6e6d9ab5de778f3885976145d09cafdee454367016e31af2e96c97e","observation_id":"2f26f45e-cdf0-455c-b78f-c0d3eca5a977","resolution":{"observed_at":"2026-08-16T04:14:13.167977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-16T17:19:12.327645Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-16T04:14:13.031140Z","title":"Pessimistic bootstrapping for uncertainty- driven offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.031140Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:2bd09981ec4e787ba1d7a32bcb6faa58a4fcd25c88d4ea50cd55afa9eab4f1b8","observation_id":"a108c1bd-fc75-4d58-962b-1efcda500453","resolution":{"observed_at":"2026-08-16T04:14:13.031140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05556","last_updated":"2021-03-17T17:22:51Z","snapshot_observed_at":"2026-08-14T03:08:55.083354Z","submitted_at":"2020-08-12T20:06:52Z","title":"Model-Based Offline Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05556","snapshot_observed_at":"2026-08-16T04:14:13.025905Z","title":"and Dulac-Arnold, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.025905Z"},"links":{"cited_paper":"/paper/2008.05556","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:99887fc77edf227ea1c4fa2d1dbe61419458e8d3b8ceebfa1da60dedc4024d6f","observation_id":"be63bd0c-4c84-45a8-bffc-4a154c935849","resolution":{"observed_at":"2026-08-16T04:14:13.025905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07309","last_updated":"2022-06-15T05:42:48Z","snapshot_observed_at":"2026-08-16T20:58:07.394350Z","submitted_at":"2022-06-15T05:42:48Z","title":"Estimating the Optimal Covariance with Imperfect Mean in Diffusion Probabilistic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07309","snapshot_observed_at":"2026-08-16T04:14:13.035920Z","title":"Estimating the optimal covariance with imperfect mean in diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.035920Z"},"links":{"cited_paper":"/paper/2206.07309","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:9d2c425abc3c992b02b03df593a9ab69949807316db1cf8d300a399366c4672a","observation_id":"00610ed7-024e-426f-bfb4-50f863bf2ee5","resolution":{"observed_at":"2026-08-16T04:14:13.035920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-14T03:13:28.801183Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-16T04:14:13.060282Z","title":"T., Klasky, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.060282Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:15239659f0924004b5dacbd677d82b405179a1c2af6cd781c3a29d41e92b445a","observation_id":"a47da1d7-a90a-43f6-ad1c-8e4d4926313e","resolution":{"observed_at":"2026-08-16T04:14:13.060282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:14:13.040813Z","title":"Cao, P., Zhou, F., Song, Q., and Yang, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:14:13.040813Z"},"links":{"citing_paper":"/paper/2505.01822"},"observation_digest":"sha256:1c79c7bb58eea74f1397799b2d4beac6aa4aa89c7bd2c3ec20c405a525679ea1","observation_id":"7a348137-2a7c-4c6f-9ed2-86a6b2b95bcf","resolution":{"observed_at":"2026-08-16T04:14:13.040813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01822","last_updated":"2025-05-03T14:00:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:07:10.268451Z","submitted_at":"2025-05-03T14:00:25Z","title":"Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.01822."}