{"as_of":"2026-08-12T23:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f54d064096d634147551274ce154dc8bfdb9490cc3c73e88db018964959e967d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:48:31.145133Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14913/citation-record","integrity":"/paper/2411.14913/integrity","json":"/paper/2411.14913/citation-record.json","paper":"/paper/2411.14913"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.645777Z","title":"More than a million ways to be pushed. a high-fidelity experimental dataset of planar pushing,","venue":null,"work_id":"4435d674-2a0a-4f06-b694-720e32e033fb","year":2016},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.208011Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:54f53e227315f418d82afd115b89a50bda12f3d7ffdd54453250ff228a041fa2","observation_id":"febaaf23-7bc2-4db0-aaa7-4f39263a23d6","resolution":{"observed_at":"2026-08-12T14:48:32.650628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.253015Z","title":"Universal manipulation policy network for articulated objects,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.253015Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:a643673382609e5f9a25b10f729407a729d359777f23f247ea958304d4e06b31","observation_id":"2e987559-d8d3-42c6-977b-3681fb0bbda7","resolution":{"observed_at":"2026-08-12T14:48:30.253015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.624699Z","title":"Contact mode guided motion planning for quasidynamic dexterous manipulation in 3d,","venue":null,"work_id":"f3bb24b6-1b4d-4910-a339-c652a9485312","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.290187Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:1392764f944092fa6860ddd41422cb36af9464eef12eca4d1c203d3cb8e0b27a","observation_id":"1a75905d-b5ac-42fa-ba83-0edffe4ea4c6","resolution":{"observed_at":"2026-08-12T14:48:32.630088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.597077Z","title":"Robust execution of contact-rich motion plans by hybrid force-velocity control,","venue":null,"work_id":"ae2829e7-9ae0-4bfa-b040-80e004513919","year":2019},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.297194Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:89be8b3fed805414018c6efb9295492525677cd76ce2d59f3b33bd0e3ac26431","observation_id":"479c545a-6014-4ddd-b08b-c9646d8193fd","resolution":{"observed_at":"2026-08-12T14:48:32.614794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.301732Z","title":"Where2act: From pixels to actions for articulated 3d objects,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.301732Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:092eb6f84799e4d4020362ca3dc4f79b32c7357f5f99b10c9b5883f52a44d076","observation_id":"c53d2d1a-604b-47a9-ace7-ebac2fa809b9","resolution":{"observed_at":"2026-08-12T14:48:30.301732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.435798Z","title":"A hybrid ap- proach for learning to shift and grasp with elaborate motion primitives,","venue":null,"work_id":"8c912b03-fd4b-4dc5-b39e-b464efd511ff","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.307584Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:7ad0f1b593a1ef56bf395e8c9f339cbac848cea3ac3a95848c65d3e4fb9654e5","observation_id":"cbeb2135-84d4-49b1-a847-2fa387cd788a","resolution":{"observed_at":"2026-08-12T14:48:32.514804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.422510Z","title":"HACMan: Learning hybrid actor-critic maps for 6d non-prehensile manipulation,","venue":null,"work_id":"9d7b9b9e-a4a8-4fe5-9933-506149d4a295","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.312679Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:884c1d79639d9272ebf1d9daa9ef5f73f1ce0f08d92dab1c431ed7c0034ca61e","observation_id":"1d942933-55b9-4e51-961b-083d0e64ef95","resolution":{"observed_at":"2026-08-12T14:48:32.427188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.401924Z","title":"Neural probabilistic motor primitives for humanoid control,","venue":null,"work_id":"347738fc-ab5d-473c-87f2-d919c5b8e42e","year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.317265Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b14d23b78f765388e41588db0a2bb0656f36139ab2e4e9502aedc54c04d5c17c","observation_id":"3338448e-d685-4d7c-b588-a4e3a8586a9a","resolution":{"observed_at":"2026-08-12T14:48:32.411626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.319945Z","title":"One solution is not all you need: Few-shot extrapolation via structured maxent rl,","venue":null,"work_id":"12b1d848-80b2-478c-8f89-88114a8b2f84","year":2020},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.327409Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:8f02de41b98b6d22ef609663bce13022385b8e5f235de89b244d6a88c5886a17","observation_id":"cfc29a3f-d8d7-4374-ae24-1fca99e592b4","resolution":{"observed_at":"2026-08-12T14:48:32.391541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.212832Z","title":"Towards diverse behaviors: A benchmark for imitation learning with human demonstrations,","venue":null,"work_id":"4446a5e0-5817-4ece-8010-8cb91d1cf43b","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.331673Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:ba195601ccc76365fac086e5e24a5da77dd6d576243a519ffe154411127b57e7","observation_id":"979267e3-f894-4fce-ae47-5855016d8858","resolution":{"observed_at":"2026-08-12T14:48:32.217674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.336068Z","title":"Generative modeling by estimating gradients of the data distribution,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.336068Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:81b60475c5b74eb32128fecaf6484a6d3bf6458ef4b526e723fd91481269590f","observation_id":"8bd8e382-fd56-4845-9821-0cf9cf098f34","resolution":{"observed_at":"2026-08-12T14:48:30.336068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.186681Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"3a1a6d3a-a9ee-4008-b515-6942e254f760","year":2020},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.407421Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:2d03d4f396ece9a4df916c4f002dc08fc95a8ebc48ed2bddfdeed45739955579","observation_id":"82698cde-04d1-4b2e-9295-6ab8f6afda8f","resolution":{"observed_at":"2026-08-12T14:48:32.192466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.172923Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning,","venue":null,"work_id":"834e5aeb-2a7d-437e-be1f-f791738dcbe0","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.441302Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:4f43517b0cb6eac0ea5304d5e6a9058273b463e9e463573e23f0512d2cd2a9b6","observation_id":"c804a0d1-1ca5-4d03-b7c1-24eca2324a76","resolution":{"observed_at":"2026-08-12T14:48:32.178538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-12T14:48:30.445107Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.445107Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:f49b39896963dff707d20f4f4081c3745956c1e6ec1f8ef27d25bb65eb49ba0d","observation_id":"4132dd47-ce97-4ada-ae68-ec39528e956c","resolution":{"observed_at":"2026-08-12T14:48:30.445107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.449264Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.449264Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:95b54d1d97b343772a3aed36e590b462d8ed60a4e74e792baf34e71d21bb1568","observation_id":"3cb50867-76c9-4a8d-9b78-b660fce80f5a","resolution":{"observed_at":"2026-08-12T14:48:30.449264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.032691Z","title":"Diffusion policies as an expres- sive policy class for offline reinforcement learning,","venue":null,"work_id":"faee1587-c17d-4826-8ca2-03583cdfe2a6","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.453629Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:67251da39c7783b4503ec162c7855d40ab0143f3d962bdbbd3f2b104abf52dda","observation_id":"f3e76ecb-0486-48e8-a388-876af8021b81","resolution":{"observed_at":"2026-08-12T14:48:32.086460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-12T14:48:30.456981Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.456981Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:1feff7b6e98fcabbeb018928b85f0c5750baa0aca8f32df4c35f90e88ca95956","observation_id":"7db96815-8116-4981-a547-b4c5667593c6","resolution":{"observed_at":"2026-08-12T14:48:30.456981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:32.015962Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline rein- forcement learning,","venue":null,"work_id":"0f84f7fc-3371-4569-822f-4a96f2531f0b","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.461079Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:c732052e10e3e220acd78f5be84d7dc5b56bb867829ebc4be45ef17fee9017e6","observation_id":"fb1e5365-808a-4aed-80b5-93622854b0aa","resolution":{"observed_at":"2026-08-12T14:48:32.022523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.997412Z","title":"Reasoning with latent diffusion in offline reinforcement learning,","venue":null,"work_id":"0a161283-6ab4-41e4-8657-b406d724c96a","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.466056Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:56324798ae952be670ac6aaa2a1b9dcecb65c4bef022b62ced1b7e9fbe0e3ead","observation_id":"c1d14f4e-e628-450f-9fdf-8f22efdf5685","resolution":{"observed_at":"2026-08-12T14:48:32.003866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.936069Z","title":"Learning multimodal behaviors from scratch with diffusion policy gra- dient,","venue":null,"work_id":"12cdc745-7c80-43e7-b4da-885b860d41be","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.471054Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:bb4c8bd08eb687d7e0a3a241c6c6a10b59c53643eaf51c0106d5139acbd0172f","observation_id":"3f20cc24-feda-4eaa-8275-0f7a0a07c414","resolution":{"observed_at":"2026-08-12T14:48:31.986176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.535443Z","title":"Goal conditioned imitation learning using score-based diffusion policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.535443Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:8e1ce9a8a74ac03f26c1352425a8b8d6528e0f2d92d0b0da22aee53898172127","observation_id":"7c4b0b4d-dc00-4779-8421-0aa0d2e0f4bf","resolution":{"observed_at":"2026-08-12T14:48:30.535443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-08-09T12:35:27.365083Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-08-12T14:48:30.554087Z","title":"Imitating human behaviour with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.554087Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:7b77790cb2cc781665bcfcb66d1ff412440bf7478cc4606d905cadf5e96f0603","observation_id":"04668f23-4699-45d8-a425-c681d4c0efea","resolution":{"observed_at":"2026-08-12T14:48:30.554087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.827272Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling,","venue":null,"work_id":"8d6832fb-49f7-4c7e-9410-6e31436055f7","year":2022},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.558475Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:68747f5f15b360cf11f05de15cae74c4b0c02e7ae68f181125597f39ac3e0784","observation_id":"97b68a1f-13a8-4b39-a9c3-22b4e0ef2ba1","resolution":{"observed_at":"2026-08-12T14:48:31.831815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-07-06T16:29:32.059905Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-08-12T14:48:30.566974Z","title":"Diffcps: Diffusion model based constrained policy search for offline reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.566974Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:620a8758e4320216eda809e4ac954fda74ca225d230336111d90be7b04eedf48","observation_id":"2a066b47-4a55-4a5d-a829-8387ae8fe6ab","resolution":{"observed_at":"2026-08-12T14:48:30.566974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.809923Z","title":"Reinforcement learning by reward-weighted regression for operational space control,","venue":null,"work_id":"f9e023ae-7813-45da-a399-c0fd4eabeba5","year":2007},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.571741Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:0c32b9cc3c237a71d58a88158f52921e4773d7ea36a43a99f126aa7b3bb4380f","observation_id":"12d4195b-1f5e-4283-afa2-0f415ee5c68d","resolution":{"observed_at":"2026-08-12T14:48:31.817442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-12T14:48:30.576870Z","title":"Aligning text-to-image models using human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.576870Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:b4e098349f32f073f6eb38649780cd8d90438e66cffeee627ec51284dd461de0","observation_id":"b5c01eb9-1942-46df-99ad-84bad7c3c82d","resolution":{"observed_at":"2026-08-12T14:48:30.576870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.749739Z","title":"Training diffu- sion models with reinforcement learning,","venue":null,"work_id":"42e51b78-d42e-4e69-85b4-c13bcf880e87","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.582788Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:3b89346907ba204aee3f844ffd5b50c8b51163feae02ff53a734d746888d404c","observation_id":"8b7bf6a0-807f-4f07-9b2a-c3f141ad4e3d","resolution":{"observed_at":"2026-08-12T14:48:31.775250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.644104Z","title":"Feedback efficient online fine-tuning of diffusion models,","venue":null,"work_id":"7c4b9e63-9427-4afd-bbcf-f1ca8d5de83e","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.636935Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:3f8d6f667637fbf01dc167843a9d23d30c39d11e22a57f3cbbe6a2243c59417f","observation_id":"6a3811f4-1d56-419b-852a-e2158a0ea7e2","resolution":{"observed_at":"2026-08-12T14:48:31.680380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-12T14:48:30.702335Z","title":"Fine-tuning of continuous-time diffusion models as entropy-regularized control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.702335Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:81305a603f26f13cbc9588fb2ab4785811c5990caa1f9968b90941e3c7953eea","observation_id":"5d8a776e-3d03-4c7d-98f3-7f5eed0ee754","resolution":{"observed_at":"2026-08-12T14:48:30.702335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-08-09T16:03:36.260214Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-12T14:48:30.730504Z","title":"Learning a diffu- sion model policy from rewards via q-score matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.730504Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:a6db12b9eb71a0c08c0e0bf5292fc193d49e322ba7d9d6d4fdad2cf813b02c84","observation_id":"07e6a49b-df04-46df-a177-0ec39454bb38","resolution":{"observed_at":"2026-08-12T14:48:30.730504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.629152Z","title":"Learning to grasp the ungraspable with emergent extrinsic dexterity,","venue":null,"work_id":"bb05fa47-b401-4fc2-91e3-a84d62d2e28f","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.763856Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:9e62549abb36d1bfffcc546d1862154e566794a8f2ba0df73a37adad7c9a08fc","observation_id":"d133409f-5e61-4eb1-b9c7-7cbc44aa5dc9","resolution":{"observed_at":"2026-08-12T14:48:31.633781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.613659Z","title":"HACMan++: Spatially-Grounded Motion Primitives for Manipulation,","venue":null,"work_id":"424ff1c2-051c-4649-9e16-227a7f84ab7e","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.768341Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:2548976e9f17482c73623cf3d5dbf17d2f47bf9a1d863a0f8b1281e45828847f","observation_id":"ef4e8979-893b-4e21-9e65-cac4c88f15ad","resolution":{"observed_at":"2026-08-12T14:48:31.618674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10008","last_updated":"2024-06-10T08:11:00Z","snapshot_observed_at":"2026-07-06T17:03:02.786273Z","submitted_at":"2023-12-15T18:24:28Z","title":"Movement Primitive Diffusion: Learning Gentle Robotic Manipulation of Deformable Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10008","snapshot_observed_at":"2026-08-12T14:48:30.773327Z","title":"Movement primitive diffusion: Learning gentle robotic manipulation of deformable objects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.773327Z"},"links":{"cited_paper":"/paper/2312.10008","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:f88d9d858af0d2edb45b07f6798556297de80630e58ba49b6bb46ecce9a9df6c","observation_id":"029051f9-eaa8-4283-bd00-b022b9f11dd1","resolution":{"observed_at":"2026-08-12T14:48:30.773327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.599961Z","title":"Prodmp: A unified perspective on dynamic and probabilistic movement primitives,","venue":null,"work_id":"b68f514d-d93f-4a53-85af-6daaabe32ba2","year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.813419Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:3e50008691f745d67ddebd1f0b438ce524ca1f8f948b1212388b29cf5bc0f5fa","observation_id":"97c47ffc-57ad-41e6-a856-8b8872294587","resolution":{"observed_at":"2026-08-12T14:48:31.603752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.884271Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.884271Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:f0c6a965fb5cf2dddde9f8ae8ef3d3516e4a7bec91998af6ef94c48c975d6edb","observation_id":"a5800fa0-bde8-4854-82da-8d05ba552610","resolution":{"observed_at":"2026-08-12T14:48:30.884271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.900665Z","title":"Addressing function approxi- mation error in actor-critic methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.900665Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:552c222a16735fd0cd6b713792c9c0752cc7817ff02f748a563e9705cf592e4c","observation_id":"27e20965-b422-4714-a147-4d42b4dfab8b","resolution":{"observed_at":"2026-08-12T14:48:30.900665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.907379Z","title":"Consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.907379Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:cef3046cd4d0516c88e887d2a38e210dec3aa3a5e634c3968b389bde80a4d22c","observation_id":"087c788b-56b8-4e55-aefc-36b0c2131136","resolution":{"observed_at":"2026-08-12T14:48:30.907379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.408429Z","title":"Efficient diffusion policies for offline reinforcement learning,","venue":null,"work_id":"dd210820-1ced-4a84-9299-0ce2105e0553","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.911471Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:ab4219f1e12278a5f5197596f904fb56c3208b73083dbe9552b18b560522e3b2","observation_id":"ad867a0e-e135-418b-a7f4-ef48bca2e324","resolution":{"observed_at":"2026-08-12T14:48:31.468490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:30.916306Z","title":"A minimalist approach to offline reinforce- ment learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.916306Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:81289c1945edbc941bad78e520d738c918e6d53244f6fdde700ad6baeb6aa0f4","observation_id":"bec46b24-0ecb-46ad-afc0-e6dd48881143","resolution":{"observed_at":"2026-08-12T14:48:30.916306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-12T14:48:30.997318Z","title":"Reinforcement learning and control as probabilistic infer- ence: Tutorial and review,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:30.997318Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:594d7803f44b0adb1a48c73091eeb8de0e592dd06d8e0635e8acb025bb39172e","observation_id":"56f2f064-2e36-4252-ba89-aead5995fa7c","resolution":{"observed_at":"2026-08-12T14:48:30.997318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-12T14:48:31.095992Z","title":"robosuite: A modular simulation framework and benchmark for robot learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.095992Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:4eb8187c6e5cc38a9aacda3437adb1afabc3660f5b698f2764a301372df4265f","observation_id":"85d899b7-b03c-40dd-b295-b59a4411a9ba","resolution":{"observed_at":"2026-08-12T14:48:31.095992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.127842Z","title":"Mujoco: A physics engine for model- based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.127842Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:bf01b1c477296776230c370d65cd176dfc939cb75f7ba6e5b8a8d7d5de29ffd4","observation_id":"73e5f864-71e1-40bd-a30f-532ab89c1b59","resolution":{"observed_at":"2026-08-12T14:48:31.127842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.376649Z","title":"Deep reinforcement learning at the edge of the statistical precipice,","venue":null,"work_id":"aba126e7-742f-4f9d-a6f7-3a4108a81aab","year":2021},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.140165Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:fd6cc04c7143338c0d9f956b509cbff0b5ce7ffe241719dc96003330ed871f45","observation_id":"d671c6fe-2f47-4ef7-b420-2b808b940341","resolution":{"observed_at":"2026-08-12T14:48:31.382002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:48:31.314195Z","title":"CORN: Contact-based Object Representation for Nonprehensile Manipulation of General Unseen Ob- jects,","venue":null,"work_id":"b55dae82-8c0c-4451-8552-1e992aa89ee8","year":2024},"citing_paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:48:31.145133Z"},"links":{"citing_paper":"/paper/2411.14913"},"observation_digest":"sha256:cda4debcb13a7ff2b20a217d64957b20bae53ea709464979c34d28aace51b300","observation_id":"17f99b32-432b-42a4-95d7-2c3c60adb074","resolution":{"observed_at":"2026-08-12T14:48:31.343831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14913","last_updated":"2025-04-25T21:42:58Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T18:30:42.405087Z","submitted_at":"2024-11-22T13:14:54Z","title":"Enhancing Exploration with Diffusion Policies in Hybrid Off-Policy RL: Application to Non-Prehensile Manipulation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2411.14913."}