{"as_of":"2026-08-09T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e484803b0801967e74de46939f4f41a369feff469e002a884ab0d312969e5a4","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:21:18.474336Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07279/citation-record","integrity":"/paper/2502.07279/integrity","json":"/paper/2502.07279/citation-record.json","paper":"/paper/2502.07279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.546860Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"3d7603f2-6ac8-461d-92b2-58e21f280eab","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.114277Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:563a81bf1291870909a09f230e6ebf7b0956ff372e568dc501cc5a58b8c28eeb","observation_id":"717804df-2c64-4226-83eb-f028019cddf1","resolution":{"observed_at":"2026-08-08T13:21:19.552117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.120405Z","title":"Tenenbaum, Tommi S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.120405Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:694a301e96f9c2eead1ec76e3605a2f7b0a861a4a0467216e7120c0930d0e102","observation_id":"1186c289-b8cd-485a-8f62-13bd7c4d93da","resolution":{"observed_at":"2026-08-08T13:21:18.120405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12399","last_updated":"2024-10-30T14:34:49Z","snapshot_observed_at":"2026-07-06T18:16:59.602510Z","submitted_at":"2024-05-20T22:51:05Z","title":"Diffusion for World Modeling: Visual Details Matter in Atari","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12399","snapshot_observed_at":"2026-08-08T13:21:18.125931Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.125931Z"},"links":{"cited_paper":"/paper/2405.12399","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:0e0c1b895159ed0ff7298d5dc43d2411b3fe5ff38cc44a83718919e7c40a4e40","observation_id":"52013a13-f6fb-4638-a35d-f2950327fed6","resolution":{"observed_at":"2026-08-08T13:21:18.125931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.521624Z","title":"Random polytopes, convex bodies, and approximation","venue":null,"work_id":"d8150c27-9d9b-4ce0-a8e4-d1245ee77897","year":2004},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.132825Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:524efacf0bffa0dbb1229b5cf7f06ad6bb3295e00892a0129a8cb50be5e19dd8","observation_id":"1c04bd1b-5546-4893-bbf7-dd6bb3d3540b","resolution":{"observed_at":"2026-08-08T13:21:19.526532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16030","last_updated":"2024-05-25T03:07:56Z","snapshot_observed_at":"2026-08-09T10:44:55.899803Z","submitted_at":"2024-05-25T03:07:56Z","title":"Constrained Ensemble Exploration for Unsupervised Skill Discovery","version":1},"cited_work":{"arxiv_id":"2405.16030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16030","snapshot_observed_at":"2026-08-08T13:21:18.932250Z","title":"Constrained Ensemble Exploration for Unsupervised Skill Discovery","venue":"cs.LG","work_id":"9533d703-363a-4f62-8824-9e61258e3dda","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.138225Z"},"links":{"cited_paper":"/paper/2405.16030","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:2a3cab09a2faf31a32a5f126ac733c25c4f79788b33028842fdfe9797c54d9d0","observation_id":"b5f258a2-ebde-445b-a142-3e292e93ebe1","resolution":{"observed_at":"2026-08-08T13:21:18.939754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.144431Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.144431Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:677e4a657684525004114045ac5ed397366f726c04a0b5cf3922a002d67b91d1","observation_id":"8f7e1583-b62b-47d7-81c5-d76e8d9c4e00","resolution":{"observed_at":"2026-08-08T13:21:18.144431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.495032Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"ca5331d9-77ed-439b-b72c-16b08cb37c7c","year":2020},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.150828Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:7e63b3a7239963d8eb064e7cf33505ac7564b87c65abb2b1edba9ef66a53462d","observation_id":"9ce0c823-a0ac-4384-888a-ad82f96ec597","resolution":{"observed_at":"2026-08-08T13:21:19.500380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02316","last_updated":"2025-06-10T14:50:48Z","snapshot_observed_at":"2026-07-06T20:30:59.454606Z","submitted_at":"2025-02-04T13:37:14Z","title":"DIME:Diffusion-Based Maximum Entropy Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02316","snapshot_observed_at":"2026-08-08T13:21:18.155791Z","title":"Dime: Diffusion-based maximum entropy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.155791Z"},"links":{"cited_paper":"/paper/2502.02316","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:4760d634d40799d35cd8b150f7eb9e6b4c26b8ef987622bee0ce9ca650ea8be7","observation_id":"4f41f3bf-524c-4d7d-b5ec-4ce13f26c927","resolution":{"observed_at":"2026-08-08T13:21:18.155791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-06T12:36:01.385451Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-08T13:21:18.160941Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.160941Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:43528edbe8267831df379474172d1198dba6fdc6ae962877f28ed489e4d219e7","observation_id":"749b2cf6-799b-4bcd-ad89-0bd4e41b92a5","resolution":{"observed_at":"2026-08-08T13:21:18.160941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02644","last_updated":"2024-01-05T05:28:40Z","snapshot_observed_at":"2026-08-04T15:37:47.750655Z","submitted_at":"2024-01-05T05:28:40Z","title":"Simple Hierarchical Planning with Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02644","snapshot_observed_at":"2026-08-08T13:21:18.166804Z","title":"Simple hierarchical planning with diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.166804Z"},"links":{"cited_paper":"/paper/2401.02644","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:0183b90c00a919fe6fd3a51461654b558031c7c3d6f6825755bbbf6d1fde5175","observation_id":"193876ed-7802-427e-94db-c299f5ddd8df","resolution":{"observed_at":"2026-08-08T13:21:18.166804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.478977Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":"f0bee4d6-10e5-4447-92cc-054470acac1b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.172641Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b969febfc5e487abfb7535c033811bc14ff5111cfe5d428dd5eae3d3f5970f23","observation_id":"249abdf1-5bc1-4cb2-b12b-91895894bbe9","resolution":{"observed_at":"2026-08-08T13:21:19.484341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09024","last_updated":"2024-10-30T07:31:43Z","snapshot_observed_at":"2026-07-06T18:45:13.949715Z","submitted_at":"2024-07-12T06:32:36Z","title":"Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09024","snapshot_observed_at":"2026-08-08T13:21:18.177946Z","title":"Aligning diffusion behaviors with q-functions for efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.177946Z"},"links":{"cited_paper":"/paper/2407.09024","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3a7ee0e6b2a2bcad85370a851a6c41c94a42392b9c9f403ef249d30df0bd1445","observation_id":"b00d0d5a-5bcb-4ec0-81b1-cf47f5dbac27","resolution":{"observed_at":"2026-08-08T13:21:18.177946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.183415Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.183415Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:54dd63ef78a93b6180e95af881e3319ad7a80534c4fc782ab4e2535ee954ae9f","observation_id":"20988d13-2fcd-4b7a-9bad-507db77e9192","resolution":{"observed_at":"2026-08-08T13:21:18.183415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-03T03:59:22.374270Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-08T13:21:18.188814Z","title":"Diffusion posterior sampling for general noisy inverse problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.188814Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9fad642c34ab06a8d0edb66a88376f94664539a84ad03391aef426de764ecb7a","observation_id":"b8dca37e-e625-40fc-98d4-dffeb92cb3b0","resolution":{"observed_at":"2026-08-08T13:21:18.188814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.194341Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.194341Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:e98ea97c708dcac6bf9eb381ca406c041628703f4b2239f56537801085e191aa","observation_id":"f1b9aff1-ba8b-4410-81e3-dbf0334efd1a","resolution":{"observed_at":"2026-08-08T13:21:18.194341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03570","last_updated":"2024-10-15T20:56:47Z","snapshot_observed_at":"2026-08-09T10:44:13.100606Z","submitted_at":"2024-02-05T22:43:57Z","title":"Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03570","snapshot_observed_at":"2026-08-08T13:21:18.199380Z","title":"Diffusion world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.199380Z"},"links":{"cited_paper":"/paper/2402.03570","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8defc82b88cd5fc2ec81cdd0af17d428ac839ce0a18610835c9b0e41255fa1ef","observation_id":"5bc01a3b-00f9-4a54-837c-210713bbf508","resolution":{"observed_at":"2026-08-08T13:21:18.199380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.442517Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"8c6534c3-ad9b-4656-886f-fa8f67e4a94d","year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.204573Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c85b7cd7e42181e865f2f429dc25285ea18fc76313d8dc5ccc194e5f9be6821f","observation_id":"cba315ae-fa8a-4bee-abeb-1f10bb41e019","resolution":{"observed_at":"2026-08-08T13:21:19.447422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.426469Z","title":"The information geometry of unsupervised reinforcement learning","venue":null,"work_id":"a41d95ee-643a-4b7d-9f78-d2707068677c","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.209501Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:05ff7ddabc6703c46245ac111637849687abe06bf365e5078169f22c787dde5c","observation_id":"54de6cbc-71f0-46b0-a13f-32ea678baa77","resolution":{"observed_at":"2026-08-08T13:21:19.431559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.411137Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"eb45a38e-b411-485a-81d5-9ae77eddee96","year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.214553Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:0e33c804c58a4b653ec38f5b3aff545c1bc7b5339a0287cab965f22a75524b60","observation_id":"e6ded4df-fa16-481d-ac4b-24d104174cae","resolution":{"observed_at":"2026-08-08T13:21:19.416165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.394692Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"b58327d5-749c-4b6e-b9d1-9e26ecf3cf4f","year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.219668Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:be6903191f7c47ceb4f9dd081b4ea9b1262e17576815b7f189b4e1041cda0370","observation_id":"8b9f12ab-cea0-4ef4-984c-bbdd091494d1","resolution":{"observed_at":"2026-08-08T13:21:19.400294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-08T13:21:18.224350Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.224350Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f9cb9e05981418ad2797c86840738cca7ecd3376715c265811627d7b6930e905","observation_id":"1803d2cc-0e49-4e91-8a24-4828acd0e416","resolution":{"observed_at":"2026-08-08T13:21:18.224350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.379105Z","title":"Diffusion model is an effective planner and data synthesizer for multi-task reinforcement learning","venue":null,"work_id":"cae2f33b-3ab5-4769-874e-51fd1e6e6b43","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.229805Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f7fae885f60d0c887c1acc040522accce328854640d29fbf533679db508f7358","observation_id":"d90fbec2-cc75-4562-a0d7-519a7e761017","resolution":{"observed_at":"2026-08-08T13:21:19.384186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.234847Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.234847Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:2c7f0f1e175c4382f4e4e0a05ad84f2681798ead380aeba287bc942e7270a77f","observation_id":"65d6ffed-8431-4bc1-a236-6b8da9905ac9","resolution":{"observed_at":"2026-08-08T13:21:18.234847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17827","last_updated":"2025-01-29T18:18:00Z","snapshot_observed_at":"2026-08-04T08:49:09.558304Z","submitted_at":"2025-01-29T18:18:00Z","title":"Langevin Soft Actor-Critic: Efficient Exploration through Uncertainty-Driven Critic Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17827","snapshot_observed_at":"2026-08-08T13:21:18.239564Z","title":"Langevin soft actor-critic: Efficient exploration through uncertainty-driven critic learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.239564Z"},"links":{"cited_paper":"/paper/2501.17827","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:6aaa2fbb63f21a918dc20351d17b7fa79f5fb26c389b4326a4e0ab073ce7d7cd","observation_id":"09ba4fbd-d15c-448d-86d4-586560b38a47","resolution":{"observed_at":"2026-08-08T13:21:18.239564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.353531Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":"ee54ed3c-1b78-416a-8a65-c7514fb7b28d","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.245569Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:69c9f5bef7e2bdeec839d626955a70cc9e4e7f937b90d435db501348c215abc0","observation_id":"64ea5b7d-a4d1-46a6-b3d7-bc072f27085f","resolution":{"observed_at":"2026-08-08T13:21:19.358510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.250301Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.250301Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:e2ed10f0ff8409bc15f256135946f76a55ec72affb75cdd4d4e43916a96bdd2a","observation_id":"0c81c733-6952-4b95-b4ef-2d8cb7a0c569","resolution":{"observed_at":"2026-08-08T13:21:18.250301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.328103Z","title":"Unsupervised skill discovery with bottleneck option learning","venue":null,"work_id":"6d4c4d9e-0253-4bc5-8b09-6ceddb98f5eb","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.255235Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:bc5b6a5a7ef814aa5deec4b0e0ffb13d19d06a94a1f864b581693bdf255ea5d7","observation_id":"3204f4ed-570d-404d-a18a-3d0ca8e4e2a1","resolution":{"observed_at":"2026-08-08T13:21:19.333288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.259982Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.259982Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:730d16faf74ab22be7cd8799296f906318ad559c7555b79b7054e81775360373","observation_id":"edc71b78-a83a-4795-9c54-6c4638cda4b5","resolution":{"observed_at":"2026-08-08T13:21:18.259982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.301421Z","title":"Unsuper- vised reinforcement learning with contrastive intrinsic control","venue":null,"work_id":"727f19ec-c817-4ba3-a726-f2b793db63c4","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.264755Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3b66f338c30bdb816b58fac7569013790c3337917e90e57f1942a8a5e62266a0","observation_id":"73b8f274-5633-4882-8931-202c37755d65","resolution":{"observed_at":"2026-08-08T13:21:19.306391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.283669Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":"1080cd0c-27e0-4e6a-9a05-7ef213472d04","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.269581Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:1c877a8dd9ab222f8ce0f8a786bd6e275790761cb494b8f6958664e4d86b219e","observation_id":"cf259c37-eb98-47a3-ad23-3cb9c6052bb5","resolution":{"observed_at":"2026-08-08T13:21:19.289871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-07-06T07:59:54.501936Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-08T13:21:18.274465Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.274465Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:3a27ab792196c045daba3e8af11908d4c0697114f85798f1fd4b1159641e1e72","observation_id":"b4104a14-fb61-4278-a931-3d2289529bc0","resolution":{"observed_at":"2026-08-08T13:21:18.274465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.267297Z","title":"Hierarchical diffusion for offline decision making","venue":null,"work_id":"2bc9a59e-6c50-44b8-908c-c67d4dd9516a","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.279537Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:01c532ed605016e681e9521df87e1a23122177b93f9f6f463a2e8ca823f45f08","observation_id":"5c091b6d-b0e9-499a-b58b-8156c8a0d9ec","resolution":{"observed_at":"2026-08-08T13:21:19.272069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00681","last_updated":"2024-06-02T09:32:28Z","snapshot_observed_at":"2026-08-07T18:25:11.407857Z","submitted_at":"2024-06-02T09:32:28Z","title":"Learning Multimodal Behaviors from Scratch with Diffusion Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00681","snapshot_observed_at":"2026-08-08T13:21:18.284794Z","title":"Learning multimodal behaviors from scratch with diffusion policy gradient","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.284794Z"},"links":{"cited_paper":"/paper/2406.00681","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:29af25c63a8aa49550ea2fa265fda7d3e52552df330aece4e7a87de21cbe898a","observation_id":"5d47d839-47e1-4e91-8bf6-b317946c851b","resolution":{"observed_at":"2026-08-08T13:21:18.284794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.252177Z","title":"Adaptdiffuser: Diffusion models as adaptive self-evolving planners","venue":null,"work_id":"ca014f79-03dc-402d-abfc-905761a4cd0b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.290217Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:77c8528f47948a5ea46d734f86d6c823064c941ed92aced0ea1083f2b45097b2","observation_id":"6c2cff4f-45cc-4e34-84b6-a9c51d4e44ad","resolution":{"observed_at":"2026-08-08T13:21:19.256958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-08T13:21:18.295604Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.295604Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c120f5bdc7d22ad207f96f9997fea94a138ac55726ac3cff8b31d3b7e228457b","observation_id":"bb26dcbb-b4dd-4744-8451-210dee826867","resolution":{"observed_at":"2026-08-08T13:21:18.295604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.236742Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"1de90850-61de-4076-b47b-7661a0afcf3b","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.301156Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f9fc2dcc20ffbb79f14161175992825f6cc0c8d9778508f82caf0d76cde29482","observation_id":"acacfe4a-278d-49ad-9b0e-3b4e0ab72907","resolution":{"observed_at":"2026-08-08T13:21:19.241608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.221271Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":"d64f287d-9c82-4010-9dc0-dd13ce35230e","year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.307110Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9ca02a502343b51b0d5f6ff83f5a348cd302f1b441233458e7a05361813a14ea","observation_id":"6e3ab296-d29d-45aa-8575-4f2845740779","resolution":{"observed_at":"2026-08-08T13:21:19.226391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12448","last_updated":"2024-09-03T18:40:47Z","snapshot_observed_at":"2026-08-05T04:25:11.974350Z","submitted_at":"2024-07-17T09:56:51Z","title":"Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12448","snapshot_observed_at":"2026-08-08T13:21:18.313075Z","title":"Energy-guided diffusion sampling for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.313075Z"},"links":{"cited_paper":"/paper/2407.12448","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9bec3ef70981ab0eaa47bea9fcedfe7efaee2e52d004c6370be0db272e71687a","observation_id":"436e4d5e-93f0-458f-9091-e6ccdef8eb7a","resolution":{"observed_at":"2026-08-08T13:21:18.313075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.204515Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":"eda4fcec-8881-4adf-9f72-7ede9af282e6","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.318224Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:430b3688f0a38c7aa0ace3c888842ee432683cad664fdf32dd14a6ae03d43139","observation_id":"43d3f187-783d-4d0c-bf6d-39429be652df","resolution":{"observed_at":"2026-08-08T13:21:19.210145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.323013Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.323013Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:8be9bfa84eac9e02f485c3032a5d7aa2cb9d6bb4daf52401f6d591b4be7dff0a","observation_id":"d6dd9ac4-0c13-4e8e-ba70-a58255ea0506","resolution":{"observed_at":"2026-08-08T13:21:18.323013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.177012Z","title":"Synthetic experience replay.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"1536079c-e752-4cb6-a59d-19e9eff35982","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.328698Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:71b372084df5792d7084fbf226c08dfef4173df6b93aea2f92cb1e753999da33","observation_id":"cab513be-a52c-4aa6-841e-378ec63bd8f9","resolution":{"observed_at":"2026-08-08T13:21:19.182147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-08T05:39:26.157687Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00361","snapshot_observed_at":"2026-08-08T13:21:18.333364Z","title":"Soft diffusion actor-critic: Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.333364Z"},"links":{"cited_paper":"/paper/2502.00361","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b50d7de287c7139f6663b6ebac7783ebbd8d4f983e93eba42437658f8112a43c","observation_id":"e1fcfedc-9fa5-464d-813c-f463941d62e6","resolution":{"observed_at":"2026-08-08T13:21:18.333364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-08T13:21:18.339718Z","title":"Policy agnostic rl: Offline rl and online rl fine-tuning of any class and backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.339718Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:be10476d2e8d10b8a43e3b67db69e282060af70985e0d37dfc5350537b1102b7","observation_id":"4c5de78b-2d75-439a-83d5-9af270e71cc1","resolution":{"observed_at":"2026-08-08T13:21:18.339718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.161636Z","title":"Curiosity-driven exploration via latent bayesian surprise","venue":null,"work_id":"cd310671-ebf9-4783-aa8c-5ccfc4e24472","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.344637Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:16230704e22088aa6409cfd387a7346464e5131c713fba6f32bf60fe78aaf24a","observation_id":"ad88db33-c4b8-4834-933b-e230cbf6614d","resolution":{"observed_at":"2026-08-08T13:21:19.166694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.146269Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"56b91315-35fa-4348-9fa3-78861581df40","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.349181Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:9d21e085548f7a8c2b4670b47c155c9867981c0e47da00ed6c5d8b14e2d811be","observation_id":"e36c7829-ae27-43f0-8d40-9e40197bdf24","resolution":{"observed_at":"2026-08-08T13:21:19.151235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-08T13:21:18.353849Z","title":"Metra: Scalable unsupervised rl with metric-aware abstraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.353849Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b20435eb24b4f45be0dd4712455e6e804b0407190e2cc0d3986da95e4992c897","observation_id":"25988992-dc49-4b2d-b2c8-54d202233e5e","resolution":{"observed_at":"2026-08-08T13:21:18.353849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.129692Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"81f61734-c28b-499a-a7c8-7b637b1ac489","year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.358862Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f619ee950bdf760cc7256a9d85deaf2f4722669adcb2d76dde6d0c67ff00c04e","observation_id":"de555d34-5ec6-4044-b0ab-c4e20ecf47c2","resolution":{"observed_at":"2026-08-08T13:21:19.135131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.112760Z","title":"Self-supervised exploration via disagreement","venue":null,"work_id":"f1cb5614-00f3-4426-befa-903518ecc9dc","year":2019},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.363809Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:35612d0bdad6e99b546cc837ea6ae856cab03b7c23b85e9ebb7b02de41cbc3b2","observation_id":"360a91dc-9430-4d88-ad63-b63cf128d0fd","resolution":{"observed_at":"2026-08-08T13:21:19.118151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-08T13:21:18.368484Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.368484Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:dfd25c711a65827500d3980b76788185ae9456682987ac5e220c20045828aa31","observation_id":"b957b3af-87ce-4b1b-b3ef-1e63cc384755","resolution":{"observed_at":"2026-08-08T13:21:18.368484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11752","last_updated":"2025-02-13T23:18:56Z","snapshot_observed_at":"2026-07-06T17:04:58.670142Z","submitted_at":"2023-12-18T23:31:01Z","title":"Learning a Diffusion Model Policy from Rewards via Q-Score Matching","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11752","snapshot_observed_at":"2026-08-08T13:21:18.374992Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.374992Z"},"links":{"cited_paper":"/paper/2312.11752","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:03c5023d916f989af9bfe38c2699abe129d6d5765cef78f4421bbfcce16d1cdf","observation_id":"42042865-f0ce-403b-a6f5-260f47240610","resolution":{"observed_at":"2026-08-08T13:21:18.374992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-08T13:21:18.380367Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.380367Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f07a39b5f989bf624b774eeefa0df8956608e0ab3fceb3ff13dd0372d647320e","observation_id":"06931fde-8a40-45aa-87d0-7d1de4e1d46c","resolution":{"observed_at":"2026-08-08T13:21:18.380367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.385361Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.385361Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:138a37c6a8d75b3196ebd30bd2bcf2585d0bca5facb2cc7eab2df1c225f3fd0d","observation_id":"2707d75e-063d-4aec-be49-31b33b7b274d","resolution":{"observed_at":"2026-08-08T13:21:18.385361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T13:21:18.390208Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.390208Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c4b8954ea9bad527a86400a92e199e9173731138b882dd29b3207550566134a2","observation_id":"db3205d2-3abc-442f-97a3-48c031397268","resolution":{"observed_at":"2026-08-08T13:21:18.390208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.395721Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.395721Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:5c45dfd3562de87a64b8d4fde15d67d2198b2607ff64bb6fb1803e56c40f0d2f","observation_id":"cbbf8218-1a96-4e75-b11d-10589a6f930c","resolution":{"observed_at":"2026-08-08T13:21:18.395721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.400244Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.400244Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:b24429c9aa7a8db08d3ebe0d0b5b9b187f8f9aef03f873be1f50d3e0a110a790","observation_id":"9c1c4d90-8598-49f0-8f25-d4866102963a","resolution":{"observed_at":"2026-08-08T13:21:18.400244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.404894Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.404894Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:f551dc551242ec56dbf8d12fd3855fe43f096af9672271bd189984082053ace9","observation_id":"413bb471-9086-4afb-904a-9a6070a93c95","resolution":{"observed_at":"2026-08-08T13:21:18.404894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.409791Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.409791Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:684fc273d7b3ff63de138ef75d1dd470bd577b94bbafe20bb8c29783c5ac4b4b","observation_id":"0b3437f2-eb5b-4c53-89d8-2a520ae2f4b7","resolution":{"observed_at":"2026-08-08T13:21:18.409791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:21:18.414534Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.414534Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:4174b8d46e883b22dad080cb5ada291c7ebe6070f87d0b07f579308417fc61e3","observation_id":"55ee6be8-6836-40f9-a899-c5f22e3d4788","resolution":{"observed_at":"2026-08-08T13:21:18.414534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-08T13:21:18.420119Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.420119Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:7de16f53730590ef9f09f4eb0525466b5ff0d5713243ecb658daac71c8b7c5f8","observation_id":"bce0a378-af0f-4c70-a587-9312f03ea012","resolution":{"observed_at":"2026-08-08T13:21:18.420119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.424969Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.424969Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:e45685c6c9c585e7c35b69a578d3e17cf004306972ef51cb2319609dc0fc2087","observation_id":"6594c9c2-0ac2-47fb-9fb0-2a70427a63b8","resolution":{"observed_at":"2026-08-08T13:21:18.424969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.034155Z","title":"A problem in geometric probability","venue":null,"work_id":"acb94a2c-e1ea-47ad-b58e-d69cafd57ea3","year":1962},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.429537Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:66040fcb78ea066fac14ce7c5115f6d92b43eba9a7209496f2b8ead15bc46b35","observation_id":"0198e1c6-8411-45ae-951a-24aca56b6b25","resolution":{"observed_at":"2026-08-08T13:21:19.039086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18076","last_updated":"2025-07-11T20:30:30Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:58:45Z","title":"Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18076","snapshot_observed_at":"2026-08-08T13:21:18.434308Z","title":"Leveraging skills from unlabeled prior data for efficient online exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.434308Z"},"links":{"cited_paper":"/paper/2410.18076","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:c03e4e5e0f65f6ba185e7258d2ca9f5efee62948a6e12926eacf0d0c23249d65","observation_id":"5944f1a6-f8ea-44a9-90e7-e9a2249fdadb","resolution":{"observed_at":"2026-08-08T13:21:18.434308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-08T14:32:15.565933Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-08T13:21:18.438947Z","title":"Policy representation via diffusion probability model for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.438947Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:33632d32652178e0c4a7f1ce09f3f674884b25fe6c4d0af24b5f35f8ed7d3c1d","observation_id":"3f30d08a-8ca5-447b-b349-8d05edb0bc5b","resolution":{"observed_at":"2026-08-08T13:21:18.438947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.017480Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"1a75baf9-bd3c-42bf-8c58-98050138a35b","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.443810Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:0778de8446bbda006519c27edb6e77b122df73f1e24313c6bc484ac1c634808e","observation_id":"78c1c545-d060-40a5-be76-0c7b9837b1b8","resolution":{"observed_at":"2026-08-08T13:21:19.022950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:19.001749Z","title":"Peac: Unsupervised pre-training for cross-embodiment reinforcement learning","venue":null,"work_id":"e407eb96-736f-421c-941f-df8d0f4dae1a","year":2024},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.448752Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:92c89106314a9a77fd3e71db96452a2e37795812fd0d58ff7df5ae592c40abe4","observation_id":"a5ec26a0-6739-42d7-9d04-108188dd472f","resolution":{"observed_at":"2026-08-08T13:21:19.006929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04436","last_updated":"2022-09-17T12:52:26Z","snapshot_observed_at":"2026-08-09T10:17:13.567358Z","submitted_at":"2022-06-09T11:57:54Z","title":"Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04436","snapshot_observed_at":"2026-08-08T13:21:18.453588Z","title":"Towards safe reinforcement learning via constraining conditional value-at-risk","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.453588Z"},"links":{"cited_paper":"/paper/2206.04436","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:49773ab2997d34ee30f4cfb042ba3f282ba18bbda295d30cb76b314be5db693b","observation_id":"6ba8d291-d21f-4541-8de4-667a1bc26e33","resolution":{"observed_at":"2026-08-08T13:21:18.453588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.984386Z","title":"Automatic intrinsic reward shaping for exploration in deep reinforcement learning","venue":null,"work_id":"7cb1e253-2570-4226-b0b6-7dc451cbc8a6","year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.459069Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:7883bed7b73b41fe1b7399d6e2df0c1a35a6e15b2179b0a4fae3a7430d2f58ad","observation_id":"5376eb95-3c8f-4f54-84ab-3ed8f27c2477","resolution":{"observed_at":"2026-08-08T13:21:18.989867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00498","last_updated":"2023-02-22T03:55:34Z","snapshot_observed_at":"2026-07-06T13:58:44.973768Z","submitted_at":"2022-10-02T12:11:44Z","title":"EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00498","snapshot_observed_at":"2026-08-08T13:21:18.464264Z","title":"Euclid: Towards efficient unsupervised reinforcement learning with multi-choice dynamics model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.464264Z"},"links":{"cited_paper":"/paper/2210.00498","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:6f97eb9c435cbefaa56863330b41b4afebaa2d4a3866635cc5fbb884bc63c961","observation_id":"97a9345c-5642-4da6-94fc-5352cf84b381","resolution":{"observed_at":"2026-08-08T13:21:18.464264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:21:18.968781Z","title":"A mixture of surprises for unsupervised reinforcement learning","venue":null,"work_id":"a36296f8-bda4-45c1-a12b-c5633e425589","year":2022},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.469375Z"},"links":{"citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:d82ace3b9adf24b2109ee817f4d77051e1954c53c98c1d45af383765722733d9","observation_id":"7d7c98b1-be79-47c8-b37e-c988112b88fa","resolution":{"observed_at":"2026-08-08T13:21:18.973702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01223","last_updated":"2024-02-23T14:42:57Z","snapshot_observed_at":"2026-07-06T16:42:12.176043Z","submitted_at":"2023-11-02T13:23:39Z","title":"Diffusion Models for Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01223","snapshot_observed_at":"2026-08-08T13:21:18.474336Z","title":"∞X i=0 γi (R(si, ai) − βDKL(π(·|si)∥πd(·|si))) s0 = s, a0 = a # =Es∼ρ0,a∼π(·|s)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.474336Z"},"links":{"cited_paper":"/paper/2311.01223","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:7a0649ac392d7e579cae8e4504d3597f5b08e50d618b313e9f09afb142aa891d","observation_id":"a33c2e8f-595f-448c-ba50-fecddc257fad","resolution":{"observed_at":"2026-08-08T13:21:18.474336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T13:12:33.630286Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2502.07279."}