{"as_of":"2026-08-07T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7ebe4b5aa519c9ee8a6ee85b4e8b14095872c21a44be7a161573aade7f22687","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:32:35.308340Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:18:45.143694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05477","snapshot_observed_at":"2026-08-03T03:18:45.143694Z","title":"Epistemically-guided forward-backward exploration.arxiv:2507.05477, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08557","last_updated":"2026-06-30T09:31:26Z","snapshot_observed_at":"2026-08-04T13:53:54.524141Z","submitted_at":"2026-02-09T11:54:45Z","title":"Combined Constrained Sampling and Reinforcement Learning for Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T03:18:45.143694Z"},"links":{"cited_paper":"/paper/2507.05477","citing_paper":"/paper/2602.08557"},"observation_digest":"sha256:5232b9d33b010fdc865ad8fcabedd044c19053a2628a720c5a3cc898ee82ec14","observation_id":"c699018c-5239-4955-9582-2b8d5e5957f6","resolution":{"observed_at":"2026-08-03T03:18:45.143694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05477/citation-record","integrity":"/paper/2507.05477/integrity","json":"/paper/2507.05477/citation-record.json","paper":"/paper/2507.05477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.876827Z","title":null,"venue":null,"work_id":"1f690eb8-d528-477c-853b-1c6e727867aa","year":2025},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.308340Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:e2c3d006c155d780dab72e97f9155426afcfed2f9864b163925c1a7a94fbcea7","observation_id":"cdb6e8ec-0078-45c9-98fe-1e9521d04c37","resolution":{"observed_at":"2026-08-06T19:32:35.882126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-07-06T12:03:06.452840Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T19:32:33.850798Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.850798Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:943459b1c611395ff61894e115c99c40afd562e07ea1dc94fc583e0f38f05356","observation_id":"6a562b5b-dfad-4cdb-bdee-9306df3dcf24","resolution":{"observed_at":"2026-08-06T19:32:33.850798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00161","last_updated":"2022-03-30T01:09:18Z","snapshot_observed_at":"2026-08-05T17:23:09.985316Z","submitted_at":"2022-02-01T00:36:29Z","title":"CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00161","snapshot_observed_at":"2026-08-06T19:32:33.928269Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.928269Z"},"links":{"cited_paper":"/paper/2202.00161","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:91cc0b8cac4c77156b52992d1774d99f640b69599bdb3085da1e4256c36fcbfd","observation_id":"bbe4c8fa-a521-4713-9492-3c4af3489c6a","resolution":{"observed_at":"2026-08-06T19:32:33.928269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-07-06T07:59:54.501936Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-06T19:32:34.022256Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.022256Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:75bcd2c8745d230c11f297418f55b696e70fcd908a7d999263e02444b71c418a","observation_id":"c80051a4-0e9e-4d70-8278-c2f8451cdb5e","resolution":{"observed_at":"2026-08-06T19:32:34.022256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.924387Z","title":"Radford M Neal","venue":null,"work_id":"27eff850-dc8a-454d-88e7-ef37f1fdd345","year":2019},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.439504Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:2181bcb212ee9458ad5cc7251e6d16834d59bc00664aa56ce4ccb9807319efd3","observation_id":"5b94f7de-60d6-4108-869e-25694130c221","resolution":{"observed_at":"2026-08-06T19:32:35.929750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-06T19:32:34.678091Z","title":"arXiv:2310.08887","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.678091Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:9da53675c175c663fa4cb19107b241d12330199f543ef9e0d86311daf79d7cfc","observation_id":"f604d288-2360-4d34-ba4f-800fe8a22f7a","resolution":{"observed_at":"2026-08-06T19:32:34.678091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06615","last_updated":"2025-03-01T03:07:31Z","snapshot_observed_at":"2026-08-01T19:29:13.076681Z","submitted_at":"2024-06-07T04:25:38Z","title":"Language Guided Skill Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06615","snapshot_observed_at":"2026-08-06T19:32:34.742766Z","title":"arXiv:2406.06615 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.742766Z"},"links":{"cited_paper":"/paper/2406.06615","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:f52d46685c8ed543982eebc38bb87000c7a8516f6ef9d3cab37eb8f3237605b8","observation_id":"4da52897-9655-4248-9d09-20fe993c5e94","resolution":{"observed_at":"2026-08-06T19:32:34.742766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14226","last_updated":"2022-05-12T14:07:48Z","snapshot_observed_at":"2026-08-03T10:11:07.660072Z","submitted_at":"2021-07-29T17:58:04Z","title":"Learning more skills through optimistic exploration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14226","snapshot_observed_at":"2026-08-06T19:32:34.884188Z","title":"arXiv:2107.14226 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.884188Z"},"links":{"cited_paper":"/paper/2107.14226","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:d9e017e4585a1e9211d66e4f3f6b20afe6af7129ae5d796f6de8a28a99dd9880","observation_id":"d2a7ebc6-ec23-4b10-9906-8f82151745c5","resolution":{"observed_at":"2026-08-06T19:32:34.884188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12371","last_updated":"2023-10-30T15:18:01Z","snapshot_observed_at":"2026-07-06T15:45:10.138095Z","submitted_at":"2023-06-21T16:26:59Z","title":"Optimistic Active Exploration of Dynamical Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12371","snapshot_observed_at":"2026-08-06T19:32:34.955726Z","title":"arXiv:2306.12371 [cs, eess]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.955726Z"},"links":{"cited_paper":"/paper/2306.12371","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:17b51b004907684856863b73e7b6e73eac2b5b1d84e6a60b1a5405c6c16b95ae","observation_id":"15aae158-40fe-4f56-93e7-c91e517cbd88","resolution":{"observed_at":"2026-08-06T19:32:34.955726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T19:32:35.041566Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.041566Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:032f342c197ad7e7effd929fcbae6ffe5aa23cfa16f5e9ae3e7685ded1465987","observation_id":"62811960-c9fe-4002-94d9-59eee7640de7","resolution":{"observed_at":"2026-08-06T19:32:35.041566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14935","last_updated":"2023-03-01T18:01:09Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:54:05Z","title":"Does Zero-Shot Reinforcement Learning Exist?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14935","snapshot_observed_at":"2026-08-06T19:32:35.184044Z","title":"Does zero-shot reinforcement learning exist? arXiv preprint arXiv:2209.14935,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.184044Z"},"links":{"cited_paper":"/paper/2209.14935","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:fc71d1e5affe798d8e4813203c7c752a9b6167875178cbafe369de10102a358d","observation_id":"1c619615-fd57-4838-a56b-cba765c42db2","resolution":{"observed_at":"2026-08-06T19:32:35.184044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04586","last_updated":"2018-10-10T15:25:49Z","snapshot_observed_at":"2026-07-06T07:07:13.878203Z","submitted_at":"2018-10-10T15:25:49Z","title":"The Laplacian in RL: Learning Representations with Efficient Approximations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04586","snapshot_observed_at":"2026-08-06T19:32:35.242918Z","title":"The laplacian in rl: Learning representations with efficient approximations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.242918Z"},"links":{"cited_paper":"/paper/1810.04586","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:96e4ae6b8449abf18dc81a3b97cdd32655776fefc558d51ad83da83db14ecc0b","observation_id":"77cb6181-fbbd-4067-baac-2d5a52d15009","resolution":{"observed_at":"2026-08-06T19:32:35.242918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.908813Z","title":"Zero-shot whole-body humanoid control via behavioral foundation models","venue":null,"work_id":"1815e824-c74a-4fbc-8f9f-139c29a96315","year":2025},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1933,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.099232Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:9523043261696f8272bae82e71c994d375e8136e656ba5862e8faad344b63f6b","observation_id":"676f0145-bdb0-4d8f-99ef-19571b11c0fa","resolution":{"observed_at":"2026-08-06T19:32:35.913648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:34.298741Z","title":"DOI: 10.1162/neco.1992.4.4.590","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.298741Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:c08b36ae590b73c88a21e3e3a824e632209597f13fca0e15fc341b8990073b42","observation_id":"531c8646-018c-473a-a6ed-235cc464fba4","resolution":{"observed_at":"2026-08-06T19:32:34.298741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-07-06T06:23:52.853341Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-06T19:32:33.542854Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.542854Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:fd4e348bf66246c8be255318d2fefdd3d5b2a331e7b6fbc87e578d406bf5660d","observation_id":"7005b169-85fc-423d-9a58-9cf57bae26a3","resolution":{"observed_at":"2026-08-06T19:32:33.542854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.940276Z","title":"ISBN 978-1-4471-2099-5","venue":null,"work_id":"7254631d-e17d-4504-9383-45c159a42d01","year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.132215Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:9704f7c625b6efc3fdc8321e1c56427670d98aa87190fc67fc6f2e0c60f5a215","observation_id":"7c4e8fa0-3681-4a58-9c0a-0d60078c85d7","resolution":{"observed_at":"2026-08-06T19:32:35.944762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:33.355943Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.355943Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:51ad774b2035c33b5bc4f99bda85deb9a150e0127d50c37f8b8cfc0db17fb2ba","observation_id":"c4b11d40-6f3f-4bcc-b430-ab609c598dfc","resolution":{"observed_at":"2026-08-06T19:32:33.355943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05030","last_updated":"2020-01-27T18:14:54Z","snapshot_observed_at":"2026-08-04T08:10:28.790873Z","submitted_at":"2019-06-12T09:39:05Z","title":"Fast Task Inference with Variational Intrinsic Successor Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05030","snapshot_observed_at":"2026-08-06T19:32:33.717439Z","title":"Fast task inference with variational intrinsic successor features.arXiv preprint arXiv:1906.05030,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.717439Z"},"links":{"cited_paper":"/paper/1906.05030","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:8579785a5d725fb448099a59e90a9d6f1e552b23d71bebb815a48b4804fc2f85","observation_id":"ce0df517-ea97-4ee1-b44c-87f1c5958902","resolution":{"observed_at":"2026-08-06T19:32:33.717439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T19:32:33.151136Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.151136Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:c0770229254860469712d4e695dc0e927b090ed29057b0067d590a82d4d236c3","observation_id":"5830355e-4360-4c3d-9795-0f345f6414b8","resolution":{"observed_at":"2026-08-06T19:32:33.151136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:32:35.893107Z","title":"• Point-mass Maze: a 2-dimensional continuous maze with four rooms","venue":null,"work_id":"a9be5941-053d-40d4-89c4-1a73e5af05c5","year":2022},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.297820Z"},"links":{"citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:6a955547dc72b0499def65af05adf2590f84fe5b97b856e7957940c36d9d55be","observation_id":"8e5e35de-bd22-491f-9209-6b9d9f23960b","resolution":{"observed_at":"2026-08-06T19:32:35.897838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05026","last_updated":"2025-06-22T16:19:25Z","snapshot_observed_at":"2026-07-06T19:29:01.116622Z","submitted_at":"2024-10-07T13:26:36Z","title":"Active Fine-Tuning of Multi-Task Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05026","snapshot_observed_at":"2026-08-06T19:32:32.656141Z","title":"Active fine-tuning of generalist policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:32.656141Z"},"links":{"cited_paper":"/paper/2410.05026","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:57aa97e2d9872ed18413d87e8b564b56fc830dd89f373630fbee18d90eee3ce1","observation_id":"af17d13d-4f92-4f39-a413-e950ea7b2171","resolution":{"observed_at":"2026-08-06T19:32:32.656141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01657","last_updated":"2020-02-14T23:20:43Z","snapshot_observed_at":"2026-08-07T06:01:49.776810Z","submitted_at":"2019-07-02T21:32:19Z","title":"Dynamics-Aware Unsupervised Discovery of Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01657","snapshot_observed_at":"2026-08-06T19:32:34.807117Z","title":null,"venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.807117Z"},"links":{"cited_paper":"/paper/1907.01657","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:f448324b59c458c078ee672b6293c2a99461d734db13fbb2d976c6e0c20d9186","observation_id":"6c34781e-890b-4cc6-b75c-9f2be1a45cb6","resolution":{"observed_at":"2026-08-06T19:32:34.807117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07123","last_updated":"2021-01-18T15:33:26Z","snapshot_observed_at":"2026-07-06T10:33:27.116166Z","submitted_at":"2021-01-18T15:33:26Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07123","snapshot_observed_at":"2026-08-06T19:32:32.924634Z","title":"Charles Blundell, Julien Cornebise, Koray Kavukcuoglu, and Daan Wierstra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:32.924634Z"},"links":{"cited_paper":"/paper/2101.07123","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:3f90e97b3b4f59254f47e33c3d28285d2b64ae2950a7dead61f3db25900e3933","observation_id":"0211dde7-c40f-4a47-b775-6b561654b0ed","resolution":{"observed_at":"2026-08-06T19:32:32.924634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00914","last_updated":"2022-02-08T07:34:26Z","snapshot_observed_at":"2026-08-03T00:16:10.512395Z","submitted_at":"2022-02-02T08:29:04Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","version":2},"cited_work":{"arxiv_id":"2202.00914","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.00914","snapshot_observed_at":"2026-08-06T19:32:35.513436Z","title":"Lipschitz-constrained Unsupervised Skill Discovery","venue":"cs.LG","work_id":"75212e78-e7c1-4554-835d-ef487d32135d","year":2022},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.547165Z"},"links":{"cited_paper":"/paper/2202.00914","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:fcb5988a822306750858f30636f5d49ae11b275a7ff05314f882ed2d4ece974e","observation_id":"9eeb93ea-b163-4843-9734-e7a12e0c7c8f","resolution":{"observed_at":"2026-08-06T19:32:35.520346Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05103","last_updated":"2023-06-03T23:35:22Z","snapshot_observed_at":"2026-08-06T05:06:22.979236Z","submitted_at":"2023-02-10T08:03:09Z","title":"Controllability-Aware Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05103","snapshot_observed_at":"2026-08-06T19:32:34.611173Z","title":"Seohong Park, Oleh Rybkin, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:34.611173Z"},"links":{"cited_paper":"/paper/2302.05103","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:5c727bd4258d84596f6864a07cdc95efe1f9ddc68a52a786c759d23f345aa2b5","observation_id":"2b930376-b3a1-4e4f-8d88-e3bbeb837eb2","resolution":{"observed_at":"2026-08-06T19:32:34.611173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15178","last_updated":"2024-10-30T10:11:03Z","snapshot_observed_at":"2026-07-06T16:24:01.868957Z","submitted_at":"2023-09-26T18:20:20Z","title":"Zero-Shot Reinforcement Learning from Low Quality Data","version":3},"cited_work":{"arxiv_id":"2309.15178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15178","snapshot_observed_at":"2026-08-06T19:32:35.592586Z","title":"Zero-Shot Reinforcement Learning from Low Quality Data","venue":"cs.LG","work_id":"3bd036c1-5c8a-4989-b981-c4d20d04e9c1","year":2023},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:33.788031Z"},"links":{"cited_paper":"/paper/2309.15178","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:0904a78b622d7386679fb04ad1da2dc38193e1aea1be221e8c5b99bbefb4be4f","observation_id":"4f5c7d2c-430d-4106-9127-8cbf6170698e","resolution":{"observed_at":"2026-08-06T19:32:35.597985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:23:07.095008Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2507.05477."}