{"as_of":"2026-08-13T03:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0c4c3c709d5aca692b5e40c543e64c5a25477a8c21d1a73a323e80a0d635d79","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:40:22.993933Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14085/citation-record","integrity":"/paper/2411.14085/integrity","json":"/paper/2411.14085/citation-record.json","paper":"/paper/2411.14085"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.671319Z","title":"Understanding the impact of entropy on policy optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.671319Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:1a0235e2fad7e3a22ea5052b334e00c8c5a20c6d3128f9ad7c7983f89e0a02d4","observation_id":"bda0ac68-1155-4998-9d0d-b046979b36b5","resolution":{"observed_at":"2026-08-12T15:40:22.671319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.681679Z","title":"Logarithmic online regret bounds for undiscounted reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.681679Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:e6f5e2e26001ebf57aba4127ffe03fa3dfc8dc993a3f02970aa8b5cd4caf69cc","observation_id":"2aaebc90-2d1e-4992-afb0-189339e19f25","resolution":{"observed_at":"2026-08-12T15:40:22.681679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-07-06T08:57:20.804732Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-12T15:40:22.692471Z","title":"Never give up: Learning directed exploration strategies","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.692471Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:87a6f847b1e21dd650dc83700a4c0339025caf653fbfce95f9c29447ab2c6605","observation_id":"156b852c-f9c9-4aa6-b4c0-53c03ad72b68","resolution":{"observed_at":"2026-08-12T15:40:22.692471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.699322Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.699322Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:d2876509abebf8fdb304ef05d411505ba89804362e3771ebf68c4f7228ff7576","observation_id":"97adbe7e-59de-4aba-b7e1-b88de64e1a3e","resolution":{"observed_at":"2026-08-12T15:40:22.699322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:24.209886Z","title":"Tightening exploration in upper confidence reinforcement learning","venue":null,"work_id":"f8e12739-63d1-455c-a990-a9e210a39ff2","year":2020},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.705292Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:6bb2050cb8b164619fd2e6549c18ac7587bf7c0f779e90202bb18c4aeae07554","observation_id":"bfbb4694-67b4-48d2-bbbe-435260879b5b","resolution":{"observed_at":"2026-08-12T15:40:24.217540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:24.187048Z","title":"R-max-a general polynomial time algorithm for near-optimal reinforcement learning","venue":null,"work_id":"fbb29c4c-cc78-4579-a908-9c50be6cb721","year":2002},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.712526Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:cdb7f8a146379e577bd53a00924690decd0d358b80a47a18e0dafdc6c08dd6bd","observation_id":"352e47e8-aa12-4e3a-a089-c0924e23141f","resolution":{"observed_at":"2026-08-12T15:40:24.194889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.719361Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.719361Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:e6ff191e3b42ac8c539ec7c32125629d70162ca62690cb7d2c081df7889eb7b6","observation_id":"cf5f0624-03ce-4d9e-8057-347c88ce7fcb","resolution":{"observed_at":"2026-08-12T15:40:22.719361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-12T12:07:37.369391Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-12T15:40:22.725940Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.725940Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:d5a9eb7564c79abea99aa42437c348cfd787a4680b662b603d3f9555f5b8bed5","observation_id":"e9264c41-c1b6-4e18-8f7b-556c108554e6","resolution":{"observed_at":"2026-08-12T15:40:22.725940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:24.136097Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"86067bd4-3c4f-4edf-b85c-0fa0ec027d08","year":2020},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.732004Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:2c36558ffa90cc657cff4a9cbab354e54a18b829cbd3044ae9682e9fb09257ee","observation_id":"ebeed464-1bb4-4ce0-ba2b-6cf43477017b","resolution":{"observed_at":"2026-08-12T15:40:24.144776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:24.107867Z","title":"Gymnasium robotics, 2023","venue":null,"work_id":"70cccfdd-4423-4ec5-b19d-6b59e76c7450","year":2023},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.738746Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:63caf31c717848ed7a90d520912730ab0a7b0ed93ec0fa164734cd8a5e1877fc","observation_id":"e07adfe4-06e6-4667-a28c-3f7ae357af6a","resolution":{"observed_at":"2026-08-12T15:40:24.118146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.746176Z","title":"Adversarial intrinsic motivation for reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.746176Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:37cbf2d165322c5afd4c81817fc0451cacf6d64cdcf34911b080b88b99887a04","observation_id":"48bb4e06-1fa2-4b2b-855e-895f0cbb78f1","resolution":{"observed_at":"2026-08-12T15:40:22.746176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-08-12T20:12:44.567915Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-12T15:40:22.755343Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.755343Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:301bf7865bbca8bbc58acc06b06130b3e246bcf061f822a1956f2c992eeb4e29","observation_id":"b7076def-4eb5-4022-95f7-01dc1bd63f7b","resolution":{"observed_at":"2026-08-12T15:40:22.755343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08909","last_updated":"2021-04-19T18:33:47Z","snapshot_observed_at":"2026-08-11T03:22:05.879340Z","submitted_at":"2020-11-17T19:58:56Z","title":"C-Learning: Learning to Achieve Goals via Recursive Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.08909","snapshot_observed_at":"2026-08-12T15:40:22.764035Z","title":"C-learning: Learning to achieve goals via recursive classification","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.764035Z"},"links":{"cited_paper":"/paper/2011.08909","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:e7a96f34da878d38433774998e1f619387af551470a8ebe604a4c8ed9859b71b","observation_id":"bf860004-ea3f-4702-b52b-9dd515496c77","resolution":{"observed_at":"2026-08-12T15:40:22.764035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:24.062750Z","title":"A theory of regularized markov decision processes","venue":null,"work_id":"cb68902e-dd2f-4fd7-9dde-ba039ad99a45","year":2019},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.772157Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:bc66b499ab05230ac4057252b188e96dd9068c0716ab885ada4479023717c4bb","observation_id":"398a2689-1d68-4d2d-b4f1-b6ed540f17ad","resolution":{"observed_at":"2026-08-12T15:40:24.072675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-02T15:05:52.307944Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-12T15:40:22.778062Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.778062Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:7b5a03e06cdb4ceedd2e4f40292ac79029ce5126a85440f978cfdea4132a334c","observation_id":"28eebf9b-7734-4f51-81ab-073146859ec2","resolution":{"observed_at":"2026-08-12T15:40:22.778062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.784544Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.784544Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:14a297f6346c221685f012355849e5bcb48e89f1fc2b0f12313a41c7aedcd354","observation_id":"a9ab1715-c75d-41f8-a8da-63e0d6fd77c7","resolution":{"observed_at":"2026-08-12T15:40:22.784544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.08225","last_updated":"2020-02-14T10:16:54Z","snapshot_observed_at":"2026-08-11T16:02:13.829514Z","submitted_at":"2019-07-18T18:07:47Z","title":"Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.08225","snapshot_observed_at":"2026-08-12T15:40:22.791638Z","title":"Dynamical distance learning for semi-supervised and unsupervised skill discovery","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.791638Z"},"links":{"cited_paper":"/paper/1907.08225","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:69809ed3d59d3679d55ebda0e5800122768ae3f9ca44eb3d0882313cdd263eee","observation_id":"3a0182ee-2e04-487b-8761-76456bef3f97","resolution":{"observed_at":"2026-08-12T15:40:22.791638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.799039Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.799039Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:3973bd00afda525e6e055968d791babc07b42cd524299a0b4d94309870bb783a","observation_id":"cce507e4-c2be-4db1-9446-2cf17a23dbbf","resolution":{"observed_at":"2026-08-12T15:40:22.799039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-08-08T00:00:13.424932Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-12T15:40:22.806820Z","title":"Reinforcement learning with unsupervised auxiliary tasks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.806820Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:8ea1bcedf868c80ed0da2f2e1960ecf7ac3816a06837fa93cae6109bc4324e90","observation_id":"5a961092-b5b2-4dd1-99f5-a9b585ea6427","resolution":{"observed_at":"2026-08-12T15:40:22.806820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:23.968639Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"29081c78-07df-431c-8981-8742e06bc3c8","year":2010},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.813752Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:6e54461e5d7634bb612fa1f661e9cacdc5ec899d06ec79855dffeb8797bc27d5","observation_id":"c37f81e9-a6bd-4726-97d1-4e1ff5b61807","resolution":{"observed_at":"2026-08-12T15:40:23.978194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10515","last_updated":"2023-07-14T22:50:52Z","snapshot_observed_at":"2026-08-09T06:40:59.587406Z","submitted_at":"2022-11-18T21:49:53Z","title":"Curiosity in Hindsight: Intrinsic Exploration in Stochastic Environments","version":2},"cited_work":{"arxiv_id":"2211.10515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.10515","snapshot_observed_at":"2026-08-12T15:40:23.431395Z","title":"Curiosity in Hindsight: Intrinsic Exploration in Stochastic Environments","venue":"stat.ML","work_id":"64aec464-dc4a-4cf6-8f01-d5cc5b6a39e2","year":2022},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.821313Z"},"links":{"cited_paper":"/paper/2211.10515","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:ed8b96fbfb1b977d2ed4183d72df6458f61ce42bd26f9e0436ee5aa4581ef4fb","observation_id":"cc3446e3-6e52-4083-90d6-4a328068dd0e","resolution":{"observed_at":"2026-08-12T15:40:23.441585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.827828Z","title":"Learning to achieve goals","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.827828Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:9d9c03792b7e3bebdfd9d03e5683f22cef9b4ce1eb2bd83cc5ca76b1bc617580","observation_id":"59b4327b-47b6-4cda-9521-2d49a4febf03","resolution":{"observed_at":"2026-08-12T15:40:22.827828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14457","last_updated":"2022-04-30T18:04:47Z","snapshot_observed_at":"2026-08-11T15:34:20.766703Z","submitted_at":"2021-10-27T14:22:19Z","title":"Direct then Diffuse: Incremental Unsupervised Skill Discovery for State Covering and Goal Reaching","version":2},"cited_work":{"arxiv_id":"2110.14457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.14457","snapshot_observed_at":"2026-08-12T15:40:23.385995Z","title":"Direct then Diffuse: Incremental Unsupervised Skill Discovery for State Covering and Goal Reaching","venue":"cs.LG","work_id":"6214a2b0-6791-45c8-bd8d-c0d7d65ffe33","year":2021},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.835716Z"},"links":{"cited_paper":"/paper/2110.14457","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:835b2814247b5a0f23bbfd96849c7b14c1f77404e2cf28a80818153d7b202adf","observation_id":"2ea18cef-fc6a-4454-ae3b-7daedb5bd4f8","resolution":{"observed_at":"2026-08-12T15:40:23.397294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:23.927236Z","title":"Near-optimal reinforcement learning in polynomial time","venue":null,"work_id":"73df7a4a-1240-4098-ae6a-18241829c32b","year":2002},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.842729Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:02522192a8e99f263c8646c4c6c883e2e1623d4163dc66de9f39fab43da65a56","observation_id":"84a2c8df-3059-4f40-8a48-891b37448f6a","resolution":{"observed_at":"2026-08-12T15:40:23.936279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05274","last_updated":"2020-02-28T16:02:59Z","snapshot_observed_at":"2026-08-10T09:58:55.020082Z","submitted_at":"2019-06-12T17:57:02Z","title":"Efficient Exploration via State Marginal Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05274","snapshot_observed_at":"2026-08-12T15:40:22.849543Z","title":"Efficient exploration via state marginal matching","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.849543Z"},"links":{"cited_paper":"/paper/1906.05274","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:f66c04fdd86586b1e775324ccac6941cc130fb2d5f6daaf0dd63285cd1173ec7","observation_id":"15a55ea9-11cf-4711-a47c-9a6a3559a711","resolution":{"observed_at":"2026-08-12T15:40:22.849543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.857404Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.857404Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:fc1aa3b76a124f000d762e6a569de07a7a081917ad907d98c7e2aba9f1d056c0","observation_id":"e173fc33-67ac-4aa5-bfdf-c62a8e28bc33","resolution":{"observed_at":"2026-08-12T15:40:22.857404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-12T14:28:10.961989Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T15:40:22.866447Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.866447Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:1b06741ea444c5a8fd185195e7a5c94b38611063321a93bebb2c4b7472a647bc","observation_id":"1f650188-b1c2-4f05-aea2-2cbd2c2edcb6","resolution":{"observed_at":"2026-08-12T15:40:22.866447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:23.864634Z","title":"From bandits to monte-carlo tree search: The optimistic principle applied to optimization and planning","venue":null,"work_id":"0cbba360-c75e-49cb-9d0e-eeca512a5b52","year":2014},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.874049Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:29d4432e74e567a32525e05ebf43dde3950c73c13aeadf5a9d0f6e5bde4945ca","observation_id":"c47e3dd3-11dd-4116-bbb9-587157d989d3","resolution":{"observed_at":"2026-08-12T15:40:23.871085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.879764Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.879764Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:fa54d6a086dd497772d5f888942450ce55989783ad6e072c8e8c4c79e8ef2986","observation_id":"ce970b08-2dba-43e1-8ed7-d2da2ef7e48a","resolution":{"observed_at":"2026-08-12T15:40:22.879764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05103","last_updated":"2023-06-03T23:35:22Z","snapshot_observed_at":"2026-08-09T14:58:39.766308Z","submitted_at":"2023-02-10T08:03:09Z","title":"Controllability-Aware Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05103","snapshot_observed_at":"2026-08-12T15:40:22.888083Z","title":"Controllability-aware unsupervised skill discovery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.888083Z"},"links":{"cited_paper":"/paper/2302.05103","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:9a8573acf1d396b9951404cd702731d79a8a32225689eb5fc92530d7d4d47b50","observation_id":"97ebaf27-37cc-4660-8241-1614519a0804","resolution":{"observed_at":"2026-08-12T15:40:22.888083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-12T15:40:22.901439Z","title":"Metra: Scalable unsupervised rl with metric-aware abstraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.901439Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:9f24c0f3ab10a93f36ec800ef7a6b4f06a79a20df71286bc0d940e62a570a504","observation_id":"a183e98b-a7ad-4878-bfcb-ffa433d719b7","resolution":{"observed_at":"2026-08-12T15:40:22.901439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.911757Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.911757Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:4fa6dbfe071f6352b3e2aab8429005cf4b8782ad76d104b1e81a57d76ba27c07","observation_id":"512b8519-aaed-4415-957c-468e426267b8","resolution":{"observed_at":"2026-08-12T15:40:22.911757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:23.810437Z","title":"Quality diversity: A new frontier for evolutionary computation","venue":null,"work_id":"efb3c7c0-fba6-471f-a365-e296a32fed2d","year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.918538Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:d88e1853438a1eb796731cf03e31a4c1e7cc6176664ae87f9a9c52a06e342e0a","observation_id":"c526c8ad-3378-40e9-b29c-ba8211e66079","resolution":{"observed_at":"2026-08-12T15:40:23.817369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.924720Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.924720Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:0939ce2650736f4a5870b0dd88f20f93f8338d9399af40229549050554269b08","observation_id":"c0969f63-0fcb-4107-9f41-8ab32ad40417","resolution":{"observed_at":"2026-08-12T15:40:22.924720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T15:40:22.935545Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.935545Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:fd864d884ce9bfc4bc0c3956e549b332e8c2958f8efed88eef4974c10e593cc5","observation_id":"05ec055b-250d-4ac9-b6f0-1459c4e9df7f","resolution":{"observed_at":"2026-08-12T15:40:22.935545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01657","last_updated":"2020-02-14T23:20:43Z","snapshot_observed_at":"2026-08-09T14:58:04.904559Z","submitted_at":"2019-07-02T21:32:19Z","title":"Dynamics-Aware Unsupervised Discovery of Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01657","snapshot_observed_at":"2026-08-12T15:40:22.941054Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.941054Z"},"links":{"cited_paper":"/paper/1907.01657","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:7aae939712e4cc9dff4ca448f63f0431bc3cddd7ef68abc1756253ab051fd6af","observation_id":"27bc0bba-74c6-4ac1-892d-d0d54d2552a5","resolution":{"observed_at":"2026-08-12T15:40:22.941054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.07307","last_updated":"2017-03-09T18:29:09Z","snapshot_observed_at":"2026-07-06T05:23:43.143337Z","submitted_at":"2016-12-21T20:29:26Z","title":"Loss is its own Reward: Self-Supervision for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.07307","snapshot_observed_at":"2026-08-12T15:40:22.946923Z","title":"Loss is its own reward: Self-supervision for reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.946923Z"},"links":{"cited_paper":"/paper/1612.07307","citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:08b8034f906b7e2f3fba4a3112b098b9cddb75a0272aa4cd27ced5ad97bd83bd","observation_id":"fbb7104e-b710-4690-a7e3-1a50ada25b5b","resolution":{"observed_at":"2026-08-12T15:40:22.946923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.953104Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.953104Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:ce729f5fe63ac2257f011f1c1f40e5c80f2964eb23beeb130f1cc2dca9d82a70","observation_id":"6a90249a-3c5f-4cbe-875f-f30070f4f9ee","resolution":{"observed_at":"2026-08-12T15:40:22.953104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.959323Z","title":"Optimal transport: old and new, volume 338","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.959323Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:e56583281ae00b75a65d1730a32b28df6b79befa924ce48b04958948a5cc3b31","observation_id":"90937fa2-3ba6-487c-bb54-2064e54cfd0c","resolution":{"observed_at":"2026-08-12T15:40:22.959323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.966704Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.966704Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:5ccdf639b622b9413d97045bb9095300965fc471c47076656360e015f9d3bbde","observation_id":"5853646a-b8ee-4150-b821-b535e9233959","resolution":{"observed_at":"2026-08-12T15:40:22.966704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.974577Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.974577Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:f5900921f3ee0c1d4b2dacd5198354d493763a644b0fe52a9cf3e8b95873aa8d","observation_id":"fc58cd2e-edc9-4505-a366-bb071d2ccd60","resolution":{"observed_at":"2026-08-12T15:40:22.974577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.983934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.983934Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:5a109142c011cfbbb8f9c6ac30effd7514a23eb2fd34cb4c1a3fd436550e0bc6","observation_id":"ddc433b5-d970-429a-8340-1a47a354753a","resolution":{"observed_at":"2026-08-12T15:40:22.983934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:40:22.993933Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T15:40:22.993933Z"},"links":{"citing_paper":"/paper/2411.14085"},"observation_digest":"sha256:73d8b30f507d4a4fc599db52df79e09aa7b132bffc234042708c192e289504db","observation_id":"5c83ec66-315c-4467-9424-6b9eadb33835","resolution":{"observed_at":"2026-08-12T15:40:22.993933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14085","last_updated":"2024-11-21T12:51:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T18:17:05.189781Z","submitted_at":"2024-11-21T12:51:09Z","title":"Exploration by Running Away from the Past"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2411.14085."}