{"as_of":"2026-08-07T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bebeaf4893bfde9c8e95b9ee98f7842ba9e79b3e9a326c0f014fb5946bba367","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:38.230312Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21044/citation-record","integrity":"/paper/2506.21044/integrity","json":"/paper/2506.21044/citation-record.json","paper":"/paper/2506.21044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:33.145979Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.145979Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e6e38780372ea8af72c56c2ce712ae2e6a1a46e22d26de90447de6044d29fde1","observation_id":"90c85963-0971-41b0-9aa5-55b627618389","resolution":{"observed_at":"2026-08-06T22:41:33.145979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.318865Z","title":"M., Crump, T., and Far, B","venue":null,"work_id":"a0d356bb-5656-4db3-8089-40b7574190c3","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.201982Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:ceb1df7813cd650192544f83960746ad53d34273dddad10aee2774e45f7266ab","observation_id":"1da8fa44-ed1a-4839-883e-e382ad82a665","resolution":{"observed_at":"2026-08-06T22:41:39.322974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-08-06T22:41:33.306850Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.306850Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:92a998a6fd84efa9ec496cfc1d284b18f49a929940b201cc0723d44abb7de9a5","observation_id":"b46a063f-888c-427f-b844-28504c636e07","resolution":{"observed_at":"2026-08-06T22:41:33.306850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08464","last_updated":"2024-12-09T08:50:46Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T13:01:18Z","title":"TLDR: Unsupervised Goal-Conditioned RL via Temporal Distance-Aware Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08464","snapshot_observed_at":"2026-08-06T22:41:33.424348Z","title":"Tldr: Unsupervised goal-conditioned rl via temporal distance-aware representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.424348Z"},"links":{"cited_paper":"/paper/2407.08464","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9814a828dfba0e9096399576aec1202afc248bcbba2e44b7d3f499a016f24507","observation_id":"88f1255f-08d8-45f4-a571-a72faee19108","resolution":{"observed_at":"2026-08-06T22:41:33.424348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.305901Z","title":"K., and Konidaris, G","venue":null,"work_id":"7ac1a028-3f77-4ecf-9f43-97dc91e96246","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.518360Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d74fd5aad7687491c43a695b2a4a64a7f25557ab9221043455aba28dd7df926f","observation_id":"1ea52e5c-7a75-40e5-8676-473c33a22ed3","resolution":{"observed_at":"2026-08-06T22:41:39.310533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.293193Z","title":"Constrained ensemble exploration for unsupervised skill discovery","venue":null,"work_id":"5a8bf0df-fffd-4c69-a4f6-50e5823c9506","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.609290Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1f8357b196b0d186fcb9cbfb0343474d05c9561f2be46b96b60f166206467e89","observation_id":"0e414a57-7eaf-4db7-9a17-26479fb26d17","resolution":{"observed_at":"2026-08-06T22:41:39.297553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.279888Z","title":"X., Tanner, J., Vuong, Q., Walling, A., Wang, H., and Zhilinsky, U","venue":null,"work_id":"7dad8a5f-73ec-4f05-8190-e73fa224055b","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.703614Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:21a39235f7cf5f395612c8751eec15745926f43867846a45a92da027ec6407c6","observation_id":"9a4094e2-9f68-4cd4-bdfe-ea633f5bcc5d","resolution":{"observed_at":"2026-08-06T22:41:39.283764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.265449Z","title":"Exploration by random network distillation","venue":null,"work_id":"da131bad-69e6-4d47-863e-97a04fad662c","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.785283Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d2c493f3d01e425c14706a04ab2f049b7b4a8e2dde28f04cfa7a927c63a692c0","observation_id":"0f826a26-1c03-4767-ade4-ceeb660bfa10","resolution":{"observed_at":"2026-08-06T22:41:39.270252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.251041Z","title":"Explore, discover and learn: Unsupervised discovery of state-covering skills","venue":null,"work_id":"9e307ef5-d9fa-49f7-a7e6-2982368696d2","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.836290Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:06c5588f8464f533d1f55ffb8cba0100d794079d9f7e0e6f6facddef4640c4c2","observation_id":"55067e30-d11b-4a7b-9452-07042e042327","resolution":{"observed_at":"2026-08-06T22:41:39.256300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.236567Z","title":"Language as a cognitive tool to imagine goals in curiosity driven exploration","venue":null,"work_id":"3f153ad6-4f61-45e0-a4f5-097513413601","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:33.917944Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:4facf0448df219c1ebac55ede6552102fadaa109e8aca90c613955723612f833","observation_id":"6f836df7-b49c-4975-87b2-7d70de188e82","resolution":{"observed_at":"2026-08-06T22:41:39.241660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.222192Z","title":"Autotelic agents with intrinsically motivated goal-conditioned reinforcement learning: a short survey","venue":null,"work_id":"abde6b12-f6e5-4bdc-b9f9-e5c5846097fb","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.005894Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:63890b42a84e47c30ee8243d1aa740351bfa28c8fc11168e8a73cfaaa4fb3e59","observation_id":"0b03d062-5f28-41ad-bee5-78a4176256fd","resolution":{"observed_at":"2026-08-06T22:41:39.227451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.207801Z","title":"Goal-conditioned imitation learning","venue":null,"work_id":"784064dd-be11-4cf9-90e0-2e28b9e1ad1e","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.090668Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1aca9d7bfdfab962b6be81b3db39a1129e5b604ce284e0eee7e1bb2a2641893f","observation_id":"ba3fe812-2a9d-4457-abdc-473cae2bb186","resolution":{"observed_at":"2026-08-06T22:41:39.212302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.192857Z","title":"Adversarial intrinsic motivation for reinforcement learning","venue":null,"work_id":"d9599649-e653-4817-9231-e3b6f721a166","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.203128Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b70c8aef08ea35e4ecd9a40b3ef31ef2221b1035bbe0998281a5e43c766dcfe8","observation_id":"a5494acd-cb81-4cd8-a6e5-f246fab0f8bd","resolution":{"observed_at":"2026-08-06T22:41:39.198143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.179293Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"4578d606-731a-4608-a952-fefab304897f","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.247740Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:364ab447d061f01a78bbf5085a7b46e91d40f2a520a4f481e25e861777c0410e","observation_id":"e284d72f-c053-4426-b2b3-0abe976a1ce9","resolution":{"observed_at":"2026-08-06T22:41:39.184132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08909","last_updated":"2021-04-19T18:33:47Z","snapshot_observed_at":"2026-07-06T10:15:31.432847Z","submitted_at":"2020-11-17T19:58:56Z","title":"C-Learning: Learning to Achieve Goals via Recursive Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.08909","snapshot_observed_at":"2026-08-06T22:41:34.332286Z","title":"C-learning: Learning to achieve goals via recursive classification","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.332286Z"},"links":{"cited_paper":"/paper/2011.08909","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:743f80b03d8207eaf868fc66cc96dc7abb1b71fd5875ec2ac16e85fc72011071","observation_id":"143187d5-3f4d-4258-9ef2-695f91139aa3","resolution":{"observed_at":"2026-08-06T22:41:34.332286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.165779Z","title":null,"venue":null,"work_id":"d7c2bb20-44d7-4c3a-8b99-441caf363eab","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.417950Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:76b2eb71ba034fe53e37c1f4028a79dc63c5e0b5fcf728d280134f2ab23c280a","observation_id":"20c0ea5b-129c-4409-bda9-7de5ec4a561b","resolution":{"observed_at":"2026-08-06T22:41:39.170092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.152368Z","title":"Curriculum-guided hindsight experience replay","venue":null,"work_id":"f58f1579-70f5-4803-9284-0584935b2ccc","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.468891Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2fc4b97f0adea1d1acb4b29f5ed1a685fed1939f60f1a141e99e556b077e16d0","observation_id":"d9147cd4-2c24-4fa6-b982-d8eec0274326","resolution":{"observed_at":"2026-08-06T22:41:39.156692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:34.473619Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.473619Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:959cad7097aafced9c888fd470826feceb59608a6045a2b6ba39e9f2436c11fd","observation_id":"a5e18089-2bb6-4ebf-b2dd-aa137296a80a","resolution":{"observed_at":"2026-08-06T22:41:34.473619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.09614","last_updated":"2018-09-21T11:20:05Z","snapshot_observed_at":"2026-07-06T06:46:42.258795Z","submitted_at":"2018-06-25T12:06:28Z","title":"Accuracy-based Curriculum Learning in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09614","snapshot_observed_at":"2026-08-06T22:41:34.578090Z","title":"Accuracy-based curriculum learning in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.578090Z"},"links":{"cited_paper":"/paper/1806.09614","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e5ba6a28d0f4026067aae09c3b7073f251183a83d544f470bb69acce9aaba6e1","observation_id":"7d6cf578-631c-4d71-849a-32e0cf78ae83","resolution":{"observed_at":"2026-08-06T22:41:34.578090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.129023Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2020","venue":null,"work_id":"49bba89f-7b72-4e9c-9471-a99b8fd003a1","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.762057Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:a9d711f1a356860faecc8432b715d0208e4a143ba6f862aac90c2ae0c269b304","observation_id":"ccb63044-06ba-4f5f-8633-324719177297","resolution":{"observed_at":"2026-08-06T22:41:39.133429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-07-06T08:44:09.493337Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-06T22:41:34.963486Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:34.963486Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:973b67006e9b9c4a5165ef58b872fa80bcdec190522153fcca2d7d6f5b2efb8d","observation_id":"77335ca6-e087-4292-8657-b2892f585840","resolution":{"observed_at":"2026-08-06T22:41:34.963486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:35.121608Z","title":"and Oudeyer, P.-Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.121608Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:8ea5fe54d9aa451a6d25aa5732b2fc97f75aabdad347d76a83fef73b9a653768","observation_id":"53a1012f-57ab-4f05-a980-b04548088400","resolution":{"observed_at":"2026-08-06T22:41:35.121608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.106361Z","title":"J., and Wierstra, D","venue":null,"work_id":"7d47703d-544f-4e45-b4f9-08379c73b696","year":2016},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.261687Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2c22682dd78d6713e50f783f0a109eed9895c59cc2c76ab4f4bddbd00e4109df","observation_id":"50abf721-f062-4549-8f28-ca8c2852b4eb","resolution":{"observed_at":"2026-08-06T22:41:39.110596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:35.471301Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.471301Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:564b0d04933572bb71b05ba1ab96b142d6f96e6e19f6dfe5026d020d515760ce","observation_id":"37668b98-4ab1-4136-be9f-db203f06ca2b","resolution":{"observed_at":"2026-08-06T22:41:35.471301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07461","last_updated":"2018-02-21T08:13:12Z","snapshot_observed_at":"2026-07-06T06:24:32.238575Z","submitted_at":"2018-02-21T08:13:12Z","title":"Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation","version":1},"cited_work":{"arxiv_id":"1802.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.07461","snapshot_observed_at":"2026-08-06T22:41:38.457113Z","title":"Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation","venue":"cs.LG","work_id":"653ba206-6be0-484d-80fa-bbc4577e0afa","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.692807Z"},"links":{"cited_paper":"/paper/1802.07461","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:8e2b5a8f0840bf40cc17c3d7bc09c8c05a1a189e0a514fbc4fe60e9678668b53","observation_id":"a1cbfc2f-458d-472e-a9bb-20c95be91d63","resolution":{"observed_at":"2026-08-06T22:41:38.461935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.084022Z","title":"Exploration in deep reinforcement learning: From single-agent to multiagent domain","venue":null,"work_id":"53a6c5c0-ce8f-4bf3-85ec-9dcd84d22fc1","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:35.858079Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:6df16ae7efa8819f9d6fbee52989166d935354b4e64add9f8699ba04991b139b","observation_id":"33de2148-99d3-48aa-8870-312b786ce215","resolution":{"observed_at":"2026-08-06T22:41:39.089016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04268","last_updated":"2024-06-06T17:15:02Z","snapshot_observed_at":"2026-07-06T18:26:37.581248Z","submitted_at":"2024-06-06T17:15:02Z","title":"Open-Endedness is Essential for Artificial Superhuman Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04268","snapshot_observed_at":"2026-08-06T22:41:36.029860Z","title":"Open-endedness is essential for artificial superhuman intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.029860Z"},"links":{"cited_paper":"/paper/2406.04268","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:43a9cb26c82533b4653f2f50795254df434680d4f89fa97668a99b158e7f418f","observation_id":"3a774f42-b30f-4306-8538-3989effc3200","resolution":{"observed_at":"2026-08-06T22:41:36.029860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.070487Z","title":"Unsupervised curricula for visual meta-reinforcement learning","venue":null,"work_id":"4aa7ba9a-53e4-425e-8dc6-1f9814812d56","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.228723Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e528f05087e2d10f1256ac85205d9bf37ef6bfd1def804f133a59f1352493d7b","observation_id":"ce161550-23c4-49d2-a496-0089d72ad128","resolution":{"observed_at":"2026-08-06T22:41:39.074905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:36.398189Z","title":"A comprehensive survey on self-interpretable neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.398189Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:104ce00be80a93a53b0b3edeac102de67dc2aa310dd5d3e8c8c2708a91ec2869","observation_id":"63d64998-cf2b-468f-9fe6-c4c89b7cb46e","resolution":{"observed_at":"2026-08-06T22:41:36.398189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02439","last_updated":"2022-01-13T22:40:12Z","snapshot_observed_at":"2026-07-06T11:54:47.559384Z","submitted_at":"2021-10-06T01:01:39Z","title":"Replay-Guided Adversarial Environment Design","version":2},"cited_work":{"arxiv_id":"2110.02439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02439","snapshot_observed_at":"2026-08-06T22:41:38.323217Z","title":"Replay-Guided Adversarial Environment Design","venue":"cs.LG","work_id":"9d350d83-862a-4753-ad7c-c5f54da84364","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.601070Z"},"links":{"cited_paper":"/paper/2110.02439","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1fe514aebe64eb5892e5f9028366951a30a0ed8e2ea4fe5138856412b619f4ae","observation_id":"f843fe81-8fb2-4a69-a52a-25fa443fe92a","resolution":{"observed_at":"2026-08-06T22:41:38.328725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.057205Z","title":"Prioritized level replay","venue":null,"work_id":"5584c6bf-41ce-4856-aa42-a4ae4096205e","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.669110Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:cdb49f3fbf26d911de8a03703b1d7dc771bc68fea46e1f366f94ef52ae107a53","observation_id":"1fabd924-f58b-4583-b50b-12a9223ad4f0","resolution":{"observed_at":"2026-08-06T22:41:39.061604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.042971Z","title":null,"venue":null,"work_id":"2fd69ad3-1cd7-47d9-b0cf-2682dc8a5404","year":1993},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.714340Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:25585f78b607454dd146b70129d331e7d8571a3ebbf1bffae6e51100d955946a","observation_id":"d4f15ff1-9b76-4682-98e1-2f2825d64cbe","resolution":{"observed_at":"2026-08-06T22:41:39.047719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:36.740268Z","title":"and Oudeyer, P.-Y","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.740268Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:d81be39a1aae1550f79f241e02ffa2931d84ca572d82fd489f7b1bf8e8c0926f","observation_id":"844b097e-fc4a-44d9-959f-3033e3aa5941","resolution":{"observed_at":"2026-08-06T22:41:36.740268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.022414Z","title":"K., Lee, H., Hwang, D., Park, S., Min, K., and Choo, J","venue":null,"work_id":"3fe7cf1f-612a-421a-b6ff-f3dca41b7d9f","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.814734Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9335a7735dd267656038d9f11d8017960132439e9cf641b67d135d4282dc9fa5","observation_id":"3b147d4b-9840-417d-a8ce-3fcd0f63d7b5","resolution":{"observed_at":"2026-08-06T22:41:39.026333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:39.007439Z","title":"Unsupervised skill discovery with bottleneck option learning, 2021","venue":null,"work_id":"eddf565e-14b3-420d-8207-d56673951575","year":2021},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.865430Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f24cde23a1fa0866af2ba5c4adc99a527d8f8d73beb616fb494b37675290c882","observation_id":"e96c04cd-b09c-4589-87e6-e8d3b65bec21","resolution":{"observed_at":"2026-08-06T22:41:39.012568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.993996Z","title":"Active world model learning with progress curiosity","venue":null,"work_id":"07ffeae9-ae39-4997-a6b4-fb436360fe6e","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:36.942087Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f744c9463629ec4c7437ac95fb3ab37f2fd57f94acf584abd62e96868714654b","observation_id":"31c84aeb-d9aa-468b-842f-3722166e7392","resolution":{"observed_at":"2026-08-06T22:41:38.998539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.980687Z","title":"Exploration in deep reinforcement learning: A survey","venue":null,"work_id":"1f7a56bc-9da6-425d-a310-a1ef51369d1c","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.015977Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:6926a79c038d8bfb317e490f4191bea5cbaab1c308d3a2c3b839b606ae2dc8fb","observation_id":"661f3f1b-5f3b-4fb8-947c-aef0e73963a1","resolution":{"observed_at":"2026-08-06T22:41:38.985466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.966924Z","title":"B., Yarats, D., Rajeswaran, A., and Abbeel, P","venue":null,"work_id":"23a9c6da-4f27-4834-8f67-2029e5d09aa9","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.079101Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:725eeb36824107d6d8ce1bc44ee272b39cf51ad261cf80de33f6d028240edfab","observation_id":"b6d116a6-a48f-4cab-8144-738129961de2","resolution":{"observed_at":"2026-08-06T22:41:38.971539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.952745Z","title":"and Seo, S.-W","venue":null,"work_id":"cac21016-1e06-4dbb-a744-9235adc7b647","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.143371Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7c6cf41eabc06eb640136614466f43b66b1c0443e4c76573a6e0a17e5f3bba05","observation_id":"7fb3eaea-27e2-4d7f-b4c3-a3b8e91864d3","resolution":{"observed_at":"2026-08-06T22:41:38.957700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.939111Z","title":"Revisiting graph adversarial attack and defense from a data distribution perspective","venue":null,"work_id":"afe81809-5db8-44fa-878d-9e4c4a3fc870","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.200699Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:00490708ba366637782d62b5d5f074bb6d62581159852bd9bcd416e8435d8e7e","observation_id":"95fd50be-07ad-4499-b263-8839f0ba694b","resolution":{"observed_at":"2026-08-06T22:41:38.944068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.925336Z","title":"Boosting the adversarial robustness of graph neural networks: An ood perspective","venue":null,"work_id":"2258032e-96f5-4cab-b1d0-e6dec4e5622d","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.273877Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:256cee3ba9fa2a957621f92892b54b258319d4622277dc122c41daba39dd7fe7","observation_id":"5cbd798b-7508-4414-98dd-1f02158d4e1f","resolution":{"observed_at":"2026-08-06T22:41:38.929948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05804","last_updated":"2024-08-11T15:49:00Z","snapshot_observed_at":"2026-08-03T08:06:11.237161Z","submitted_at":"2024-08-11T15:49:00Z","title":"A Single Goal is All You Need: Skills and Exploration Emerge from Contrastive RL without Rewards, Demonstrations, or Subgoals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05804","snapshot_observed_at":"2026-08-06T22:41:37.321403Z","title":"A single goal is all you need: Skills and exploration emerge from contrastive rl without rewards, demonstrations, or subgoals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.321403Z"},"links":{"cited_paper":"/paper/2408.05804","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:468484ca4c7d0c5c9738a9109feaa276719ad2f0e0c68d018b18a65286058368","observation_id":"8972b79e-4f56-4c4d-879d-e3ff63f6d453","resolution":{"observed_at":"2026-08-06T22:41:37.321403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.911383Z","title":"Choreographer: Learning and adapting skills in imagination","venue":null,"work_id":"9c9bb606-f398-4a81-83b5-fb7cbfea7071","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.365884Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b37edddd80ca5666acb0ea78fd00bad71bebdbb2f3d8a837086f31d337aff567","observation_id":"17c92cf3-8124-4217-8929-958f476c3f8b","resolution":{"observed_at":"2026-08-06T22:41:38.916681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.897871Z","title":"Planning with goal-conditioned policies","venue":null,"work_id":"b4210aff-35ff-4be5-be2a-4e504cb09c34","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.462003Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:62924c53bd1f30c0068ac72a138430dcd5bb739e41b30a3f2fc89d0b3edb1b5f","observation_id":"57d2ebd6-1b94-4784-b061-afed5604589b","resolution":{"observed_at":"2026-08-06T22:41:38.901968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.884979Z","title":"Wasserstein dependency measure for representation learning","venue":null,"work_id":"3016ddcc-0230-4901-94ef-02ccda156a2d","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.499235Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:376840c21582da39b0cf0ccf39089f400a42da6cd2de1b0dfef149dc314c3c4c","observation_id":"06538529-6818-4526-94fe-164caa8d0a93","resolution":{"observed_at":"2026-08-06T22:41:38.889465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.871767Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"a2507c5d-58d0-4293-861e-4bc0f8d60a2c","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.582284Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:42f940188d31c287186590217ebcfffa58d5c8ed73adb58041c602cf3229d0c8","observation_id":"cb1c474e-9636-4702-886b-d7f66500ee3f","resolution":{"observed_at":"2026-08-06T22:41:38.876381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.858788Z","title":"Hiql: Offline goal-conditioned rl with latent states as actions","venue":null,"work_id":"d050609f-001e-4c04-9b34-41c289aa29b8","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.652587Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:f5ef4aea2ded5ffdb5ae5db613858da6c81eb15701e37a6b93d34030ffbcb6bb","observation_id":"2318ca52-4a84-4898-b339-788fcc50afb8","resolution":{"observed_at":"2026-08-06T22:41:38.863376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.845729Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":"30593d81-f7eb-44a2-a10c-54309797840c","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.697677Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1d2418eb6527a63d838799c57973a14e869f239034b427457cc61453a38084bd","observation_id":"edf572e2-741e-428e-8fa2-e7cf5223703b","resolution":{"observed_at":"2026-08-06T22:41:38.849816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.832704Z","title":"METRA : Scalable unsupervised RL with metric-aware abstraction","venue":null,"work_id":"b2b0f687-69dd-416c-af15-cd819499c137","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.797162Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:bfa19ee65e078b0b73b665b339a34238f534ab8246dc70a7ea0589c3adcbe633","observation_id":"1c666100-dff7-49e6-9bb4-4666000b500c","resolution":{"observed_at":"2026-08-06T22:41:38.837059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.819762Z","title":"Evolving curricula with regret-based environment design","venue":null,"work_id":"df70f6a8-8e4a-4154-b0d1-b6d0b878ccfd","year":2022},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.867902Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:55c313ec9df07e4a80fb39edd11d1afc531e53ba74c0f70dafc092ce40bd60db","observation_id":"b04ca4b0-c24e-47a8-a6e3-beb4780880fa","resolution":{"observed_at":"2026-08-06T22:41:38.824248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.805909Z","title":"A., and Darrell, T","venue":null,"work_id":"c570e2b0-9d2f-4132-8745-91734ab4ac22","year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:37.943248Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:7622ac777eb70dc207cbde01a030c789bd5f0f76e69933694664543c4e3b511d","observation_id":"06fc72e3-eb0c-41b2-aeec-450f54d74c22","resolution":{"observed_at":"2026-08-06T22:41:38.810397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.791935Z","title":"H., Dalal, M., Lin, S., Nair, A., Bahl, S., and Levine, S","venue":null,"work_id":"06304c72-e63f-4925-b26e-20e973c466e8","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.036854Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e0f6f31d923e9c7e1ad2f0dcdfa9581e7c5e163155259416a58310f132c0f3e5","observation_id":"99fba55d-032c-4e6b-9bbb-6e0f2bb19b85","resolution":{"observed_at":"2026-08-06T22:41:38.796256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04664","last_updated":"2020-05-28T20:51:40Z","snapshot_observed_at":"2026-07-06T09:03:37.435861Z","submitted_at":"2020-03-10T12:38:31Z","title":"Automatic Curriculum Learning For Deep RL: A Short Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04664","snapshot_observed_at":"2026-08-06T22:41:38.079354Z","title":"Automatic curriculum learning for deep rl: A short survey","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.079354Z"},"links":{"cited_paper":"/paper/2003.04664","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:14e6310b73fa1f4707d75d4dc0590d7aa4c8c4d79ad46215560d1d28fcdd02fe","observation_id":"9cfa1ce2-4d30-42d0-8d0b-d85150d118b1","resolution":{"observed_at":"2026-08-06T22:41:38.079354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.779065Z","title":null,"venue":null,"work_id":"537632b8-1ebd-4fb1-bd40-9beb97efe565","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.121688Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b80136380f94756a9d45128c911e88699dde85dfc494784ca4a00a2c05a97c0c","observation_id":"428819a6-0947-4e3d-90bb-107c5f699bdb","resolution":{"observed_at":"2026-08-06T22:41:38.783134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.765739Z","title":"Prioritized experience replay","venue":null,"work_id":"c9aff55f-fba2-4e87-8433-27899ac2d7c9","year":2016},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.131699Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:69a90e7b065c8eda677c0257acd4dd5cda47e0832c6e78b07020a15e14a3156b","observation_id":"20125f29-6832-4238-89d4-625fbd6c8abc","resolution":{"observed_at":"2026-08-06T22:41:38.770421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T22:41:38.139133Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.139133Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:b5ee11dff67f3b30d182a123d770b382d293e0a11b2456aec9f779d96deb24c4","observation_id":"c49c44bb-ec1b-4384-93b5-5b9283d4a7b8","resolution":{"observed_at":"2026-08-06T22:41:38.139133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.750452Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":"0eda6792-aa51-461a-8e00-f27e4a62747e","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.149622Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:ddec72175ead1d288f3b02465fccff116c6b95c5f0d38debc7528b58507342ba","observation_id":"37147148-54ea-48b5-ae05-9d0211ef2774","resolution":{"observed_at":"2026-08-06T22:41:38.755575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.735437Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"2cb942d7-b420-4880-acd2-2675cd2c9f51","year":2014},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.157683Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:c06567e3446ce9d0ac8c47e97e1d75ee80462c0d2e9e80c1278a41462f444efc","observation_id":"3ece75c2-8146-4a87-aac1-db7807dc5998","resolution":{"observed_at":"2026-08-06T22:41:38.740517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.720401Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play","venue":null,"work_id":"7658185c-c743-4a29-af13-e768e7dead00","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.165986Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9a53c7a64cf2b7b50525002a37499874b4d0e0db6ddeeb91523c9cd1cadb8dcf","observation_id":"ae196208-c010-45c4-9dee-eea8293b97e0","resolution":{"observed_at":"2026-08-06T22:41:38.725250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.706437Z","title":"Intrinsic motivation and automatic curricula via asymmetric self-play","venue":null,"work_id":"1010575a-4e60-4c67-972c-86b5d3190305","year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.170823Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:1074f3dafecb002caff4cbdd359f8775a4e732f0c66e3f8165b6e5253aec54dc","observation_id":"05395d97-732b-444f-971b-fd92e2885772","resolution":{"observed_at":"2026-08-06T22:41:38.710934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.692066Z","title":"Policy continuation with hindsight inverse dynamics","venue":null,"work_id":"50ea453f-3663-4a14-9e05-20bf88e699e6","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.174661Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2ecb72a8fc4521222b5839013554cbcffc9812bd989ed8f5bbfe458416d8350b","observation_id":"72c02ece-e109-43a7-a90a-62125a6fec8f","resolution":{"observed_at":"2026-08-06T22:41:38.696597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.677385Z","title":"Hierarchical reinforcement learning for dynamic autonomous vehicle navigation at intelligent intersections","venue":null,"work_id":"e55d7409-250c-4423-bf39-12aca89e6d23","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.179067Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:e5c17a41c3f501dfd9fd1aaa3ec9d01833faee5a59ca4cb62f6d8d2e16f46ea1","observation_id":"9343b173-20df-48ed-9c25-1f9d65641445","resolution":{"observed_at":"2026-08-06T22:41:38.682455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.662807Z","title":"Market-aware long-term job skill recommendation with explainable deep reinforcement learning","venue":null,"work_id":"3454ee91-8b07-4833-821b-6feb252f92cb","year":2025},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.183587Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:eef33e47fc349515d1671760ebc45df3f1089157d6e84fc6870fa22e336e6c3d","observation_id":"fdad43a7-eb70-470d-baff-90cdd4c02170","resolution":{"observed_at":"2026-08-06T22:41:38.667895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.188231Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.188231Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:5e617f04dc7bde906d365703a1a8a54aa4aa68b448fe459ace808602c53849e3","observation_id":"8abb6957-0f84-4e6a-b131-b2d2787a6ba8","resolution":{"observed_at":"2026-08-06T22:41:38.188231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.191955Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.191955Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:130e8b0e36d3ffbcc2ac8137c3c5ff7025d6c78ff337469b34088e474ce465d9","observation_id":"2c1ae144-c4ff-4eb7-bd6d-223d2bb13244","resolution":{"observed_at":"2026-08-06T22:41:38.191955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.632264Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":"91520d11-800e-4dee-bf8e-1a3765ebce81","year":2020},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.196846Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:774906ade49f3ad78ce464fbdbfa9437c51a76e4d28fb55d72fb8cf51ab895ab","observation_id":"0c85fde9-bacb-4a1b-8a53-ba00562a2777","resolution":{"observed_at":"2026-08-06T22:41:38.637023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.618239Z","title":"M., Mathieu, M., Dudzik, A., Chung, J., Choi, D","venue":null,"work_id":"c0947a04-ff02-4552-882e-1879ce6dd56d","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.201024Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:3a3f5478b19aba10fb81df9679c42f5d62c28d0a5f889499058df02606518e08","observation_id":"7fe00edc-7e18-485c-8903-9a3394f52bc8","resolution":{"observed_at":"2026-08-06T22:41:38.623333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.604308Z","title":"Optimal goal-reaching reinforcement learning via quasimetric learning","venue":null,"work_id":"8eb85e8d-e516-4465-84b8-09d5c45650f1","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.204893Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:16ced7e49d77b389c79989397b23f585b71a6fe8d1fa960908893a20c5d79347","observation_id":"d7b4d0c5-2d5f-4bdc-84e9-52b926ab9d66","resolution":{"observed_at":"2026-08-06T22:41:38.608881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.590532Z","title":"Ski LD : Unsupervised skill discovery guided by factor interactions","venue":null,"work_id":"f41761b1-467b-4229-971d-a65edd19ce1a","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.209112Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:2d3033c4385ad7bcd9861ac0f06184412da8a8dd4a088a1f3e9ab5391be09094","observation_id":"366bb4e3-00e8-4f0d-9c7f-15d14fc0b0d7","resolution":{"observed_at":"2026-08-06T22:41:38.594975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.577276Z","title":"A comprehensive survey of forgetting in deep learning beyond continual learning","venue":null,"work_id":"c13289bc-b6c0-400a-8a61-6ba29c6428ec","year":2024},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.213181Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:4e30679fe06b2c6a24ae9f29bc5510d9d855df6b7dc7cd61973c7c6f088cfffa","observation_id":"14c24df4-3b5b-43a6-8166-d494a170eb41","resolution":{"observed_at":"2026-08-06T22:41:38.581685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05865","last_updated":"2019-10-13T23:44:37Z","snapshot_observed_at":"2026-07-06T08:29:10.516150Z","submitted_at":"2019-10-13T23:44:37Z","title":"Neural Program Synthesis By Self-Learning","version":1},"cited_work":{"arxiv_id":"1910.05865","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.05865","snapshot_observed_at":"2026-08-06T22:41:38.264897Z","title":"Neural Program Synthesis By Self-Learning","venue":"cs.LG","work_id":"8897fd7a-9fd2-47cc-8346-a91fc97ae5a6","year":2019},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.217400Z"},"links":{"cited_paper":"/paper/1910.05865","citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:0722ccc9ac15b208071cd94eda0960aee9630d604887ddadcc4430421c1414e6","observation_id":"2d352df8-1244-410b-94cb-5d6481ba4334","resolution":{"observed_at":"2026-08-06T22:41:38.271036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.562783Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"a847def2-0828-4acf-8d99-20783a53128f","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.222361Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:6bd242555a50eb85cf9f19cc18e5df344543e939b25807effa1e8411089f5ebb","observation_id":"499e79d3-9c9e-4f05-ba46-034c0a95d1b5","resolution":{"observed_at":"2026-08-06T22:41:38.568005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.548420Z","title":"Interactive interior design recommendation via coarse-to-fine multimodal reinforcement learning","venue":null,"work_id":"706b9d57-6879-4bd6-b84e-c025949baa84","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.226237Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9a5961e7e9699dcd2ee156d3281b06714ee604fd075cc3aae205c608beba6967","observation_id":"9db995b6-e3eb-4e5b-9d9b-30ce1be6506b","resolution":{"observed_at":"2026-08-06T22:41:38.553086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:38.533880Z","title":"Generative learning plan recommendation for employees: A performance-aware reinforcement learning approach","venue":null,"work_id":"c9a46759-4bbd-4bb7-b2e2-3252ea573355","year":2023},"citing_paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T22:41:38.230312Z"},"links":{"citing_paper":"/paper/2506.21044"},"observation_digest":"sha256:9096b31bfbdb5c136de153ea8dd0b5568fe2a9f0dee140925925a1ca4bdaa75a","observation_id":"6c028a05-0532-41b4-8993-8abd49123dec","resolution":{"observed_at":"2026-08-06T22:41:38.538713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21044","last_updated":"2025-06-26T06:45:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T22:32:27.284523Z","submitted_at":"2025-06-26T06:45:59Z","title":"Efficient Skill Discovery via Regret-Aware Optimization"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":51},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2506.21044."}