{"as_of":"2026-08-13T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6a71b5457b763c1a552f384a22953f308ea1ea2861376349e2b02dbb5850174","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:44:54.854670Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03790/citation-record","integrity":"/paper/2509.03790/integrity","json":"/paper/2509.03790/citation-record.json","paper":"/paper/2509.03790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.212552Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"75bb2533-fc6b-4c16-a8f6-0d21c9cd09f6","year":2020},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:51.905996Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:1a77cddef8cdd07961a7f674eea2f8d7edc906742549760ec314574b75aa25f0","observation_id":"61a69c04-57ad-4741-9361-5d42d3ce38c7","resolution":{"observed_at":"2026-08-05T10:44:55.215477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.203743Z","title":"Concrete problems in ai safety","venue":null,"work_id":"066b8883-850d-4972-95fc-54b68e45080f","year":2016},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:51.938999Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:1100961ffc9f07358e0b87553633f619028d128adc24370ece2df21e198c1b88","observation_id":"a0618042-d32d-4fc4-a021-3ae207b9f65f","resolution":{"observed_at":"2026-08-05T10:44:55.206844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.195094Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"36b6fafb-0503-417e-815f-573f86421f5b","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.032067Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:45d22be7048bc1582c448b407f833af98dfdc0df4526879e8520923875c123df","observation_id":"b46811d9-cf55-4c4c-bea7-add12a9af030","resolution":{"observed_at":"2026-08-05T10:44:55.197987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.186219Z","title":"Never give up: Learning directed exploration strategies","venue":null,"work_id":"89ccf005-29ce-4791-afd0-33f08a7ef2e7","year":2020},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.156883Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:cccb572dac8bc635613a3009e3a124d3805e0dafd83b795750ec6f1c0499f995","observation_id":"d2c96fd8-c31a-4359-a2f3-6f48e6a3622a","resolution":{"observed_at":"2026-08-05T10:44:55.189310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.177417Z","title":"Successor features for transfer learning in reinforcement learning","venue":null,"work_id":"201b4513-044c-408e-b844-242eb5ee7edf","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.251342Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:b72b12de7ca4ec4fd2f3287e24452db199817a3f23340d845dd7bbf8b95f76fb","observation_id":"d125df17-233f-408d-97ae-9d45a4324230","resolution":{"observed_at":"2026-08-05T10:44:55.180348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.168509Z","title":"Recent advances in hierarchical reinforcement learning","venue":null,"work_id":"7e2929fe-15ac-441a-8557-b50bc94f4ab6","year":2003},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.353751Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:5b91d63a6f5eeb1117b19b96ff6354f4df68085d0d04453a5fd95d833f82c5cc","observation_id":"061405ec-0a5f-4977-a4b8-d8a40fa3f1b1","resolution":{"observed_at":"2026-08-05T10:44:55.171601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.159692Z","title":"Unifying count-based exploration and hashing: A case study of model-based rl","venue":null,"work_id":"c674a1c2-cef3-43e4-a5ee-b66281d8cbbc","year":2035},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.446776Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:def2e0216cd079e37cfd8c1200dd4f50ed2244bba9934d2c26a9584ece5717ab","observation_id":"6dae3d5d-5cec-42aa-b3c8-f7f42aba1ea9","resolution":{"observed_at":"2026-08-05T10:44:55.162825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.150339Z","title":"Exploration by random network distillation","venue":null,"work_id":"1415087d-5b39-4e13-9f81-95d61f051a7f","year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.541137Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:8be3e7351941a6466ca9c811832f651a2febafb42383c5669ad505288a8882b9","observation_id":"d03e90b6-52aa-48fe-b5b5-94a2079a9c21","resolution":{"observed_at":"2026-08-05T10:44:55.153375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.141737Z","title":"Exact matrix completion via convex optimization","venue":null,"work_id":"5731df9d-2753-4f5c-804a-369e9a52e50e","year":2009},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.672343Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:815f9663590c8f312449628c2f2a7be08addf7c057b16f8d58651661258a0ecb","observation_id":"343b61b7-4fea-44f5-89be-6fb11f97fd03","resolution":{"observed_at":"2026-08-05T10:44:55.144586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.132863Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"936c13c9-1c24-4031-a16b-c42013f0bb9c","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.767333Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:5446e1e124762ca339d79fd8cee5b409f0a8510713081e858151fc865221f5a6","observation_id":"03caf873-c70d-4398-8948-6c7b6ddac702","resolution":{"observed_at":"2026-08-05T10:44:55.136007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.124196Z","title":"Unifying pac and regret: Uniform pac bounds for episodic reinforcement learning","venue":null,"work_id":"7f00d45d-f19e-4ff7-b2fd-46d661bba53f","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.861378Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:f1d6974d49c1759a849d253aaaecb1d9f6188ce6b792ba7cb037e154ea6dc7fc","observation_id":"3436a895-2f50-435a-b202-d04e798b8df2","resolution":{"observed_at":"2026-08-05T10:44:55.127123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.115894Z","title":"First return, then explore","venue":null,"work_id":"f2d66ebd-2faa-4170-8563-e41618bd0c23","year":2021},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:52.959493Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:8653c3b1df8e6618a7b76e256c51a3a72a9d0d8fa3748237fbf8da9a4687b05e","observation_id":"f0aa382e-e0ea-4f29-ae8c-83008e5ca69f","resolution":{"observed_at":"2026-08-05T10:44:55.118583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:53.041454Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.041454Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:47019ba99eb1bc954f441a5eaa5a0146150b3ec226ab1824be281a6b2ffb70db","observation_id":"aaaba82b-867b-4c85-b801-27dd68042aba","resolution":{"observed_at":"2026-08-05T10:44:53.041454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.101162Z","title":"Noisy networks for exploration","venue":null,"work_id":"d9a70287-4127-4209-8ea3-9e2748d26f14","year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.132640Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:0e21567c6b24c22077439733a30e697ddf1ae5a2c68769bc12531dbd113c7e2e","observation_id":"afc6dc41-07a0-4496-b6a2-2c87a0fa9bb8","resolution":{"observed_at":"2026-08-05T10:44:55.104002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.091431Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":"fef63524-88bd-4cee-89c4-63edb16f9b45","year":2016},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.194608Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:333d0ec466ff05fb060ba1724667163b74c2707408efae628d7a882cb28da257","observation_id":"1619a5b7-eaac-42a8-8be2-a25d489cc1f1","resolution":{"observed_at":"2026-08-05T10:44:55.095467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.082478Z","title":"Selective classification for deep neural networks","venue":null,"work_id":"60dc4c1c-151a-4a03-9e19-92e2218ca4ed","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.281430Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:c0464f9f2820bf356f328efe1a51299933e576eddbc0119223fa26c54b1e1fb5","observation_id":"d7bc2470-cfb9-499f-9753-e8749512931b","resolution":{"observed_at":"2026-08-05T10:44:55.085517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:53.379016Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.379016Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:3aa65d96ec279ddba907e52f3b9d5e0162bbb2fe6c2dfcd87f2e55d595d87e3a","observation_id":"03094c25-fcb9-4b68-b94b-2ef3f03b2173","resolution":{"observed_at":"2026-08-05T10:44:53.379016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.067883Z","title":"Is q-learning provably efficient? In Advances in neural information processing systems, pp.\\ 4863--4873, 2018","venue":null,"work_id":"4b21f544-42f8-4c3e-a94e-e4b4c82829d5","year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.480019Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:064e0f009746c2be40b5314387d8799074811a4fe9c9d5c2283041380f784e72","observation_id":"98af3b9e-f8cd-4b61-bdf2-349074980d2a","resolution":{"observed_at":"2026-08-05T10:44:55.070834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.059524Z","title":"Matrix factorization techniques for recommender systems","venue":null,"work_id":"944e5a3a-a1e4-41cf-9e32-1592b3f6ca8d","year":2009},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.534264Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:04983ae2bb76adf5a42c16a7610bc22c87bcbeaeb86bb2e2cd1ba9324f4b0ffe","observation_id":"161eb1fa-2536-4cf1-8004-ad1a8d9848e0","resolution":{"observed_at":"2026-08-05T10:44:55.062320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.051070Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"7c596c0f-c4d9-4698-a98c-d740b266b616","year":2020},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.636560Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:3cc695f2cfe4d67e57ecdbc626edf0dc85b6fd7f3593209be462b7bc1cb298ca","observation_id":"eb03162a-62cb-42da-bf91-e4f1020b33aa","resolution":{"observed_at":"2026-08-05T10:44:55.053993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.041900Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":"7350daeb-ca50-497e-833d-2cbf7bcacb5b","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.715694Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:d0153d9271d8730af40f4294d1cd9b4e1ff4c744e71bf15abcfbb3bde6ba0c0f","observation_id":"43ced941-8322-4021-9a20-e84a67a1cbe3","resolution":{"observed_at":"2026-08-05T10:44:55.045162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.033261Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"0d1cecf1-f55e-472c-a899-52fef366f6ce","year":2020},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.789392Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:1c64bb000a055dfb83ae08eb0972e0e4c76318df16dcbeab13ca52b1a18ebec4","observation_id":"16c21fbb-d790-4386-9fc3-af3263007b84","resolution":{"observed_at":"2026-08-05T10:44:55.036236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-10T22:22:50.566276Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T10:44:53.792642Z","title":"Scalable agent alignment via reward modeling: A research direction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.792642Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:35b3fed5921c174790148c6f1902cfd8f6ec8975ecbbfa2bf332bd7992b30218","observation_id":"a6500af1-ac20-43ba-9e3a-d7c9f5d72e2d","resolution":{"observed_at":"2026-08-05T10:44:53.792642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.024432Z","title":"Neural matrix completion","venue":null,"work_id":"87f73c43-e025-49ca-9136-bceb3f20490f","year":2019},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:53.889065Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:631a5a3991ee453837e5a0a38311417a9a05dd7b9e5a9140354a73d95054876b","observation_id":"40281e58-e21a-4ff1-86ef-76e86a90ce06","resolution":{"observed_at":"2026-08-05T10:44:55.027369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.015726Z","title":"Geometric deep learning on graphs and manifolds using mixture model cnns","venue":null,"work_id":"f4f51ba7-0b8d-44a4-880d-c269e840d0d5","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.055402Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:f9d563994e9a814a8b54e5ee53f1757c904e88ac47a712b40ee978ef40faa64b","observation_id":"09903806-2fce-41d7-b808-a7b77862400f","resolution":{"observed_at":"2026-08-05T10:44:55.018642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:55.006521Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"40e27b8b-e37c-4f43-b27a-82aa9ff45016","year":2016},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.208262Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:50ed0c25499cb1f3ccd7aa18e10aba5b327e9a5932c61ac066954ddd96dfa95a","observation_id":"901aa83e-fcd5-412d-8bdf-e243c7a462b9","resolution":{"observed_at":"2026-08-05T10:44:55.009710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.996294Z","title":"Can you trust your model's uncertainty? evaluating predictive uncertainty under dataset shift","venue":null,"work_id":"1faad777-9053-45b0-bd4c-2b2c7ec3b830","year":2019},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.312502Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:2282771430bb7a048ddf2c9aa433e5ebd55a9ff7082ee243dac2ada47f3fcebf","observation_id":"fe316ec4-b673-40b1-ae81-5c589c899ef7","resolution":{"observed_at":"2026-08-05T10:44:54.999869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.987488Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"c6ed7cf6-b521-44cc-9a9b-90d9f833794c","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.385774Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:dcb1c5c15edcc549ec548d66d4a3b8732143df242a159ab43cf5d21b2c565253","observation_id":"0e3e6819-4644-4f1d-9452-60fa13104529","resolution":{"observed_at":"2026-08-05T10:44:54.990463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.978551Z","title":"Parameter space noise for exploration","venue":null,"work_id":"9b89d0dd-b320-4d4a-8b06-1eda93bc3999","year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.417351Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:33030e0fdbff29d7ca4af157c4961c1acef294b2f0075ea6035bda274b2235e1","observation_id":"acf8debe-5075-42bf-a458-1e517b75ad7a","resolution":{"observed_at":"2026-08-05T10:44:54.981592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.969222Z","title":"Masked autoencoder for distribution estimation","venue":null,"work_id":"cef72e95-9a9b-4a75-979b-61a1c829feb6","year":2022},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.496293Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:a535bb99278d6c61c2993cb0f5af81103cda85eb2c8f580c22cf77c92569bf41","observation_id":"985c2629-4ab6-4b0c-b3b4-52e30df5612d","resolution":{"observed_at":"2026-08-05T10:44:54.972501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.960152Z","title":"Guaranteed minimum-rank solutions of linear matrix equations via nuclear norm minimization","venue":null,"work_id":"d097f6e0-a36f-4628-ad15-8d40dbf624b7","year":2010},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.601050Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:6fea518b7e60f4165e54a9bff75d9af8ee3d5270565d778b04635464e32d3d42","observation_id":"9083b7cc-a066-4c2e-8367-bfc5ded1f278","resolution":{"observed_at":"2026-08-05T10:44:54.963174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.675256Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.675256Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:8ca327affaf9b852f2329c69e569daf0b9ccdfcd88971c1faed70de41e39d446","observation_id":"89579e03-7ccf-4f6e-a2b9-df2071873aad","resolution":{"observed_at":"2026-08-05T10:44:54.675256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.945335Z","title":"Data-efficient reinforcement learning with self-predictive representations","venue":null,"work_id":"bbeb892c-4e32-464d-afcd-7eefa12edc77","year":2021},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.735953Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:f03e1e284410c8f5327d2739670a082e9a277da7ad68779ce8fb262e367b738b","observation_id":"1dca62d0-f10e-4bc4-8c1e-e2d13433cc9d","resolution":{"observed_at":"2026-08-05T10:44:54.948517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.830629Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.830629Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:5581e67a019e8f50f2004b6a2305fd1b393b7af0b71a046c44a997811d6a0fd1","observation_id":"8c7ccabb-c7f3-4823-aa57-a4b1195d84a8","resolution":{"observed_at":"2026-08-05T10:44:54.830629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.930340Z","title":"Exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"9c8587a2-e217-4215-9d3d-890d0bcd0723","year":2017},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.835503Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:60304078aa607f8a5a5ee2133372836216c94ac3cd77d011620f13763289e18f","observation_id":"43f400f5-e024-464a-9b4d-fd9debc92ffa","resolution":{"observed_at":"2026-08-05T10:44:54.933307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.919472Z","title":"Transfer learning for reinforcement learning domains: A survey","venue":null,"work_id":"f981fc94-7962-4d87-a465-549b5410678f","year":2009},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.839418Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:9179d5d17c77aa7cf9ffceb210159835f587e451513d6022259fb9f75c13bbb6","observation_id":"4f56905c-49bf-460b-8e38-eb1a7a03e5f1","resolution":{"observed_at":"2026-08-05T10:44:54.924008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.842224Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.842224Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:68839f5dfd8cbfafd521d2e8cd3c89e73c50c99c35ef0b171f9df585db16b9da","observation_id":"c27b9540-0d10-4109-8f8f-536f44434b33","resolution":{"observed_at":"2026-08-05T10:44:54.842224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.845037Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.845037Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:ae361ecfc057a8258e42fcefcf10dd718d3d4f546f0c959b7c3b4f1aa2cdeeab","observation_id":"525ab8c6-cf31-4f25-bc24-086a54a256ec","resolution":{"observed_at":"2026-08-05T10:44:54.845037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.848547Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.848547Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:33a9444117aa200345fc58cf3212841e6ce98f2d421146910722cff00f63f863","observation_id":"ac162a1f-52de-4eaa-bb25-60b328146859","resolution":{"observed_at":"2026-08-05T10:44:54.848547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.851648Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.851648Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:280827c5f6cbfdfeb31393f9614b1dda6d0625d21f1ab55601b079d5537511ef","observation_id":"ecec5964-6001-4b04-97b5-b9bb7846175c","resolution":{"observed_at":"2026-08-05T10:44:54.851648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:44:54.854670Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T10:44:54.854670Z"},"links":{"citing_paper":"/paper/2509.03790"},"observation_digest":"sha256:3ba54d29604a967533ae6351b47960078107545902f6dc0f12a48b9a511a61c9","observation_id":"c1f775e4-5698-48a9-a160-9b82d0d3b6e5","resolution":{"observed_at":"2026-08-05T10:44:54.854670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03790","last_updated":"2025-09-09T02:53:54Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:23:50.195977Z","submitted_at":"2025-09-04T00:53:02Z","title":"What Fundamental Structure in Reward Functions Enables Efficient Sparse-Reward Learning?"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2509.03790."}