{"as_of":"2026-08-05T02:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32b8ab56a2948ca4f654dcfd65160d4b58e0b51da5a22d22cc7f61c5cce15f4f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:39:32.069321Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T19:06:08.995943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1906.09205","last_updated":"2019-06-21T15:44:41Z","snapshot_observed_at":"2026-07-29T14:50:16.065925Z","submitted_at":"2019-06-21T15:44:41Z","title":"Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T19:05:13.780087Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1906.09205"},"observation_digest":"sha256:aca3cb6c2ddbb5f0d6d302ab8a517eb62993952307bf8efc477a0000f1fccff9","observation_id":"14e92d04-108f-4fd2-a2a6-f4964f1f82a5","resolution":{"observed_at":"2026-05-25T19:06:08.999190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1906.09237","last_updated":"2019-06-24T15:36:55Z","snapshot_observed_at":"2026-07-06T08:01:59.671409Z","submitted_at":"2019-06-21T16:54:42Z","title":"Shaping Belief States with Generative Environment Models for RL","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T18:56:19.459447Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1906.09237"},"observation_digest":"sha256:83f3b6ad82e7a162b34c492b03e6e0dbefb83f64f835376d7e381cb53644c949","observation_id":"517d1d1e-4190-4c07-a335-bb31cf6a7801","resolution":{"observed_at":"2026-05-25T18:57:06.846491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1906.09510","last_updated":"2019-06-22T21:40:03Z","snapshot_observed_at":"2026-08-01T15:40:51.856292Z","submitted_at":"2019-06-22T21:40:03Z","title":"Learning Belief Representations for Imitation Learning in POMDPs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T17:54:12.840437Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1906.09510"},"observation_digest":"sha256:ba5ccdc2839a4416d5b90940af4561cb6b6dea53b837bbc5ed8524c887a3c730","observation_id":"e3b90c70-0a11-426c-8aac-9df65f5d3079","resolution":{"observed_at":"2026-05-25T17:56:06.715210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1906.11951","last_updated":"2019-06-27T20:38:47Z","snapshot_observed_at":"2026-07-06T08:03:27.295594Z","submitted_at":"2019-06-27T20:38:47Z","title":"Supervise Thyself: Examining Self-Supervised Representations in Interactive Environments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-25T14:31:31.260885Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1906.11951"},"observation_digest":"sha256:bf894c886f21781498d8d8df3eb2f37e3be4f1ce761d900db7f823b5adfb5ed4","observation_id":"bd93b13b-0456-4e43-a530-30037837c8d5","resolution":{"observed_at":"2026-05-25T14:35:57.379110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1907.11770","last_updated":"2019-07-26T19:45:23Z","snapshot_observed_at":"2026-07-06T08:10:34.301657Z","submitted_at":"2019-07-26T19:45:23Z","title":"To Learn or Not to Learn: Analyzing the Role of Learning for Navigation in Virtual Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T15:25:38.583850Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1907.11770"},"observation_digest":"sha256:76a0bfbccc9285a676a7f83e0a6e71c01161ccca4f150823667ed5571d3f9eef","observation_id":"775dfe4c-c8fc-4153-8d4d-82d6f7450e9d","resolution":{"observed_at":"2026-05-24T15:26:14.457991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1911.08265","last_updated":"2020-02-21T18:05:30Z","snapshot_observed_at":"2026-07-06T08:38:07.984092Z","submitted_at":"2019-11-19T13:58:52Z","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T23:57:02.653534Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1911.08265"},"observation_digest":"sha256:a046af5fe2315eaf7ca6e051c59a8ade9ff0f8184d7399fc9e31c8cfa6688311","observation_id":"c6802c97-daf4-4b12-9d7e-9a0ff4941d5d","resolution":{"observed_at":"2026-05-16T23:57:02.713011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:36.399272Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/1912.01603"},"observation_digest":"sha256:3864d85eecae952e5f2e521dd3ab919123bdae822a611c3c19ce7bcfee733a6e","observation_id":"49cb5872-2991-401c-a29a-11d762934e06","resolution":{"observed_at":"2026-05-12T01:16:36.511720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T09:08:21.677362Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2301.04104"},"observation_digest":"sha256:9135a9c0ff02454392fdc1ec32e05f85f26a7505da0a4b17a111dc202e92b42c","observation_id":"c2d5b451-7c76-412d-b732-bd000dfd64d1","resolution":{"observed_at":"2026-05-11T09:08:22.501186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-02T23:46:56.509336Z","title":"M., Schaul, T., Leibo, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12753","last_updated":"2026-06-11T11:35:13Z","snapshot_observed_at":"2026-08-02T23:46:44.311642Z","submitted_at":"2026-02-13T09:32:26Z","title":"Hierarchical Successor Representation for Robust Transfer","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T23:46:56.509336Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2602.12753"},"observation_digest":"sha256:689f3fe74137690f46686f743f0b72dd1234508ae9ab35ac999846888f5c3596","observation_id":"cbf16847-a4e2-4bc1-a597-2b1efb5174f8","resolution":{"observed_at":"2026-08-02T23:46:56.509336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2604.02391","last_updated":"2026-04-02T07:26:46Z","snapshot_observed_at":"2026-07-06T22:51:48.992363Z","submitted_at":"2026-04-02T07:26:46Z","title":"Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T21:08:00.495956Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2604.02391"},"observation_digest":"sha256:f1d97a5dd0ee2d0e5910ebbcf9f35e8794641842528ba2e46d08ac807a335c15","observation_id":"dc2f41c3-69d3-4b2a-8f8f-63ef9d1ff257","resolution":{"observed_at":"2026-05-13T21:08:17.065113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2604.03189","last_updated":"2026-04-03T17:05:45Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T17:05:45Z","title":"Reflective Context Learning: Studying the Optimization Primitives of Context Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:29:13.761153Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2604.03189"},"observation_digest":"sha256:47ed7af0ad403e73edc66d23f860b4722c032f2dfa9de18935a5c1a4a4179345","observation_id":"7aff776e-1348-43dc-a87f-98a81b38dd9f","resolution":{"observed_at":"2026-05-13T20:33:17.004130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2604.24532","last_updated":"2026-04-27T14:32:44Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:32:44Z","title":"A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:04:19.891421Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2604.24532"},"observation_digest":"sha256:8a0d7e4fc490862dc2e53ce6ee5ea4b8204397ec15faacc132fbdbfc6b85d78c","observation_id":"eb595bab-a188-4494-a781-5cd0db995f48","resolution":{"observed_at":"2026-05-11T21:51:29.695769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2605.03413","last_updated":"2026-06-04T13:19:41Z","snapshot_observed_at":"2026-08-02T19:38:13.010561Z","submitted_at":"2026-05-05T06:39:12Z","title":"Learning to Theorize the World from Observation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-07T17:15:43.429602Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2605.03413"},"observation_digest":"sha256:9b2b137676112232e1bc2ba86a0b2da69edec8b4ae8f75ec13c72c54664a1b55","observation_id":"80e987fe-a219-4022-a0f3-c70591316c19","resolution":{"observed_at":"2026-05-11T23:21:33.077174Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":"1611.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","venue":"cs.LG","work_id":"8ac80d7b-b24c-4128-9798-b3a9b02ad56d","year":2016},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:3b030f690e7caaa1d36d56554def4e362157b88240926ad726a28f2cdaf57985","observation_id":"8eea4d83-7326-4c82-a23f-34cf9df350d7","resolution":{"observed_at":"2026-05-25T05:00:21.601916Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-02T07:20:40.802032Z","title":"Jaderberg et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11953","last_updated":"2026-07-15T13:05:53Z","snapshot_observed_at":"2026-08-04T04:19:39.910810Z","submitted_at":"2026-07-11T21:33:32Z","title":"When Does Reward Teach State? A Hidden-Automaton Instrument and the Group-Language Boundary","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:40.802032Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.11953"},"observation_digest":"sha256:b8673da97257a8911eb73fcea915df201b5562d20e9a210286e99e7d9b4f4c1b","observation_id":"30a8ef44-1c82-405a-ab56-d557f2d2ea0d","resolution":{"observed_at":"2026-08-02T07:20:40.802032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-01T16:26:17.956351Z","title":"arXiv preprint arXiv:1611.05397 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18004","last_updated":"2026-07-20T14:36:11Z","snapshot_observed_at":"2026-08-03T05:55:38.808505Z","submitted_at":"2026-07-20T14:36:11Z","title":"PAMD: Structured Adaptive Distances for Bisimulation Representations in Visual Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T16:26:17.956351Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.18004"},"observation_digest":"sha256:f82438fff1e979d15bfe4b294c57203b9ef725954f093af4c2ba9f407b6ae795","observation_id":"c47536ad-d400-4540-b82a-cb11a388130e","resolution":{"observed_at":"2026-08-01T16:26:17.956351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-07-31T21:44:39.625477Z","title":"Reinforcement learning with unsupervised auxiliary tasks.arXiv preprint arXiv:1611.05397, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.625477Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:3b661faada64a6a205ec070bee605348ff19a7dbcd8ba5fb765c0adcf68e45e6","observation_id":"c7e4a8bd-41a0-4f7a-87c1-794798b2141c","resolution":{"observed_at":"2026-07-31T21:44:39.625477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-08-03T04:39:32.069321Z","title":"and Silver, David and Kavukcuoglu, Koray , month = nov, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-05T02:16:52.292163Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.069321Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:1093a3e5290064ea9174c542cdb57c1cf0f87379c88ced300e77c2fa71892514","observation_id":"8024fd77-6ac0-4172-b553-47579b855246","resolution":{"observed_at":"2026-08-03T04:39:32.069321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1611.05397/citation-record","integrity":"/paper/1611.05397/integrity","json":"/paper/1611.05397/citation-record.json","paper":"/paper/1611.05397"},"outbound":[],"paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:1611.05397."}