{"as_of":"2026-08-12T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2e464a9936fbc1d0239a6ccbfe2f238e344510d21618ef0af8c8549cca95e63","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:00:57.747243Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00985/citation-record","integrity":"/paper/2412.00985/integrity","json":"/paper/2412.00985/citation-record.json","paper":"/paper/2412.00985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.378425Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.378425Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:26889c822e1bb086c07c37f3d83f6418dffe3b0e3fec40a61f17de468f66b258","observation_id":"e7163470-73cd-472d-b4a6-f1ebc205c09e","resolution":{"observed_at":"2026-08-12T05:00:57.378425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.383149Z","title":"Learning dex- terous in-hand manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.383149Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:8cf32fd6ab3921805ac6dc68b28a02286b5e080375c789feb06d419460fdab43","observation_id":"5cbeeea6-e844-492d-99e6-5820f41ad289","resolution":{"observed_at":"2026-08-12T05:00:57.383149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-03T05:49:14.071341Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-12T05:00:57.387345Z","title":"Safe, multi-agent, reinforcement learning for autonomous driving","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.387345Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b056a17b3170b77032817b3b54c841ef71305b88b8dfa80dcc7692bc40c80a39","observation_id":"1dd38f47-686d-40a7-a6b4-632b05f0de02","resolution":{"observed_at":"2026-08-12T05:00:57.387345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.392093Z","title":"Deep reinforcement learning for autonomous driving: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.392093Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:733dbe8566de94e480104c17cae6736e7ca735e4e31b4b7336c4780c87fcbac4","observation_id":"ea9f9c37-b818-4012-99d4-d365c7d89a29","resolution":{"observed_at":"2026-08-12T05:00:57.392093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.396226Z","title":"Pomdp-based statistical spoken dialog systems: A review","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.396226Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:adc7960aa3a8fb68b21d0a24bd4ddb2489809db3bc22fc5b7e383819ff9329f2","observation_id":"6cd51fa3-3e5b-4ea3-b2a2-72417c621d80","resolution":{"observed_at":"2026-08-12T05:00:57.396226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.400361Z","title":"Informing sequential clinical decision-making through reinforcement learning: an empirical study","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.400361Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:4772d06b05afd65af6af72ae9898a9fbb6eaab895d711be01be8d527ba1e9b4e","observation_id":"c90bb442-a7bd-4b7e-8cb8-45907d5e3881","resolution":{"observed_at":"2026-08-12T05:00:57.400361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.404638Z","title":"The complexity of markov decision processes","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.404638Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c9a61c468249386badbd0e0f515b5754f15e3e97481df76016ab6c2732e3ea3c","observation_id":"a70d1743-7a2a-4167-b3e5-3c6ae7eb9f07","resolution":{"observed_at":"2026-08-12T05:00:57.404638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.408509Z","title":"Pac reinforcement learning with rich observations","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.408509Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f19ea82daceb1a4c969dfb5e2b39617c0117fe24e1c7dbefc0dce90fcf1df0ba","observation_id":"23b1aab0-39eb-4063-bc2a-0f7b5c539fe7","resolution":{"observed_at":"2026-08-12T05:00:57.408509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.412288Z","title":"Sample-e fficient reinforce- ment learning of undercomplete POMDPs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.412288Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:52fa3161b9498f0205e67daeedcb1e97ff2b6f1d793dddd4d30a846f09e64f24","observation_id":"6edf07d0-4530-4dc5-9c96-d945087cfccc","resolution":{"observed_at":"2026-08-12T05:00:57.412288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.416105Z","title":"A counterexample in stochastic optimum control","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.416105Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:588798c43d5973f5ee285622fad43c8ab6e736e47de4cf2640ec20ff14163f43","observation_id":"35341c44-0538-44a0-ad0d-25693ee815aa","resolution":{"observed_at":"2026-08-12T05:00:57.416105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.419988Z","title":"On the complexity of decentralized decision making and detection problems","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.419988Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:189edae2f90490625d5610f9f80419d8187c87bd2c0315f9419fbbe91a92d489","observation_id":"85cdf6c5-84e0-402f-add6-a0d965b262bd","resolution":{"observed_at":"2026-08-12T05:00:57.419988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.424233Z","title":"Multi- agent actor-critic for mixed cooperative-competitive environments.Advances in Neural Informa- tion Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.424233Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:db3ae0bbbebd320e8fe07336c87d60b3ac77e0d7f32a52c6460ae667d0849a85","observation_id":"0e9392e0-05ed-48ab-a20b-8989b49afb6f","resolution":{"observed_at":"2026-08-12T05:00:57.424233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.428099Z","title":"QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.428099Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6eaa1f7ebe9b13021a9a7cbb5743e58223dcbb142377fb711267049441630fd8","observation_id":"4f837fb5-a935-4d6e-b68f-d7ec928e50b6","resolution":{"observed_at":"2026-08-12T05:00:57.428099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.431857Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.431857Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:8e9a163c935f812b8fa3f1f2b4fb832406b3b79fcb56c26af4420231259e6596","observation_id":"0b6db165-42da-4fcc-b2dc-b38653b2e6c9","resolution":{"observed_at":"2026-08-12T05:00:57.431857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.435449Z","title":"Grandmas- ter level in StarCraft II using multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.435449Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e1bda790f9643245a28ba6e3a6fbf1e17f6cbcc09998b9ea5bb5754e07cec628","observation_id":"4ae1370d-cfe2-4e80-9d80-3e49b8411cd9","resolution":{"observed_at":"2026-08-12T05:00:57.435449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.439379Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.439379Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6ae9da66ca4859372fe9e2a0bc3c012c4d647ac2d0c2c1730bb00869295d3256","observation_id":"209f5775-dff3-4ee1-8fbc-63ef7fd0f64c","resolution":{"observed_at":"2026-08-12T05:00:57.439379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.873770Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":"dd492ce6-fba9-4c36-a483-219b8cc34edd","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.443169Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e6907323a7a08c542a523df503f2f66b51bef949e946e3133712271c8a0b48f1","observation_id":"b086a5a3-43c3-4730-9c9c-83b87f90fc3f","resolution":{"observed_at":"2026-08-12T05:00:58.877864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.861515Z","title":"Learning by cheating","venue":null,"work_id":"b1ab5306-4ec6-4fe1-8b29-ea2159e101c3","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.446983Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:3168b8f58e1bfe52b2a5d039f1576a8eb698fc1add5e67198065191da0706b47","observation_id":"72e2ad17-e185-48ce-962d-7f900b515742","resolution":{"observed_at":"2026-08-12T05:00:58.865509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.849364Z","title":"Asymmetric actor critic for image-based robot learning","venue":null,"work_id":"10d07bf0-7e90-49f2-874f-9629dbadff2d","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.450732Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:9dd1fc5a3d298da84afd905137df8a334f15e256ff122486eddb189a82c30784","observation_id":"f8827aa1-a12f-4b16-b09e-b5af8efc6b35","resolution":{"observed_at":"2026-08-12T05:00:58.853512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.837084Z","title":"Learning in pomdps is sample- efficient with hindsight observability","venue":null,"work_id":"211a1934-b1c5-4b05-b3ea-b2168cfdfc04","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.454380Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:90b458e2b642a45ba36bbcb66647dfc4f258271d7019cabaa431603eecf5668f","observation_id":"3dbd4a4d-4b10-4558-9917-3494ab24f717","resolution":{"observed_at":"2026-08-12T05:00:58.841243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.824314Z","title":"Sample- efficient learning of pomdps with multiple observations in hindsight","venue":null,"work_id":"64a9ae3f-22c4-44b1-9835-e7d4f3a2215d","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.458190Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:264fee8cb146c7e1553c2fc093ce13730fe7666121b21a3a73a7a8738065b7d1","observation_id":"4833688b-eb7c-41d0-a7a8-da1d7b233706","resolution":{"observed_at":"2026-08-12T05:00:58.828703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.812003Z","title":"Learning in observable POMDPs, without computationally intractable oracles","venue":null,"work_id":"e2bc1d64-365e-48cf-8175-664bb8314a95","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.461960Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:dcba1525e68db56011e03489cef851158e61ceaff096fb00a8e2952de3c819ee","observation_id":"afb14ff5-9add-461f-830f-dd4432bae525","resolution":{"observed_at":"2026-08-12T05:00:58.815988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.799423Z","title":"On oracle-e fficient pac rl with rich observations","venue":null,"work_id":"cdb5cde7-36f1-4c11-9322-7a8f68bf401b","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.465780Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f12dadec69f351d9e988caea5452614576cd3288590b00eb5c4d5a38ba9751dc","observation_id":"6b6818fe-b22c-491d-854c-f95eb52a8bed","resolution":{"observed_at":"2026-08-12T05:00:58.803818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.787422Z","title":"Provably e fficient rl with rich observations via latent state decoding","venue":null,"work_id":"7ae075b0-e4df-4d69-9a0c-9191e0dd7ff9","year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.469539Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7184d886bfe13aafb46141e95833027853f59911bc127e8992f691b55464ce79","observation_id":"47c406f7-1a2d-4fae-afdd-5786d14ebff9","resolution":{"observed_at":"2026-08-12T05:00:58.791388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.775235Z","title":"Kinematic state abstraction and provably efficient rich-observation reinforcement learning","venue":null,"work_id":"1349ec6d-3da3-4975-bdca-386bc7f31443","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.474307Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6eea09cb547bb3daf63c43aab18ecc3a8e7d493815dc4d0910cfb4995a4ae5e7","observation_id":"cc6b3e90-541e-4674-8d86-9ce17c4e78f7","resolution":{"observed_at":"2026-08-12T05:00:58.779272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03774","last_updated":"2024-04-04T19:35:41Z","snapshot_observed_at":"2026-08-03T10:38:19.014431Z","submitted_at":"2024-04-04T19:35:41Z","title":"Exploration is Harder than Prediction: Cryptographically Separating Reinforcement Learning from Supervised Learning","version":1},"cited_work":{"arxiv_id":"2404.03774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03774","snapshot_observed_at":"2026-08-12T05:00:57.886042Z","title":"Exploration is Harder than Prediction: Cryptographically Separating Reinforcement Learning from Supervised Learning","venue":"cs.LG","work_id":"2125c8d5-5cdf-4b95-b3ec-2a390055106c","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.478097Z"},"links":{"cited_paper":"/paper/2404.03774","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:617fd06c8b33969a620980e0aa3b1d0b189c8d2691d967945401df6a41b3dd10","observation_id":"217b5634-c3f1-4990-989d-548706502368","resolution":{"observed_at":"2026-08-12T05:00:57.892712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.762623Z","title":"Provable reinforce- ment learning with a short-term memory","venue":null,"work_id":"eea7d424-2e76-42d7-aba3-ce5a9278e636","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.482113Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c980fd7ef07257de1d48c298434f3957b6e88b22dd47eaa6cf31570f2d587107","observation_id":"d6220eb8-cd38-4b8b-b43c-fb142e56c383","resolution":{"observed_at":"2026-08-12T05:00:58.766737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.750392Z","title":"When is partially observable rein- forcement learning not scary? In Conference on Learning Theory, pages 5175–5220, 2022","venue":null,"work_id":"bfd77d9b-82ed-441e-853a-63d1440e6f31","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.486135Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:add5bd94baa75d7ae76142c1febf17abd78325ff96f390e292e132c61db62c59","observation_id":"cd64147e-b6ea-4d4e-9728-8d54b405e90e","resolution":{"observed_at":"2026-08-12T05:00:58.754554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.737847Z","title":"Partially observable multi-agent RL with (quasi-)e fficiency: the blessing of information sharing","venue":null,"work_id":"aa8807ce-a31b-4d59-b110-02ca094684b2","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.489987Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b8649f9cc3de0cd81bd0350bd2de6b4f22e864370f48a2f72773ff3c87d27cb1","observation_id":"737e6c1e-7190-412b-909f-d6d980fe8e94","resolution":{"observed_at":"2026-08-12T05:00:58.742068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.725574Z","title":"Schapire","venue":null,"work_id":"530ca053-0cb6-47de-a2a7-3368ff21eaa1","year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.493807Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5f804ce037efe2fe4ac5d96fb9548bcb11c4036a8e66ff9881428fd96b984ec6","observation_id":"c383ef95-b6ce-471b-b251-94451ae6aab7","resolution":{"observed_at":"2026-08-12T05:00:58.729516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.713240Z","title":"Represent to control partially ob- served systems: Representation learning with provable sample efficiency","venue":null,"work_id":"e4658313-0521-40b9-a9e2-36c6f5e0d296","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.497654Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:41f6d2193275946177382cdb2b4d415b31327f816fbf03d35260ff943682c6dc","observation_id":"48aa0392-b631-4fd2-89ff-f49f5db7b751","resolution":{"observed_at":"2026-08-12T05:00:58.717368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.700702Z","title":"Partially observable RL with b-stability: Unified structural condition and sharp sample-e fficient algorithms","venue":null,"work_id":"1ebb5f69-9f37-4994-8d24-21b0eb2e9891","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.501395Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:4d59b6a281f7f0c762d16c941ce25a5a68497cad259b6d42717f818e33885300","observation_id":"e2754bc8-d010-4a96-be31-39ae8a9d93a3","resolution":{"observed_at":"2026-08-12T05:00:58.705076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.688129Z","title":"Reinforcement learning from partial observation: Linear function approximation with provable sample e fficiency","venue":null,"work_id":"89011c9d-ab55-4db1-bc2d-e2e07cf74f56","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.505120Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:222c781fa9aa2209343877c5410e457baf6ae777e142bb2d11265afdd72b0e2f","observation_id":"af9dad91-3fc7-48d2-89f3-f5753195c22f","resolution":{"observed_at":"2026-08-12T05:00:58.692309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.675758Z","title":"Pessimism in the face of confounders: Provably efficient offline reinforcement learning in partially observable markov decision pro- cesses","venue":null,"work_id":"27be56ed-b9e4-4e1d-836d-d4231fc8c6a7","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.509825Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:10d679db03557c35d1335295b7b4c4ac170078dc0cc8417c0ee89221e14f09d0","observation_id":"b66ce82c-c450-40e6-93c4-2050fb6e6a4f","resolution":{"observed_at":"2026-08-12T05:00:58.679947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.663214Z","title":"Optimistic MLE: A generic model-based algorithm for partially observable sequential decision making","venue":null,"work_id":"7e202926-5005-4b25-99fd-2d9a12b4be09","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.513652Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:5ccc7e43db60c20dedee9ed1b0e9288c6f6cd529b0c0a56a029d442e154092fb","observation_id":"aec8ff2d-a16a-497f-9e24-2e5ac3d3718c","resolution":{"observed_at":"2026-08-12T05:00:58.667308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.650704Z","title":null,"venue":null,"work_id":"00467bcc-9d05-417e-a0f9-1c374dc72e7a","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.517747Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7c6a7769511f87feed58bb13f1bff320ccc04a70e20599b3bd311df773b5a126","observation_id":"86df68e4-ed4d-4a4f-8aa1-6c371f8fe8fd","resolution":{"observed_at":"2026-08-12T05:00:58.655043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.638439Z","title":"Partially observable multi-agent reinforcement learning with information sharing, 2024","venue":null,"work_id":"abc6ca77-b80e-4c78-bdb5-93ec13f3685f","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.521399Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:271bcc439b7cb45f612c77aa80e0b596ff33962853a5ae7cb385de957946e9a1","observation_id":"72599437-b993-4eb5-a50e-1f38ec65ac56","resolution":{"observed_at":"2026-08-12T05:00:58.642424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04735","last_updated":"2022-03-23T15:26:15Z","snapshot_observed_at":"2026-07-06T12:26:55.386214Z","submitted_at":"2022-01-12T23:16:37Z","title":"Planning in Observable POMDPs in Quasipolynomial Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.04735","snapshot_observed_at":"2026-08-12T05:00:57.525271Z","title":"Planning in observable pomdps in quasipolynomial time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.525271Z"},"links":{"cited_paper":"/paper/2201.04735","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:501d72da02f28f3797b9e46721b8f2f17aeca27251ebae9a1ba3da582e31bfde","observation_id":"105fcce5-289a-46c5-bcf2-969200142602","resolution":{"observed_at":"2026-08-12T05:00:57.525271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.625865Z","title":"Planning and learning in partially observ- able systems via filter stability","venue":null,"work_id":"ea744b54-bcc3-46f8-af0f-6e31b80b51f1","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.529316Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d97d172428d1098ea1df16d4ad3f2172fd8f7f66bf5f73ab2898eca1a9dc8f82","observation_id":"8cb4df1d-8d25-4114-9ec0-02605981450a","resolution":{"observed_at":"2026-08-12T05:00:58.629812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.613631Z","title":"Theoretical hardness and tractability of pomdps in rl with partial online state information, 2024","venue":null,"work_id":"1db1d65f-eb91-48a9-a2ab-5e9b7bed3a7d","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.533144Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:98d6cc08cc637b1ceb42f9596ee945bae8a3bfde3e30448a90314263b2b378b6","observation_id":"4b795815-13fc-490f-a582-00a8188a81bd","resolution":{"observed_at":"2026-08-12T05:00:58.617712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.601064Z","title":"Leveraging fully observable policies for learning under partial observability","venue":null,"work_id":"75817724-0847-43b6-8203-51397eb00e7d","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.536883Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ed73f4025f32a35f9dba588524d5a3858d243b2887a14857250863bea19ee562","observation_id":"311d25fe-b0d2-4841-a9de-df18d7812141","resolution":{"observed_at":"2026-08-12T05:00:58.605312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.588865Z","title":"Learning to jump from pixels","venue":null,"work_id":"dfb90cab-df00-4845-8201-6b4e50056145","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.540594Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ea403eb5b0df75a5e1b3942f1d3c7d1a99124139b08c3a3ebf492d646d771fca","observation_id":"8343e49c-fd3a-448d-994e-3cd4802dda99","resolution":{"observed_at":"2026-08-12T05:00:58.593020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.576821Z","title":"Tgrl: An algorithm for teacher guided reinforcement learning","venue":null,"work_id":"2237ba2c-2c6f-4763-a49d-eb39d2569b5b","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.544380Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:766e90f51d6c1eb7fbe2f18a6dbd84a313be82c224819d188bbb29767de5175c","observation_id":"dca28fe8-bbb3-4f3e-9302-f672302aeb71","resolution":{"observed_at":"2026-08-12T05:00:58.580773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.564216Z","title":"Asymmetric DQN for partially observable reinforcement learning","venue":null,"work_id":"8751bf27-dbca-4bff-8b5e-dbe23fcb4f3e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.548314Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:724573af1c841151d2c7fb0d27b89b03ec2449bce93fcf9cd3a624cd53312dbf","observation_id":"27473edb-659a-4496-8580-a62aae1ad57c","resolution":{"observed_at":"2026-08-12T05:00:58.568365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.552139Z","title":"Perfectdou: Dominating doudizhu with perfect information distillation.Advances in Neural Information Processing Systems, 35:34954–34965, 2022","venue":null,"work_id":"7e81fbd5-8a6b-4213-850c-02c316d5b28e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.552052Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:94eff338388fc2949103d8b7e92770b6df23aae609ca0480906b934ee6befc78","observation_id":"73818330-0008-423b-82cd-5428279c758f","resolution":{"observed_at":"2026-08-12T05:00:58.556140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.539712Z","title":"Towards unifying behavioral and response diversity for open-ended learn- ing in zero-sum games","venue":null,"work_id":"00d99746-a828-4278-a958-8b641ab887b7","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.555842Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:929c57a029c0e171b567704ab82b5cb4f106266dff2a8cdc0df9e3256a2c791d","observation_id":"86c05e3a-ba6c-4130-ad4c-fc2068feb608","resolution":{"observed_at":"2026-08-12T05:00:58.544002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.527129Z","title":"Unbiased asymmetric reinforcement learning under partial observability","venue":null,"work_id":"fd02ed20-25cb-4a16-ab49-34558928116e","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.559621Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:758391ca417df3c30de1705bdf5427d4ead6f8155a5551440e0edfab9c045fe5","observation_id":"46cfd868-9448-4408-8a6d-965ecd08c15e","resolution":{"observed_at":"2026-08-12T05:00:58.531166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.514715Z","title":"A deeper understanding of state-based critics in multi-agent reinforcement learning","venue":null,"work_id":"2b7f2050-b446-41fd-b732-23d6e6521d10","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.563346Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7563bfcd44da7a066aeb0fa1447d0fe8623705a6f50490d9ae451196827f1cd7","observation_id":"d18c399a-2656-4fb1-9490-1eb289e362f7","resolution":{"observed_at":"2026-08-12T05:00:58.518806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.502163Z","title":"On cen- tralized critics in multi-agent reinforcement learning","venue":null,"work_id":"d4cada1a-f741-4ce8-8f0d-3328d4aa1c35","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.566988Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ace73f025cafc70d28e0abeb2bf9f83448161f25f5f9ded039829b59792a3d55","observation_id":"992bd910-ae36-4806-9b81-d38c65da0108","resolution":{"observed_at":"2026-08-12T05:00:58.506483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.489818Z","title":"Learning belief representations for partially observable deep rl","venue":null,"work_id":"bd58caa3-3d0d-46d5-ab29-c39c27263c0e","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.570730Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d0e02c5990b7c228c979a437dab89c06245cf49a73a527f743149d5f3e5e70b2","observation_id":"2e1a4770-5d02-4db9-b30e-1e7d478fe43c","resolution":{"observed_at":"2026-08-12T05:00:58.493910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.477496Z","title":"Learning belief representations for imitation learning in pomdps","venue":null,"work_id":"4ff9d778-e207-4155-9e2a-36c13ae50b12","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.575636Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:95d89d656e075ab76924d04dafeb2d0a6ed4cf3103004139e5a941cdc59faea7","observation_id":"c202d67a-d224-46c0-8f92-717a8020d41d","resolution":{"observed_at":"2026-08-12T05:00:58.481653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.465145Z","title":"Belief-grounded networks for accelerated robot learning under partial observability","venue":null,"work_id":"0a6b3b80-ed9f-4ab8-b07e-5e093dda7eae","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.579698Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:573ef7b5474cab867307ae3af79256a900c11bc61850e888d5959037c37f0885","observation_id":"bf86327d-f6bd-452b-95fd-7fd78af64a55","resolution":{"observed_at":"2026-08-12T05:00:58.469046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09086","last_updated":"2021-06-16T19:00:53Z","snapshot_observed_at":"2026-07-06T11:20:06.076373Z","submitted_at":"2021-06-16T19:00:53Z","title":"Learned Belief Search: Efficiently Improving Policies in Partially Observable Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09086","snapshot_observed_at":"2026-08-12T05:00:57.583507Z","title":"Learned belief search: Efficiently improving policies in partially observable settings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.583507Z"},"links":{"cited_paper":"/paper/2106.09086","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:52d68325b888741e759b526cd96d47d980b1e35f8acb0900840a9bc84726dd45","observation_id":"1b8675e2-1378-493b-9b45-0aae522d1133","resolution":{"observed_at":"2026-08-12T05:00:57.583507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.452576Z","title":"Flow-based recurrent belief state learning for pomdps","venue":null,"work_id":"8e8a00a1-0b34-438b-899c-f4a3b70dcd4c","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.587635Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:fe7d6f78c2fb701ddbb17adb5d714d4af5d4c59a615528b196a346417c373503","observation_id":"892cabc8-9d4a-43ba-b625-39329c5c8d51","resolution":{"observed_at":"2026-08-12T05:00:58.456809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.440463Z","title":"Belief state actor-critic algorithm from separation principle for POMDP","venue":null,"work_id":"bf781fa0-e90a-41d6-873a-05c053e675a5","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.591604Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:ebfd59858fbb5ebc81f78e162981e49a7d6c37d37889da32df71a79e1d982578","observation_id":"4084d94e-4e65-4da7-8968-b4cec9add4ab","resolution":{"observed_at":"2026-08-12T05:00:58.444516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.427789Z","title":"Neural belief states for partially observed domains","venue":null,"work_id":"a19267ce-95f5-444e-91b3-672fd21c5618","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.595393Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:fb612c1b0a621994718feae6a1425c93d68bc7a7a5d2fde5c819f34a25f41cf0","observation_id":"2882b484-5216-4df3-82a5-5405accbbe24","resolution":{"observed_at":"2026-08-12T05:00:58.432094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.415095Z","title":"The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models","venue":null,"work_id":"f68b9e3c-fa01-4a32-a200-e3d36b6b2968","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.599071Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:6dc2b6052ac8ffb599917cbf5b05ab64b2f0756a7ec933dcd70e07d457179dea","observation_id":"6691a7d0-4711-4ad8-b0b7-68895a1f9f99","resolution":{"observed_at":"2026-08-12T05:00:58.419475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.309408Z","title":"Common informa- tion based markov perfect equilibria for stochastic games with asymmetric information: Finite games","venue":null,"work_id":"6ffd6f9f-44ca-4f70-be67-1998f19ca400","year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.602837Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:2ff793adbfc643dc1abbc5863d904f7a19f8093aca01ff3431f9e195d664b79f","observation_id":"7f616ca9-4ad1-4b58-9440-50b8e78a14f2","resolution":{"observed_at":"2026-08-12T05:00:58.313480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.297188Z","title":"Decentralized stochastic con- trol with partial history sharing: A common information approach","venue":null,"work_id":"3d9acb7f-e873-4068-ae65-7b74d2c37b90","year":2013},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.606535Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c5ce81967429e8de570c22984de671a6969171dabb9d98846a93c476ea3bc965","observation_id":"af3b9a8a-b593-4bc1-812a-06b5c13054bd","resolution":{"observed_at":"2026-08-12T05:00:58.301288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.285098Z","title":"Sample-e fficient reinforcement learning of par- tially observable Markov games","venue":null,"work_id":"ca8545ce-df7d-446b-a5f1-97e07973d26f","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.610519Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:36c683102647856fe1490b82e2fe1716e6c52a0f2dc0e9e044ba82cfcb0c936b","observation_id":"cd4d198c-2a00-4d7f-a17b-ade838f12842","resolution":{"observed_at":"2026-08-12T05:00:58.289167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04184","last_updated":"2022-03-31T12:12:43Z","snapshot_observed_at":"2026-08-08T13:45:53.505063Z","submitted_at":"2021-10-08T15:06:22Z","title":"When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04184","snapshot_observed_at":"2026-08-12T05:00:57.614294Z","title":"When can we learn general-sum Markov games with a large number of players sample-efficiently? arXiv preprint arXiv:2110.04184, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.614294Z"},"links":{"cited_paper":"/paper/2110.04184","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:06649b25664cb66c225c43483fa581a8e26010fe9501b87e5ffa304f1fd160b2","observation_id":"4df6750a-8ad8-4153-98ff-fc5ce1da62c0","resolution":{"observed_at":"2026-08-12T05:00:57.614294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.271389Z","title":"A sharp analysis of model-based reinforce- ment learning with self-play","venue":null,"work_id":"268c94ef-8879-4b3e-bfd3-9825388b83e6","year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.618444Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7c5b9f3268c5f424c4bb7f4118bdc1e2c682586df46156a2e2cfb553e35639a5","observation_id":"6ec2666b-1ae8-49a4-bb75-441e8eb21da6","resolution":{"observed_at":"2026-08-12T05:00:58.275849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14555","last_updated":"2021-10-27T16:25:55Z","snapshot_observed_at":"2026-08-09T10:31:53.237354Z","submitted_at":"2021-10-27T16:25:55Z","title":"V-Learning -- A Simple, Efficient, Decentralized Algorithm for Multiagent RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14555","snapshot_observed_at":"2026-08-12T05:00:57.622093Z","title":"V-learning–a simple, efficient, decen- tralized algorithm for multiagent rl","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.622093Z"},"links":{"cited_paper":"/paper/2110.14555","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:edc6f3be8a19021d4aa714ecc0558381e3ebede98c9d50cf1a889ff91c8874a3","observation_id":"38b72e48-4179-4bd1-ad2b-17174936a734","resolution":{"observed_at":"2026-08-12T05:00:57.622093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.259388Z","title":"Algorithmic game theory","venue":null,"work_id":"bff6b6c8-1784-4064-97b0-c831ffa0f650","year":2010},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.626139Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7dee4f555d98e93e7aa285eb656a8eb194d164954bbd3fa49fd8634b7a26c3a9","observation_id":"b2b1acf5-a996-4570-8c66-3f65afcea8f3","resolution":{"observed_at":"2026-08-12T05:00:58.263260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.247258Z","title":"Kakade, and Yishay Mansour","venue":null,"work_id":"ff815fcc-7a53-45c3-9623-01dff93276fd","year":2007},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.629852Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:8f81be5d5f939ab082448a321fa2e2ea5e73b913318aed842c4387f02069d9d0","observation_id":"413df1b0-1e47-4182-8beb-ead88dbc369f","resolution":{"observed_at":"2026-08-12T05:00:58.251251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.234430Z","title":"Common information based markov perfect equilibria for linear-gaussian games with asymmetric information","venue":null,"work_id":"05cade9d-29f4-485d-a26a-71e6ec18ddeb","year":2014},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.633736Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:980996d4c7bebb484b7117e01e0cfccae6c18d4713c8c9a3548d4b84c61835ec","observation_id":"4a866159-e575-4a45-9ed7-802c1031900e","resolution":{"observed_at":"2026-08-12T05:00:58.238544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.221982Z","title":"Poste- rior sampling for competitive rl: Function approximation and partial observation","venue":null,"work_id":"51005925-e597-4316-8135-785de6576707","year":2024},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.637547Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:86299d1dce0e9d32fcf0225c9365f25775b4d3407a562741d852fb3bb2ea0087","observation_id":"cedc9884-654f-48df-a2a5-a4435ef11285","resolution":{"observed_at":"2026-08-12T05:00:58.226186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.209632Z","title":"Learning to communicate with deep multi-agent reinforcement learning","venue":null,"work_id":"eec66772-cdb6-48d3-9856-63d1d3a75691","year":2016},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.641729Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:7ebd2af933fcb95e4a5f77f18161b7c19281ce88a1a502e8f8d566b02a4223e5","observation_id":"fa8a4d42-0c85-45f8-aa69-ebeebc845115","resolution":{"observed_at":"2026-08-12T05:00:58.213731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.197111Z","title":"Computationally efficient pac rl in pomdps with latent determinism and conditional embeddings","venue":null,"work_id":"24ce4f1e-7a9c-45bc-b70a-4a91a796934a","year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.645575Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:8a7244471eb715c84ce12d2ab4c16a10392e49884dfcda9c44743a7f1c12fc7f","observation_id":"2231e7d5-4078-439a-8c17-b7b62cfe3929","resolution":{"observed_at":"2026-08-12T05:00:58.201238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.182408Z","title":"Actor-critic algorithms","venue":null,"work_id":"feb6e833-fa51-43d5-b95f-613afaadd631","year":2000},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.649339Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:8cd244db072813ab72050000273f5ad5bdc562bc5e3793f29661041039cddf99","observation_id":"e14c806f-8f65-42cf-9715-667326470196","resolution":{"observed_at":"2026-08-12T05:00:58.186967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.168813Z","title":"Provably e fficient exploration in policy optimization","venue":null,"work_id":"02e6305e-e598-469d-86cf-065e38c69967","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.653116Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:20055848adc85d0ea075c61fa54ab01d82d2fbffc69319d33a9fbb2dc6d0a5f0","observation_id":"82d5fc1e-41a3-4ca6-8134-d17fa4c918e2","resolution":{"observed_at":"2026-08-12T05:00:58.173029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.155357Z","title":"Optimistic policy optimization with bandit feedback","venue":null,"work_id":"55717c1f-437f-476b-bc55-ed26fb1eb7c1","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.657114Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:feaeaaeed4f21b6efe2308c2b580ec033c90b1510972852914d2da32b5c883f2","observation_id":"31f7914a-92bf-4466-a3a6-50437b3e9e20","resolution":{"observed_at":"2026-08-12T05:00:58.159754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T05:00:57.660877Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.660877Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:718ce0efff90cd9f150d4afd39bd58a056587046bfb58b02931457da7b654fae","observation_id":"c73b445d-dab2-4326-8fb5-54831e4d0d0f","resolution":{"observed_at":"2026-08-12T05:00:57.660877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.141416Z","title":"A natural policy gradient","venue":null,"work_id":"d79cc3a6-8eb6-40d6-87de-f91c266b7fc4","year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.664830Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b9b85fdccbeb523d79642bd8e160ed3a2577ee18f91b4551bdb9b4a92df066d4","observation_id":"4b321497-10f6-4430-a6b4-a709545abb65","resolution":{"observed_at":"2026-08-12T05:00:58.146247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.127660Z","title":"Optimality and approxi- mation with policy gradient methods in Markov decision processes","venue":null,"work_id":"2f6fe869-eedf-4f10-946d-2534cc82bbf6","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.668539Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:1ae9c50962e2ba2f106313b8e13c20dccfff8de8602058ed1b2059be11adb7c6","observation_id":"3c907966-e501-4a25-b882-e415f34b9484","resolution":{"observed_at":"2026-08-12T05:00:58.131943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.115227Z","title":"Information state embedding in partially observable cooperative multi-agent reinforcement learning","venue":null,"work_id":"364367a0-4c9c-4170-926c-d16e175319e0","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.672466Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:48dcc95fccb761a001d55cad76b2b36f696e8a4ef1cbe74ee5d2552c3f1b53f9","observation_id":"292cda01-7a8f-4ac7-a0f0-cfb0b2c95d91","resolution":{"observed_at":"2026-08-12T05:00:58.119280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.102506Z","title":"Approximate infor- mation state for approximate planning and reinforcement learning in partially observed sys- tems","venue":null,"work_id":"0f0330c9-5b17-4b6d-a055-de42f4a24f16","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.676320Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:cfdd7144c2b0ce1f621423a463ca2c7976ee4752e9eb6f82d13fce0f4efbef74","observation_id":"c95e5aa1-8890-4093-9d8c-740e3d16bc7e","resolution":{"observed_at":"2026-08-12T05:00:58.106613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.090004Z","title":"Stochastic games with one step delay sharing information pattern with application to power control","venue":null,"work_id":"0599ab54-5e4d-4040-b64f-901813844197","year":2009},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.680053Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f49dc47077e7377d4108536b5bb61d442895203a1e99c24d3ca06a66e68b31f7","observation_id":"c9bc6d5d-eefc-4818-be95-83c0487b7a49","resolution":{"observed_at":"2026-08-12T05:00:58.094199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.077548Z","title":"A mea- surement study of internet delay asymmetry","venue":null,"work_id":"e3d1a3b8-e279-4f75-83b8-053cf350b335","year":2008},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.683976Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:3d7b4348c6b44ba1b4f634bd65a7c4a49802706716c5ab3cd2497b114c10faa6","observation_id":"9e3bb496-8db5-4244-830e-f8d3f22febbf","resolution":{"observed_at":"2026-08-12T05:00:58.081640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.687754Z","title":"Repeated games with incomplete information","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.687754Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:64ba6bda629d6a85f6c96a36b76ad47e4c6dcd70b744705bd0640f338594ab4b","observation_id":"6d2cb1c1-a240-4700-9c95-5033cda07d6b","resolution":{"observed_at":"2026-08-12T05:00:57.687754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.056746Z","title":"Information theory: From coding to learning","venue":null,"work_id":"33a1d465-998a-44cc-8d6f-b24b8e362a97","year":2025},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.691607Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:165c06c0071fc14abb5462a7ce5c20b7d9259c94319f9385396e581333d9725d","observation_id":"254b8c83-d1ab-4357-a907-d2f66ae616c0","resolution":{"observed_at":"2026-08-12T05:00:58.060933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13341","last_updated":"2020-06-01T03:28:44Z","snapshot_observed_at":"2026-08-10T11:08:21.720144Z","submitted_at":"2019-05-30T22:39:57Z","title":"On Value Functions and the Agent-Environment Boundary","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13341","snapshot_observed_at":"2026-08-12T05:00:57.695389Z","title":"On value functions and the agent-environment boundary","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.695389Z"},"links":{"cited_paper":"/paper/1905.13341","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:361b348218237f50f97aaddb3df479fd4a156f7b263ea1156e31860e8208d5ba","observation_id":"67936a39-66f6-4d20-b77b-b4d56d62b14f","resolution":{"observed_at":"2026-08-12T05:00:57.695389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11457","last_updated":"2020-04-08T22:39:42Z","snapshot_observed_at":"2026-08-08T17:40:57.148833Z","submitted_at":"2020-02-25T06:14:59Z","title":"A short note on learning discrete distributions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11457","snapshot_observed_at":"2026-08-12T05:00:57.699272Z","title":"A short note on learning discrete distributions","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.699272Z"},"links":{"cited_paper":"/paper/2002.11457","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:828ef0a00e6d96caefcf94bf2a60c82ea810839157b136511850e4b6653dddc2","observation_id":"6c07b385-7de8-4e98-8727-ce3a58b94cd4","resolution":{"observed_at":"2026-08-12T05:00:57.699272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.044352Z","title":"A characteri- zation of multiclass learnability, 2022","venue":null,"work_id":"c956d6d6-bb41-4cf8-ac1a-d31f81742474","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.703594Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:fa99ffae85212beba4ca7241a0e75a9fb37896021ae226010b4d7a2a1dce10c4","observation_id":"2580b214-3fde-481e-aa8e-d04beaee22e3","resolution":{"observed_at":"2026-08-12T05:00:58.048694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.031908Z","title":"A characteriza- tion of multiclass learnability","venue":null,"work_id":"b42c9381-6097-4d0e-a5c6-357e07888c3b","year":2022},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.707289Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b2e36c9aee4f595c561fef5a7c19c1f01d0ecc4b2367c0a74f41e3ccf80f52cb","observation_id":"cffa59e6-104b-47c8-99c6-0c4b76a227a0","resolution":{"observed_at":"2026-08-12T05:00:58.036051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.019336Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"b54496e6-a2b9-4baf-9825-0d0c046391e1","year":2002},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.711055Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:a5696a2f72c3ed38edb6cbbcdc954ab57432779aec690441a76a44d8733d6d65","observation_id":"88707e5b-c738-43f6-a625-0f666337a471","resolution":{"observed_at":"2026-08-12T05:00:58.023529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:58.006319Z","title":"Convex optimization: Algorithms and complexity","venue":null,"work_id":"ba64a2af-d848-4fac-a442-019549463c0a","year":2015},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.714868Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c096d6950d4f1464fdc1390d71c69182f8e998cd46d0eba0252e7db6544a6ece","observation_id":"db7590f0-0b5f-43a8-81bb-880ea14462cf","resolution":{"observed_at":"2026-08-12T05:00:58.010854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.993657Z","title":"Tighter problem-dependent regret bounds in reinforce- ment learning without domain knowledge using value function bounds","venue":null,"work_id":"ed645aa9-dd67-499e-8c46-507b8443d093","year":2019},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.718762Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:81c2f9db95cef2af5e661bd207ba88c2a04156468a50f090c03294e796586d15","observation_id":"c550fa58-6a96-4029-9677-f99375c1814a","resolution":{"observed_at":"2026-08-12T05:00:57.997919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.980713Z","title":"Reward-free exploration for reinforcement learning","venue":null,"work_id":"dd54286d-61a6-47ab-b550-b8cdf56a18d5","year":2020},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.722481Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:d88e414bc725c8a393c05dccaaf190ce52761751b62d01553e2872ee17bb4a6f","observation_id":"b84e87ff-29a4-42be-843a-e0b026fa63cb","resolution":{"observed_at":"2026-08-12T05:00:57.984880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.967019Z","title":"Is Q-learning provably efficient? In Advances in Neural Information Processing Systems, pages 4863–4873, 2018","venue":null,"work_id":"69ddc08f-c8b8-4176-b200-a64d87c6005d","year":2018},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.726414Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:04047a2be08200b3167abf66abe4e6d28849b029ec375d8492383d31a16351c4","observation_id":"a754894a-2951-40e7-909b-970f2e2adf3b","resolution":{"observed_at":"2026-08-12T05:00:57.971151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.954412Z","title":"No-regret learning in convex games","venue":null,"work_id":"bf5e0c7a-448c-4a12-8aab-2edb417febc5","year":2008},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.730158Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:f067079883ccea2498234dadfdaf6e5ddcb88f88396e1d5a7b504906829ec3a4","observation_id":"c3b66ef2-81f7-40af-ad94-b46acf6a31e8","resolution":{"observed_at":"2026-08-12T05:00:57.958482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.941592Z","title":"No-regret learning in bayesian games","venue":null,"work_id":"bb6c5738-4182-411f-82ed-011255e3150f","year":2015},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.734176Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:b35e250818168671abd6d222718db71d043508dc18ffc1b91c726e93d93456f3","observation_id":"2822478c-8fe3-4201-995a-0bdb4b02f0e7","resolution":{"observed_at":"2026-08-12T05:00:57.945880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05005","last_updated":"2025-06-29T13:53:00Z","snapshot_observed_at":"2026-08-12T16:00:52.002360Z","submitted_at":"2023-04-11T06:22:51Z","title":"Bayes correlated equilibria, no-regret dynamics in Bayesian games, and the price of anarchy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05005","snapshot_observed_at":"2026-08-12T05:00:57.737884Z","title":"distilled","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.737884Z"},"links":{"cited_paper":"/paper/2304.05005","citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:c4ad69961707ef9428610ca3f6c141cf593377f63ccdb4a66aadd5564316325e","observation_id":"1b60dc6e-6f1f-43bb-bd5c-1f1a7e5e29ab","resolution":{"observed_at":"2026-08-12T05:00:57.737884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.928758Z","title":"By pluggingLt−1(π) into Equation (C.1), with simple algebric manipulations, we prove that: πt h(·|τh)∝πt−1 h (·|τh)exp ηEsh∼bh(τh) h Qt−1 h (τh,sh,·) i","venue":null,"work_id":"a54c020d-76f8-46b1-b96c-c05c622f21c6","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.742983Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:e2ccf45f4b0bd06c96f43bc62a0fe10d9bd34cb683d0c92e3ffe5b77bca288a8","observation_id":"c3edf6af-5c31-413e-a19b-9db9d4b3320c","resolution":{"observed_at":"2026-08-12T05:00:57.933014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:00:57.915698Z","title":"bV (mi⋄πk i )⊙πk −i,G i,h+1 (ch+1) # ,H−h + 1 ) , where the last step is by inductive hypothesis. Now note that for anysh,ph,ah, we have bk−1 h (sh,ah) +Eoh+1∼bJk−1 h (·|sh,ah)","venue":null,"work_id":"fae1e440-59ff-4eb4-befd-70b940c1ebbc","year":null},"citing_paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T05:00:57.747243Z"},"links":{"citing_paper":"/paper/2412.00985"},"observation_digest":"sha256:51125d9906aba0ce3a70359fec7c9ff56a442d77ef3365155c4476182f1d2685","observation_id":"1032c0d1-fd32-4015-a79e-d617f6fb4d71","resolution":{"observed_at":"2026-08-12T05:00:57.920214Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00985","last_updated":"2025-02-20T21:41:07Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T16:00:42.754639Z","submitted_at":"2024-12-01T22:26:27Z","title":"Provable Partially Observable Reinforcement Learning with Privileged Information"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":67},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2412.00985."}