{"as_of":"2026-08-08T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ae4074b648d0ce1b05691a3d634960ed7c64ceae9a74b7d3a5af9d57b5f7868","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:43:32.011996Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.26000/citation-record","integrity":"/paper/2509.26000/integrity","json":"/paper/2509.26000/citation-record.json","paper":"/paper/2509.26000"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:28.830256Z","title":"Reinforcement learning for HVAC control in intelligent buildings: A technical and conceptual review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:28.830256Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:c2b106dc1dce1ccd6df5e0007ca641cb85c6d36286c1f27efffd1d7c421caf9c","observation_id":"d1895590-a8ae-41da-a642-52a358684f77","resolution":{"observed_at":"2026-08-04T13:43:28.830256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:28.873203Z","title":"MicroPPO: Safe power flow management in decentralized micro-grids with proximal policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:28.873203Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:daa1cbf0913380bc732759d48ecf51e5385d0952c30150092c61e153ab2199a1","observation_id":"cce86ea8-b16e-4a46-ac6c-6a0c3c6cb978","resolution":{"observed_at":"2026-08-04T13:43:28.873203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:28.949222Z","title":"Deep reinforcement learning solutions for energy microgrids management","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:28.949222Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:312b1b2a251dbc874b6db8b7047d741d4354a4767b6d294445fc2e9d1f756ce8","observation_id":"1bb75d7a-ee11-48a0-a78e-4610715bd47f","resolution":{"observed_at":"2026-08-04T13:43:28.949222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.014886Z","title":"Deep reinforcement learning framework for autonomous driving.Electronic Imaging, 2017:70–76, 01 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.014886Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:5dbda59fa2c6500e4ea1648421284ce3f283adca1c1f4197f4a982b8b2cdb4d0","observation_id":"52133c76-122a-4296-a6ce-e07a8dc78929","resolution":{"observed_at":"2026-08-04T13:43:29.014886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.134741Z","title":"Deep reinforcement learning for robotics: A survey of real-world successes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.134741Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:36bccf28960a0eb59fd14ff2722b04c21301254f7858e53662ea70f9471ee714","observation_id":"9718af9b-a604-44be-b832-bafe48757bc4","resolution":{"observed_at":"2026-08-04T13:43:29.134741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.253019Z","title":"Planning and acting in partially observable stochastic domains.Artificial intelligence, 101(1-2):99–134, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.253019Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:ce8507bd53e78a853d6e024dd7ac5abb964d28ae0e12d11560d5628fd5d2a6a0","observation_id":"97e8ab1a-4cbd-431d-a0b1-0ef4da00ab7b","resolution":{"observed_at":"2026-08-04T13:43:29.253019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.320270Z","title":"Deep recurrent Q-learning for partially observable MDPs","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.320270Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:50def1cfd056bac6c6f75252099b6508e0200eb5e231fea5bd8d16efb97c8dfd","observation_id":"6cf44693-a62c-464e-b551-f53110d02e18","resolution":{"observed_at":"2026-08-04T13:43:29.320270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.457909Z","title":"Learning deep neural network policies with continuous memory states","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.457909Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:11574ab7a8cb37829af3a0d7bf0c16345b8ef04e45358c299a7536a47911086d","observation_id":"e9029117-8f2c-4fc5-8ab4-e44ec99a76fc","resolution":{"observed_at":"2026-08-04T13:43:29.457909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06542","last_updated":"2017-10-18T01:10:37Z","snapshot_observed_at":"2026-07-06T06:04:47.929758Z","submitted_at":"2017-10-18T01:10:37Z","title":"Asymmetric Actor Critic for Image-Based Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06542","snapshot_observed_at":"2026-08-04T13:43:29.538519Z","title":"Asymmetric actor critic for image-based robot learning.arXiv preprint arXiv:1710.06542, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.538519Z"},"links":{"cited_paper":"/paper/1710.06542","citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:9f6a3e8a2d25a479a47ecaf4ea05849a79538b539952f1181c5d6692a57ea0dc","observation_id":"d87faf64-147a-4028-b1cf-33390191b749","resolution":{"observed_at":"2026-08-04T13:43:29.538519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.624030Z","title":"Unbiased asymmetric reinforcement learning under partial observability","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.624030Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:e725c59bfa970e81a68ff4072ef5dc4a3cfa9d44eece123406704b3b825ce90b","observation_id":"89f14fee-3b2c-4d77-bcdd-3934d7075e4e","resolution":{"observed_at":"2026-08-04T13:43:29.624030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07978","last_updated":"2018-05-24T14:13:20Z","snapshot_observed_at":"2026-07-06T05:39:20.517167Z","submitted_at":"2017-04-26T05:55:07Z","title":"On Improving Deep Reinforcement Learning for POMDPs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07978","snapshot_observed_at":"2026-08-04T13:43:29.684346Z","title":"On improving deep reinforcement learning for PODMPs.arXiv preprint arXiv:1704.07978, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.684346Z"},"links":{"cited_paper":"/paper/1704.07978","citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:2f6cefdb7d019d051ac6c3f2cc11c8d24c7e476adb4801869e901c2d21f1c0ed","observation_id":"4473a43d-2153-4e3b-acc8-4ff7754032d2","resolution":{"observed_at":"2026-08-04T13:43:29.684346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.771032Z","title":"Recurrent policy gradients","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.771032Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:c1b7f3986d73deecfbecc9c0793556ffea6e85682c80c75cff305a0f6e00bb8f","observation_id":"39256772-0beb-4366-8859-be6985cac341","resolution":{"observed_at":"2026-08-04T13:43:29.771032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.924982Z","title":"Reinforcement learning with long short-term memory","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.924982Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:c33bcb2d1347f2b6b7a5b10ecb7e9ad506d7c4a30e0a384ff15b7172c1af610b","observation_id":"68af1ac4-061f-427c-a9f2-2485903e3fda","resolution":{"observed_at":"2026-08-04T13:43:29.924982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:29.996009Z","title":"Recurrent natural policy gradient for POMDPs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:29.996009Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:01c4ef82e8258cb26f926a1e7a4ff138745929d68c1881391a99217d4a8ff120","observation_id":"9e44a7f0-07de-4c95-b98c-eb67bccf8d3d","resolution":{"observed_at":"2026-08-04T13:43:29.996009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08898","last_updated":"2024-04-21T05:59:37Z","snapshot_observed_at":"2026-08-07T07:35:05.900443Z","submitted_at":"2024-01-17T00:47:43Z","title":"Bridging State and History Representations: Understanding Self-Predictive RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08898","snapshot_observed_at":"2026-08-04T13:43:30.088955Z","title":"Bridging state and history representations: Understanding self-predictive rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.088955Z"},"links":{"cited_paper":"/paper/2401.08898","citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:94536e788ecd26d9bbac29eca7ba5c8c60ac3edf3abeb1e05e6121d75eb0010f","observation_id":"e961f44d-52cf-4de8-99ab-6c98522680bb","resolution":{"observed_at":"2026-08-04T13:43:30.088955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.236286Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.236286Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:9247bcfc3f3e391552e44c593e4978b496e5db3239394b1d073fd0b05bce44fc","observation_id":"13f3e427-d2ce-4bff-a5a2-6c6914a49a09","resolution":{"observed_at":"2026-08-04T13:43:30.236286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.344287Z","title":"Data-driven planning via imitation learning.The International Journal of Robotics Research, 37(13-14):1632–1672, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.344287Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:bc7ae8aece9daa17b73dd0a7228015012e9c582c9b20dfb7ea66b4940d488678","observation_id":"f78ed1fe-7a1a-4aab-87f0-3d21cb5b36a6","resolution":{"observed_at":"2026-08-04T13:43:30.344287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.423812Z","title":"Robust asymmetric learning in POMDPs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.423812Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:13608f257f7ebd0a85deff304221f5348b34ca83a74a2dd9c518eee77212ef32","observation_id":"83bbfdd3-b98b-4170-83d9-57e9e99b6eee","resolution":{"observed_at":"2026-08-04T13:43:30.423812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.529384Z","title":"Informed POMDP: Leveraging additional information in model-based RL.Reinforcement Learning Journal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.529384Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:4358bdc7a26536adc138e8e3b9ae6048186ba2ab9844404075a54d7ace250127","observation_id":"d643a3bb-2e4c-49ea-a50e-808bcfaac549","resolution":{"observed_at":"2026-08-04T13:43:30.529384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.639403Z","title":"The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.639403Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:a3efb3054adb686f94a0d032e7c51d9d0f62821cd02633b4242033562fde4934","observation_id":"69114514-c576-442a-b49e-0d5c1a44bd22","resolution":{"observed_at":"2026-08-04T13:43:30.639403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.683356Z","title":"Hu, James Springer, Oleh Rybkin, and Dinesh Jayaraman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.683356Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:089b48dd15bb4a7b3015c6343c1ca77424538334f31ba41ff36576fd3e694bab","observation_id":"8be63fca-ba09-4327-bf7f-7fbaeab8df18","resolution":{"observed_at":"2026-08-04T13:43:30.683356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.729903Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.729903Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:77f8517eb1ba3c4e27818aa301756734d1fbaa31ac0931136c239acb987576dc","observation_id":"55edacc7-bfc8-4618-829b-275b50df21ec","resolution":{"observed_at":"2026-08-04T13:43:30.729903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.853496Z","title":"A theoretical justification for asymmetric actor-critic algorithms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.853496Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:34f7f06654d092ff6622eba2039dbd4ecc3e4ee84b4841b37281945ea31a9314","observation_id":"f0442c94-7ca7-42a4-a4ae-0edf1834d53a","resolution":{"observed_at":"2026-08-04T13:43:30.853496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:30.999386Z","title":"A hilbert space embedding for distributions","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:30.999386Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:abf0fb857a9a84bc28e519188f7caa2fb057185d208911b29a73aba722ff2c7e","observation_id":"cf3f0c19-26e5-4169-998c-7d190c0e4778","resolution":{"observed_at":"2026-08-04T13:43:30.999386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.088783Z","title":"Measuring statistical dependence with hilbert-schmidt norms","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.088783Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:22d8cb0d951cef103335bf17fe0165a317ad7b9ef780c4278aaddff6ad053817","observation_id":"dd101662-1b6f-4c81-b239-024beef257c0","resolution":{"observed_at":"2026-08-04T13:43:31.088783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.199136Z","title":"A measure-theoretic approach to kernel conditional mean embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.199136Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:56667ebc107ff1e696b54470e36c1c054d01426c122a1955a30d893a347780db","observation_id":"ebde8a40-81ea-41f8-85cf-df3cd3d1741c","resolution":{"observed_at":"2026-08-04T13:43:31.199136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.347183Z","title":"On overfitting and asymptotic bias in batch reinforcement learning with partial observability","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.347183Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:fffe1f39c2170ba19d0dc02a394447b14946d38e0204b65ae919f2a3061255d5","observation_id":"e15a151e-9ea8-4e62-942d-c5b01d3735be","resolution":{"observed_at":"2026-08-04T13:43:31.347183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.453617Z","title":"Solving large POMDPs using real time dynamic programming","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.453617Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:7cce965096c5e4751d1299690f297620ec02d98c2d384a818bc7fb29198833d0","observation_id":"d6a1de3f-9aba-4d51-a38d-fa71277dc52e","resolution":{"observed_at":"2026-08-04T13:43:31.453617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.539400Z","title":"gym-pomdps: Gym environments from POMDP files.https://github","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.539400Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:c31a2d629eba33f920a918456c67ff3f9a0bf7885925357cd188e976edb054f9","observation_id":"21ba80b6-33b5-4c57-8a09-c92cff800ce1","resolution":{"observed_at":"2026-08-04T13:43:31.539400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.621646Z","title":"POMDP Robot Domains","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.621646Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:fdd1f98d81a7240924bc7ac2a35390a76d80ba064edeab5515ffc060af1a81b8","observation_id":"f264b523-9d61-4d30-8bb0-4f1527b2c5ba","resolution":{"observed_at":"2026-08-04T13:43:31.621646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.677707Z","title":"Multi-agent reinforcement learning with directed exploration and selective memory reuse","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.677707Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:7eba5128c9e9d0a9510c49f6c6765ca4db91931dd3dc80d406b52cec686aeb9a","observation_id":"77eeb484-d2fb-4b49-b37e-f5cf836fc87b","resolution":{"observed_at":"2026-08-04T13:43:31.677707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:31.827191Z","title":"gym-gridverse: Gridworld domains for fully and partially observable settings.https://github.com/abaisero/gym-gridverse, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:31.827191Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:268204f5175dadae2ac6fec1ce1570dab7d1cb7583a08b9132421aae06a79643","observation_id":"e2adb9da-7b1f-47a2-bde3-b735d2dcdc22","resolution":{"observed_at":"2026-08-04T13:43:31.827191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:43:32.011996Z","title":"asym-porl: Asymmetric methods for partially observable reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:32.011996Z"},"links":{"citing_paper":"/paper/2509.26000"},"observation_digest":"sha256:ebdec0c0d3bfa040cebc891a3e172df2cb0576a238c8b20314b51a741c8ca708","observation_id":"9554b710-679a-4493-8cd2-6f2e36c9363f","resolution":{"observed_at":"2026-08-04T13:43:32.011996Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.26000","last_updated":"2026-06-09T14:29:52Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T06:12:53.159640Z","submitted_at":"2025-09-30T09:32:20Z","title":"Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2509.26000."}