Pith. sign in

Paper Citation Record · LEDGER

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access

As of 21 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2509.26000.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.26000 v3

Coverage vector

measured 33 of 33 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T13:43:32.011996Z

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

33 of 33 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved32
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d1895590-a8ae-41da-a642-52a358684f77 · outbound

This paper cites Reinforcement learning for HVAC control in intelligent buildings: A technical and conceptual review.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Reinforcement learning for HVAC control in intelligent buildings: A technical and conceptual review

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.830256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.830256Z digest=sha256:2cfd8d514ab12e489c2407c4dce1dff963013801cb4e91c91d81f5bf41cd0a21

Observation cce86ea8-b16e-4a46-ac6c-6a0c3c6cb978 · outbound

This paper cites MicroPPO: Safe power flow management in decentralized micro-grids with proximal policy optimization.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access MicroPPO: Safe power flow management in decentralized micro-grids with proximal policy optimization

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.873203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.873203Z digest=sha256:793256599b5a9c0ce39d48d111a229a87d9ecd2a4e6499eeeaacdfde90d2f6c7

Observation 1bb75d7a-ee11-48a0-a78e-4610715bd47f · outbound

This paper cites Deep reinforcement learning solutions for energy microgrids management.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning solutions for energy microgrids management

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.949222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.949222Z digest=sha256:848af604d00df0a28a08f62dd01ce03affb9d4793a258d3f04d1357b8c15c8dd

Observation 52133c76-122a-4296-a6ce-e07a8dc78929 · outbound

This paper cites Deep reinforcement learning framework for autonomous driving.Electronic Imaging, 2017:70–76, 01 2017.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning framework for autonomous driving.Electronic Imaging, 2017:70–76, 01 2017

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.014886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.014886Z digest=sha256:8961db809e25de21271a0984fc538296ff3d0878921662bfc3e59d52521ec46f

Observation 9718af9b-a604-44be-b832-bafe48757bc4 · outbound

This paper cites Deep reinforcement learning for robotics: A survey of real-world successes.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning for robotics: A survey of real-world successes

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.134741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.134741Z digest=sha256:f21403436fdffc49e873ab945a00507dd586985f09c94671e383376fcb2641f0

Observation 97e8ab1a-4cbd-431d-a0b1-0ef4da00ab7b · outbound

This paper cites Planning and acting in partially observable stochastic domains.Artificial intelligence, 101(1-2):99–134, 1998.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Planning and acting in partially observable stochastic domains.Artificial intelligence, 101(1-2):99–134, 1998

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.253019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.253019Z digest=sha256:3de97c2e289aafabc40db6ec98e085f48062b6cf6a54b1bf9d53f06174572a7b

Observation 6cf44693-a62c-464e-b551-f53110d02e18 · outbound

This paper cites Deep recurrent Q-learning for partially observable MDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep recurrent Q-learning for partially observable MDPs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.320270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.320270Z digest=sha256:4030c7288db56ed0a6ffd24a0e606edcd4e22595b6479daf3acdf10910c9f757

Observation e9029117-8f2c-4fc5-8ab4-e44ec99a76fc · outbound

This paper cites Learning deep neural network policies with continuous memory states.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Learning deep neural network policies with continuous memory states

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.457909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.457909Z digest=sha256:f89980a35a30edf5310b5051dd5f1afd2946adec679f98df86a1085b65494e12

Observation d87faf64-147a-4028-b1cf-33390191b749 · outbound

This paper cites Asymmetric Actor Critic for Image-Based Robot Learning.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Asymmetric Actor Critic for Image-Based Robot Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.538519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.538519Z digest=sha256:f02ee54cfa5ee1682def9d49babab520c01c9b317b2a7666c6f57639154ca942

Observation 89f14fee-3b2c-4d77-bcdd-3934d7075e4e · outbound

This paper cites Unbiased asymmetric reinforcement learning under partial observability.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Unbiased asymmetric reinforcement learning under partial observability

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.624030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.624030Z digest=sha256:20de4b9748625f3081443b31b73364ffeda75e259312e474ba478dece03c6fe9

Observation 4473a43d-2153-4e3b-acc8-4ff7754032d2 · outbound

This paper cites On Improving Deep Reinforcement Learning for POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access On Improving Deep Reinforcement Learning for POMDPs

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.684346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.684346Z digest=sha256:009263c146225d664e0e61d8654da06fa375e85d7e4838c02fb48170151ca047

Observation 39256772-0beb-4366-8859-be6985cac341 · outbound

This paper cites Recurrent policy gradients.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Recurrent policy gradients

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.771032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.771032Z digest=sha256:d9897c918b0bee21e643f925ebee69325e63e4c1abcf87d2f5933b331a532694

Observation 68af1ac4-061f-427c-a9f2-2485903e3fda · outbound

This paper cites Reinforcement learning with long short-term memory.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Reinforcement learning with long short-term memory

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.924982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.924982Z digest=sha256:a6b466de5537746139c1d8412345127bdfec49a4ce66309ca9cf3f1c9a2f841d

Observation 9e44a7f0-07de-4c95-b98c-eb67bccf8d3d · outbound

This paper cites Recurrent natural policy gradient for POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Recurrent natural policy gradient for POMDPs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.996009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.996009Z digest=sha256:689b00b85bce5be368c000944b62c64e88952c5911c4ed9991b4ca3a8c38ef5e

Observation e961f44d-52cf-4de8-99ab-6c98522680bb · outbound

This paper cites Bridging State and History Representations: Understanding Self-Predictive RL.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Bridging State and History Representations: Understanding Self-Predictive RL

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.088955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.088955Z digest=sha256:5be1c78322e2df550bdb777e5f3d30cc36d95f8b75e3258d29ff13b3fdae3a96

Observation 13f3e427-d2ce-4bff-a5a2-6c6914a49a09 · outbound

This paper cites Approximate information state for approximate planning and reinforcement learning in partially observed systems.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Approximate information state for approximate planning and reinforcement learning in partially observed systems

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.236286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.236286Z digest=sha256:6c961ba3b3f22c387e048a18a7997dd1f35c7101bbcb88412263178ea108dbed

Observation f78ed1fe-7a1a-4aab-87f0-3d21cb5b36a6 · outbound

This paper cites Data-driven planning via imitation learning.The International Journal of Robotics Research, 37(13-14):1632–1672, 2018.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Data-driven planning via imitation learning.The International Journal of Robotics Research, 37(13-14):1632–1672, 2018

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.344287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.344287Z digest=sha256:9669222cc78225f3bbc92d7f18ff9988fca154ef7bfe2a32644b0766ce361d0f

Observation 83bbfdd3-b98b-4170-83d9-57e9e99b6eee · outbound

This paper cites Robust asymmetric learning in POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Robust asymmetric learning in POMDPs

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.423812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.423812Z digest=sha256:d749c6893a08366d517a7e47ea849c473e66f00a98d5a97a06870390605077eb

Observation d643a3bb-2e4c-49ea-a50e-808bcfaac549 · outbound

This paper cites Informed POMDP: Leveraging additional information in model-based RL.Reinforcement Learning Journal, 2024.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Informed POMDP: Leveraging additional information in model-based RL.Reinforcement Learning Journal, 2024

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.529384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.529384Z digest=sha256:2772b095dcbd0590d6647664d557af377e278ff643e438cb7d3835c7a615e1b6

Observation 69114514-c576-442a-b49e-0d5c1a44bd22 · outbound

This paper cites The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.639403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.639403Z digest=sha256:3ee3c1d9824caf113547536b628e0a9c85e2b1adef3b7de27223ae713e400a03

Observation 8be63fca-ba09-4327-bf7f-7fbaeab8df18 · outbound

This paper cites Hu, James Springer, Oleh Rybkin, and Dinesh Jayaraman.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Hu, James Springer, Oleh Rybkin, and Dinesh Jayaraman

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.683356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.683356Z digest=sha256:7e6b42188cd99e6a7f3b45b63009966e6bd67381d508fb8d19d9644a9127114f

Observation 55edacc7-bfc8-4618-829b-275b50df21ec · outbound

This paper cites Neural policy gradient methods: Global optimality and rates of convergence.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Neural policy gradient methods: Global optimality and rates of convergence

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.729903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.729903Z digest=sha256:6f37096a3f931fd626245398477075834cef9dbe0b065d33aeefbc2e232d22e3

Observation f0442c94-7ca7-42a4-a4ae-0edf1834d53a · outbound

This paper cites A theoretical justification for asymmetric actor-critic algorithms.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A theoretical justification for asymmetric actor-critic algorithms

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.853496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.853496Z digest=sha256:78ed88c913c9acec7690e61912e98925ce78cb1848895cc1f1ded1041cf177fe

Observation cf3f0c19-26e5-4169-998c-7d190c0e4778 · outbound

This paper cites A hilbert space embedding for distributions.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A hilbert space embedding for distributions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.999386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.999386Z digest=sha256:a20d99ccac5f84367f1a28ba147723bf3b5ca2e94023bf639c25faf1c44f630d

Observation dd101662-1b6f-4c81-b239-024beef257c0 · outbound

This paper cites Measuring statistical dependence with hilbert-schmidt norms.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Measuring statistical dependence with hilbert-schmidt norms

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.088783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.088783Z digest=sha256:7e84cc1368bec7687a9116da4691996ae93fbb2ab8ac856bfe8a97db6ca4583e

Observation ebde8a40-81ea-41f8-85cf-df3cd3d1741c · outbound

This paper cites A measure-theoretic approach to kernel conditional mean embeddings.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A measure-theoretic approach to kernel conditional mean embeddings

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.199136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.199136Z digest=sha256:004ebbed2691539eace7030505d6713d8076f40777d006d3397c05e0fb406911

Observation e15a151e-9ea8-4e62-942d-c5b01d3735be · outbound

This paper cites On overfitting and asymptotic bias in batch reinforcement learning with partial observability.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access On overfitting and asymptotic bias in batch reinforcement learning with partial observability

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.347183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.347183Z digest=sha256:7cc67684cdfe6ec9f77f038589560e67c46accc331ea9840a63487cc6c97763e

Observation d6a1de3f-9aba-4d51-a38d-fa71277dc52e · outbound

This paper cites Solving large POMDPs using real time dynamic programming.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Solving large POMDPs using real time dynamic programming

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.453617Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.453617Z digest=sha256:a237e24079ebbafc4e39e8e918274e3777a6f6790e262412413279a669d4863d

Observation 21ba80b6-33b5-4c57-8a09-c92cff800ce1 · outbound

This paper cites gym-pomdps: Gym environments from POMDP files.https://github.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access gym-pomdps: Gym environments from POMDP files.https://github

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.539400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.539400Z digest=sha256:ddbd2ac60c44a24ffd7f6f99f2eda94db100df25d33755d2a6b3c5ccc7892ccd

Observation f264b523-9d61-4d30-8bb0-4f1527b2c5ba · outbound

This paper cites POMDP Robot Domains.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access POMDP Robot Domains

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.621646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.621646Z digest=sha256:8be036cfd66da5edaa4eb5ab5008870b3dad746ee69413bf2d16f15e175fda88

Observation 77eeb484-d2fb-4b49-b37e-f5cf836fc87b · outbound

This paper cites Multi-agent reinforcement learning with directed exploration and selective memory reuse.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Multi-agent reinforcement learning with directed exploration and selective memory reuse

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.677707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.677707Z digest=sha256:29550cdf43f920d84ace680cef8b053b5a4708d2a1f36d2c2a01eb603c9cbd70

Observation e2adb9da-7b1f-47a2-bde3-b735d2dcdc22 · outbound

This paper cites gym-gridverse: Gridworld domains for fully and partially observable settings.https://github.com/abaisero/gym-gridverse, 2021.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access gym-gridverse: Gridworld domains for fully and partially observable settings.https://github.com/abaisero/gym-gridverse, 2021

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.827191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.827191Z digest=sha256:f9d9975f4838871793a76c6698117b013cfb823a18164f2036b1b8e05a2c21b0

Observation 9554b710-679a-4493-8cd2-6f2e36c9363f · outbound

This paper cites asym-porl: Asymmetric methods for partially observable reinforcement learning.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access asym-porl: Asymmetric methods for partially observable reinforcement learning

Reference 33

Resolution
malformed identifier
no resolver link, observed 2026-08-04T13:43:32.011996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:32.011996Z digest=sha256:aa8c606e10f01ddab52e8cdf8465062c0a3cb734519acc00effdd0a1b7b3d98d

Pith citing papers

No inbound Pith citation observations are available.