Pith. sign in

Paper Citation Record · LEDGER

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access

As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2509.26000.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.26000 v3

Coverage vector

measured 33 of 33 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T13:43:32.011996Z

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

33 of 33 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved32
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d1895590-a8ae-41da-a642-52a358684f77 · outbound

This paper cites Reinforcement learning for HVAC control in intelligent buildings: A technical and conceptual review.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Reinforcement learning for HVAC control in intelligent buildings: A technical and conceptual review

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.830256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.830256Z digest=sha256:c2b106dc1dce1ccd6df5e0007ca641cb85c6d36286c1f27efffd1d7c421caf9c

Observation cce86ea8-b16e-4a46-ac6c-6a0c3c6cb978 · outbound

This paper cites MicroPPO: Safe power flow management in decentralized micro-grids with proximal policy optimization.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access MicroPPO: Safe power flow management in decentralized micro-grids with proximal policy optimization

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.873203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.873203Z digest=sha256:daa1cbf0913380bc732759d48ecf51e5385d0952c30150092c61e153ab2199a1

Observation 1bb75d7a-ee11-48a0-a78e-4610715bd47f · outbound

This paper cites Deep reinforcement learning solutions for energy microgrids management.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning solutions for energy microgrids management

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:28.949222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:28.949222Z digest=sha256:312b1b2a251dbc874b6db8b7047d741d4354a4767b6d294445fc2e9d1f756ce8

Observation 52133c76-122a-4296-a6ce-e07a8dc78929 · outbound

This paper cites Deep reinforcement learning framework for autonomous driving.Electronic Imaging, 2017:70–76, 01 2017.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning framework for autonomous driving.Electronic Imaging, 2017:70–76, 01 2017

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.014886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.014886Z digest=sha256:5dbda59fa2c6500e4ea1648421284ce3f283adca1c1f4197f4a982b8b2cdb4d0

Observation 9718af9b-a604-44be-b832-bafe48757bc4 · outbound

This paper cites Deep reinforcement learning for robotics: A survey of real-world successes.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep reinforcement learning for robotics: A survey of real-world successes

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.134741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.134741Z digest=sha256:36bccf28960a0eb59fd14ff2722b04c21301254f7858e53662ea70f9471ee714

Observation 97e8ab1a-4cbd-431d-a0b1-0ef4da00ab7b · outbound

This paper cites Planning and acting in partially observable stochastic domains.Artificial intelligence, 101(1-2):99–134, 1998.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Planning and acting in partially observable stochastic domains.Artificial intelligence, 101(1-2):99–134, 1998

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.253019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.253019Z digest=sha256:ce8507bd53e78a853d6e024dd7ac5abb964d28ae0e12d11560d5628fd5d2a6a0

Observation 6cf44693-a62c-464e-b551-f53110d02e18 · outbound

This paper cites Deep recurrent Q-learning for partially observable MDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Deep recurrent Q-learning for partially observable MDPs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.320270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.320270Z digest=sha256:50def1cfd056bac6c6f75252099b6508e0200eb5e231fea5bd8d16efb97c8dfd

Observation e9029117-8f2c-4fc5-8ab4-e44ec99a76fc · outbound

This paper cites Learning deep neural network policies with continuous memory states.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Learning deep neural network policies with continuous memory states

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.457909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.457909Z digest=sha256:11574ab7a8cb37829af3a0d7bf0c16345b8ef04e45358c299a7536a47911086d

Observation d87faf64-147a-4028-b1cf-33390191b749 · outbound

This paper cites Asymmetric Actor Critic for Image-Based Robot Learning.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Asymmetric Actor Critic for Image-Based Robot Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.538519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.538519Z digest=sha256:9f6a3e8a2d25a479a47ecaf4ea05849a79538b539952f1181c5d6692a57ea0dc

Observation 89f14fee-3b2c-4d77-bcdd-3934d7075e4e · outbound

This paper cites Unbiased asymmetric reinforcement learning under partial observability.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Unbiased asymmetric reinforcement learning under partial observability

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.624030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.624030Z digest=sha256:e725c59bfa970e81a68ff4072ef5dc4a3cfa9d44eece123406704b3b825ce90b

Observation 4473a43d-2153-4e3b-acc8-4ff7754032d2 · outbound

This paper cites On Improving Deep Reinforcement Learning for POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access On Improving Deep Reinforcement Learning for POMDPs

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.684346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.684346Z digest=sha256:2f6cefdb7d019d051ac6c3f2cc11c8d24c7e476adb4801869e901c2d21f1c0ed

Observation 39256772-0beb-4366-8859-be6985cac341 · outbound

This paper cites Recurrent policy gradients.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Recurrent policy gradients

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.771032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.771032Z digest=sha256:c1b7f3986d73deecfbecc9c0793556ffea6e85682c80c75cff305a0f6e00bb8f

Observation 68af1ac4-061f-427c-a9f2-2485903e3fda · outbound

This paper cites Reinforcement learning with long short-term memory.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Reinforcement learning with long short-term memory

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.924982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.924982Z digest=sha256:c33bcb2d1347f2b6b7a5b10ecb7e9ad506d7c4a30e0a384ff15b7172c1af610b

Observation 9e44a7f0-07de-4c95-b98c-eb67bccf8d3d · outbound

This paper cites Recurrent natural policy gradient for POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Recurrent natural policy gradient for POMDPs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:29.996009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:29.996009Z digest=sha256:01c4ef82e8258cb26f926a1e7a4ff138745929d68c1881391a99217d4a8ff120

Observation e961f44d-52cf-4de8-99ab-6c98522680bb · outbound

This paper cites Bridging State and History Representations: Understanding Self-Predictive RL.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Bridging State and History Representations: Understanding Self-Predictive RL

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.088955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.088955Z digest=sha256:94536e788ecd26d9bbac29eca7ba5c8c60ac3edf3abeb1e05e6121d75eb0010f

Observation 13f3e427-d2ce-4bff-a5a2-6c6914a49a09 · outbound

This paper cites Approximate information state for approximate planning and reinforcement learning in partially observed systems.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Approximate information state for approximate planning and reinforcement learning in partially observed systems

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.236286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.236286Z digest=sha256:9247bcfc3f3e391552e44c593e4978b496e5db3239394b1d073fd0b05bce44fc

Observation f78ed1fe-7a1a-4aab-87f0-3d21cb5b36a6 · outbound

This paper cites Data-driven planning via imitation learning.The International Journal of Robotics Research, 37(13-14):1632–1672, 2018.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Data-driven planning via imitation learning.The International Journal of Robotics Research, 37(13-14):1632–1672, 2018

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.344287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.344287Z digest=sha256:bc7ae8aece9daa17b73dd0a7228015012e9c582c9b20dfb7ea66b4940d488678

Observation 83bbfdd3-b98b-4170-83d9-57e9e99b6eee · outbound

This paper cites Robust asymmetric learning in POMDPs.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Robust asymmetric learning in POMDPs

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.423812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.423812Z digest=sha256:13608f257f7ebd0a85deff304221f5348b34ca83a74a2dd9c518eee77212ef32

Observation d643a3bb-2e4c-49ea-a50e-808bcfaac549 · outbound

This paper cites Informed POMDP: Leveraging additional information in model-based RL.Reinforcement Learning Journal, 2024.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Informed POMDP: Leveraging additional information in model-based RL.Reinforcement Learning Journal, 2024

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.529384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.529384Z digest=sha256:4358bdc7a26536adc138e8e3b9ae6048186ba2ab9844404075a54d7ace250127

Observation 69114514-c576-442a-b49e-0d5c1a44bd22 · outbound

This paper cites The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access The wasserstein believer: Learning belief updates for partially observable environments through reliable latent space models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.639403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.639403Z digest=sha256:a3efb3054adb686f94a0d032e7c51d9d0f62821cd02633b4242033562fde4934

Observation 8be63fca-ba09-4327-bf7f-7fbaeab8df18 · outbound

This paper cites Hu, James Springer, Oleh Rybkin, and Dinesh Jayaraman.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Hu, James Springer, Oleh Rybkin, and Dinesh Jayaraman

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.683356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.683356Z digest=sha256:089b48dd15bb4a7b3015c6343c1ca77424538334f31ba41ff36576fd3e694bab

Observation 55edacc7-bfc8-4618-829b-275b50df21ec · outbound

This paper cites Neural policy gradient methods: Global optimality and rates of convergence.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Neural policy gradient methods: Global optimality and rates of convergence

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.729903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.729903Z digest=sha256:77f8517eb1ba3c4e27818aa301756734d1fbaa31ac0931136c239acb987576dc

Observation f0442c94-7ca7-42a4-a4ae-0edf1834d53a · outbound

This paper cites A theoretical justification for asymmetric actor-critic algorithms.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A theoretical justification for asymmetric actor-critic algorithms

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.853496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.853496Z digest=sha256:34f7f06654d092ff6622eba2039dbd4ecc3e4ee84b4841b37281945ea31a9314

Observation cf3f0c19-26e5-4169-998c-7d190c0e4778 · outbound

This paper cites A hilbert space embedding for distributions.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A hilbert space embedding for distributions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:30.999386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:30.999386Z digest=sha256:abf0fb857a9a84bc28e519188f7caa2fb057185d208911b29a73aba722ff2c7e

Observation dd101662-1b6f-4c81-b239-024beef257c0 · outbound

This paper cites Measuring statistical dependence with hilbert-schmidt norms.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Measuring statistical dependence with hilbert-schmidt norms

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.088783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.088783Z digest=sha256:22d8cb0d951cef103335bf17fe0165a317ad7b9ef780c4278aaddff6ad053817

Observation ebde8a40-81ea-41f8-85cf-df3cd3d1741c · outbound

This paper cites A measure-theoretic approach to kernel conditional mean embeddings.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access A measure-theoretic approach to kernel conditional mean embeddings

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.199136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.199136Z digest=sha256:56667ebc107ff1e696b54470e36c1c054d01426c122a1955a30d893a347780db

Observation e15a151e-9ea8-4e62-942d-c5b01d3735be · outbound

This paper cites On overfitting and asymptotic bias in batch reinforcement learning with partial observability.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access On overfitting and asymptotic bias in batch reinforcement learning with partial observability

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.347183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.347183Z digest=sha256:fffe1f39c2170ba19d0dc02a394447b14946d38e0204b65ae919f2a3061255d5

Observation d6a1de3f-9aba-4d51-a38d-fa71277dc52e · outbound

This paper cites Solving large POMDPs using real time dynamic programming.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Solving large POMDPs using real time dynamic programming

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.453617Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.453617Z digest=sha256:7cce965096c5e4751d1299690f297620ec02d98c2d384a818bc7fb29198833d0

Observation 21ba80b6-33b5-4c57-8a09-c92cff800ce1 · outbound

This paper cites gym-pomdps: Gym environments from POMDP files.https://github.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access gym-pomdps: Gym environments from POMDP files.https://github

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.539400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.539400Z digest=sha256:c31a2d629eba33f920a918456c67ff3f9a0bf7885925357cd188e976edb054f9

Observation f264b523-9d61-4d30-8bb0-4f1527b2c5ba · outbound

This paper cites POMDP Robot Domains.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access POMDP Robot Domains

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.621646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.621646Z digest=sha256:fdd1f98d81a7240924bc7ac2a35390a76d80ba064edeab5515ffc060af1a81b8

Observation 77eeb484-d2fb-4b49-b37e-f5cf836fc87b · outbound

This paper cites Multi-agent reinforcement learning with directed exploration and selective memory reuse.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access Multi-agent reinforcement learning with directed exploration and selective memory reuse

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.677707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.677707Z digest=sha256:7eba5128c9e9d0a9510c49f6c6765ca4db91931dd3dc80d406b52cec686aeb9a

Observation e2adb9da-7b1f-47a2-bde3-b735d2dcdc22 · outbound

This paper cites gym-gridverse: Gridworld domains for fully and partially observable settings.https://github.com/abaisero/gym-gridverse, 2021.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access gym-gridverse: Gridworld domains for fully and partially observable settings.https://github.com/abaisero/gym-gridverse, 2021

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T13:43:31.827191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:31.827191Z digest=sha256:268204f5175dadae2ac6fec1ce1570dab7d1cb7583a08b9132421aae06a79643

Observation 9554b710-679a-4493-8cd2-6f2e36c9363f · outbound

This paper cites asym-porl: Asymmetric methods for partially observable reinforcement learning.

Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access asym-porl: Asymmetric methods for partially observable reinforcement learning

Reference 33

Resolution
malformed identifier
no resolver link, observed 2026-08-04T13:43:32.011996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T13:43:32.011996Z digest=sha256:ebdec0c0d3bfa040cebc891a3e172df2cb0576a238c8b20314b51a741c8ca708

Pith citing papers

No inbound Pith citation observations are available.