Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T19:30:12.341086Z
Paper Citation Record · LEDGER
As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.16753.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T19:30:12.341086Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
44 of 44 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 968649e3-b948-4873-9a9e-8a3a56b1e88e · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Then, we approximate the peak of the probability by a constant multiple of Dirac’s delta function asκworstδ(˜s⋆) and distribute the remaining probability equally as 1−κworst
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 98c71c13-319a-4909-974a-cc15c25d1fbb · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation (57) 5: end for 6: else 7: Do nothing (pass) 8: end if C.3
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 564ea699-d5ee-44ae-80e1-55fd41310cda · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 4b18e3d9-5a3c-49d2-9e01-0ef81c64418f · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1fbe3810-9a7f-44b4-99f8-38038756669a · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Soft Actor-Critic Algorithms and Applications
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af50499b-2f15-47c0-b5ac-33fc22bd01c9 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Average episodic rewards (± standard deviation) for median- seed models of our proposed methods (V ALT-EPS, V ALT-SOFT) and other SAC baselines across four MuJoCo tasks
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 407518af-8b6e-466c-b73f-f9596fcbffa8 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation fd3dc850-0bf3-448c-b634-1be529023962 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation We denote the ablation setting as w/o PE, and regularization is applied in all settings, including the ablation
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 3eed6b07-0e34-43c2-9df8-8d9f1575263d · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation b9797397-b95e-4e70-9522-feab1d3950f9 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation We denote these settings asAdv*, where * indicates the adversary rate
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 124ec24f-4704-4ef5-8836-31de9203e49d · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation B., Andrychowicz, M., Zaremba, W., and Abbeel, P
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation ef5b6cc1-b2c0-4482-bfd0-f62f49c8c9ca · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Robust Deep Reinforcement Learning Through Adversarial Attacks and Training : A Survey
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8f57e79b-8927-4729-a277-9d5fa1459075 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation L., Esfandiari, Y ., Lee, X
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 57ed649e-24f4-40ed-849d-59373fce1789 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Robust Reinforcement Learning using Adversarial Populations
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 799698de-26a9-413f-8b7b-89774f2ecdc9 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation b724273f-62e5-4a8e-bb22-43275a72e863 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 04b25261-974c-48a1-a00b-ddc3eb1deb40 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Sincef(Q,st) is a monotonically increasing function for Q, then we can say: f(Q1,st)≤f(Q2 +ϵ,st) =ϵ +f(Q2,st) =∥Q1−Q2∥st,˜at +f(Q2,st) ↔f(Q1,st)−f(Q2,st)≤∥Q1−Q2∥st,˜at
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation d05cc4d2-c1d0-43be-a17e-5c27d94b8a90 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation While its effect is only slightly better in some tasks, we do not observe any disadvantages to using PER
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1a90eaa9-ff76-45f2-b7c2-9475746be696 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation However, we observe that the agent’s learning became critically slow in HalfCheetah due to delays in updating the running statistics
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation da42e9a6-1e9d-4a19-93ef-1f2aa25b2e64 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation EnvironmentEnv
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 837462b4-866c-46ff-ac59-7a08ef9cad52 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation The SAC (agent) component retains the same settings as the base SAC, while the PPO (adversary) component follows the adversary settings of ATLA-PPO (Zhang et al., 2021)
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5b2d8083-6b5a-41c6-a14c-916e318863a9 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation The solid lines represent the average evaluation scores, and the shaded areas indicate standard deviations across different seeds
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 0f58721f-51fc-4565-8b18-087b95c39f80 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Compared to V ALT-EPS-SAC, V ALT-SOFT-SAC introduces more hyperparameters due to adversary policy training
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation e8e3b7c4-c509-4e7a-8e9f-61d06d0d37b3 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation We perform multiple training runs to tune robust critic parameters (perturbation scale and regression term) around the benchmark’s attack scale
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 60900cd9-585e-4287-88b1-c3dd1dbebb09 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation We denote these settings as w/o PE and w/o PI
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 64f00d96-f918-42e2-972c-782d38a969c3 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Adv1.0 assumes full adversarial influence (˜at∼π◦νsoft), while Adv0.0 uses the agent policy alone (at∼π).α = 4 const
Reference 43
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8005e069-78af-4755-a9ee-f364aea26137 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation f5047eff-1cfa-4559-bcf1-72b3e6b1fe04 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Adversarial Attacks on Neural Network Policies
Reference 1972
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d93ac52b-5d6b-43b8-9e3a-4b6b75750782 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 1998
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 7832744d-ee2e-4b48-b3d2-59112542e08d · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Whatever Does Not Kill Deep Reinforcement Learning, Makes It Stronger
Reference 1999
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e35784f0-25fd-487b-81b7-c6de09dfa5ad · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Reinforcement Learning via Fenchel-Rockafellar Duality
Reference 2005
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c3720f9-ec5f-4dff-a113-3f2bd8c9dc66 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation OpenAI Gym
Reference 2011
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7eb69763-072f-4380-b53b-c2f645dbbef4 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Adversarial examples in the physical world
Reference 2012
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 62cd38ce-eda0-4063-b6a3-155a2d2b074c · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Delving into adversarial attacks on deep policies
Reference 2013
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f38e2ea4-f007-4003-b5f1-923ab23c0f7b · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation On the Effectiveness of Interval Bound Propagation for Training Verifiably Robust Models
Reference 2014
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dfdeffd3-b782-4701-961b-cca68da1e72d · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Proximal Policy Optimization Algorithms
Reference 2015
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9d590071-ed2f-48ad-abb6-a4218fe1bf0e · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Practical black-box attacks against 12 Off-Policy Actor-Critic for Observation Robustness: Virtual Alternative Training machine learning
Reference 2016
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation eb18e4d5-08a8-4f09-94c2-5e69bd3e69b2 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation f-Divergence constrained policy improvement
Reference 2017
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49fcc47c-4f03-46a8-ad2b-4151366b8ad4 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Soft Actor-Critic for Discrete Action Settings
Reference 2018
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c144b36e-3e1f-4f92-847c-0be805b0ea9f · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Mujoco: A physics engine for model-based control
Reference 2019
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 79195780-b7e0-4635-84f8-b0844585f1c0 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Unresolved cited work
Reference 2020
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 782021d3-6eed-4c5e-a70c-c2180bce2b6f · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation Furthermore, Liu et al
Reference 2021
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 64e57ba0-bf54-4121-942e-e2ca3ae7dcdb · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation The limitations of deep learning in adversarial settings
Reference 2022
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 7d1abe1c-cd0f-4f89-8225-c58d6d6f2082 · outbound
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation In the following, we temporarily set aside strict notation and represent expressions like ” R a∈A·,da ” as ”P a∈A·” when discussing continuous action space
Reference 2023
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
No inbound Pith citation observations are available.