{"as_of":"2026-08-19T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49dfeee3071d4e5ce78848b37d7c7f69ebab80c58a81542645eb39c240162adf","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:30:12.341086Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16753/citation-record","integrity":"/paper/2506.16753/integrity","json":"/paper/2506.16753/citation-record.json","paper":"/paper/2506.16753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.703375Z","title":"Then, we approximate the peak of the probability by a constant multiple of Dirac’s delta function asκworstδ(˜s⋆) and distribute the remaining probability equally as 1−κworst","venue":null,"work_id":"633d88b3-2260-492e-8ca1-f22a34e7507e","year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.271580Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:8f3e0fc7b2c8b07c9e4ed46b72e5f5f0b16dbb6cd46f0020886f4ef27a3aa4a3","observation_id":"968649e3-b948-4873-9a9e-8a3a56b1e88e","resolution":{"observed_at":"2026-08-15T19:30:12.707156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.683799Z","title":"(57) 5: end for 6: else 7: Do nothing (pass) 8: end if C.3","venue":null,"work_id":"e1eb0b6b-cc7a-453f-8340-9b41749043d6","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.278946Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:9ce28f4d2cc7ee1f2d0a3f6a5859fd1345216ea06520412c4eab2a90743d999f","observation_id":"98c71c13-319a-4909-974a-cc15c25d1fbb","resolution":{"observed_at":"2026-08-15T19:30:12.687282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.524531Z","title":null,"venue":null,"work_id":"9b2bf678-8be1-48e9-8fed-8824534c9787","year":2019},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.333756Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:0639c9b3d30dc4e56822664ea30c8aa0160bb89b306f4cf42342467232e47b6c","observation_id":"564ea699-d5ee-44ae-80e1-55fd41310cda","resolution":{"observed_at":"2026-08-15T19:30:12.527935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.673810Z","title":null,"venue":null,"work_id":"a77e27a9-beaf-4bd5-a9dd-5a3a719e8b08","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.282856Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:4eab30ba91401ada198c38deb319c2e312a8f5f98e5a0c93ca167b7ba1093e84","observation_id":"4b18e3d9-5a3c-49d2-9e01-0ef81c64418f","resolution":{"observed_at":"2026-08-15T19:30:12.677160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-15T19:30:12.198150Z","title":"Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.198150Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:1bdb096b2ee72d95bebb6f2f72f04cf196d4ddfe05192a4476a2c023b2a82667","observation_id":"1fbe3810-9a7f-44b4-99f8-38038756669a","resolution":{"observed_at":"2026-08-15T19:30:12.198150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.579348Z","title":"Average episodic rewards (± standard deviation) for median- seed models of our proposed methods (V ALT-EPS, V ALT-SOFT) and other SAC baselines across four MuJoCo tasks","venue":null,"work_id":"8a59c5ce-0483-4069-b663-a81717207b69","year":2022},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.315732Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:2edb50e1db5c44645ec6432d88336499901adead37153731fb150141588a541e","observation_id":"af50499b-2f15-47c0-b5ac-33fc22bd01c9","resolution":{"observed_at":"2026-08-15T19:30:12.583199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.568714Z","title":null,"venue":null,"work_id":"bf5703e7-15c4-437d-b13c-c8fca510965d","year":2000},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.319227Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:a0a9a5b6b20f9772604eaa111e15701df2dba7e1028be47d4f187c8c20c13f76","observation_id":"407518af-8b6e-466c-b73f-f9596fcbffa8","resolution":{"observed_at":"2026-08-15T19:30:12.572250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.546179Z","title":"We denote the ablation setting as w/o PE, and regularization is applied in all settings, including the ablation","venue":null,"work_id":"a8e6f814-a298-4a70-aac0-8bce74ee136e","year":1953},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.325953Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:1c67376ba3b7c2d9b9c5b707cc842133fb81385cff42c01d267bac71ed1bd63a","observation_id":"fd3dc850-0bf3-448c-b634-1be529023962","resolution":{"observed_at":"2026-08-15T19:30:12.549881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.743550Z","title":null,"venue":null,"work_id":"93848f60-c25f-403c-85bc-1d79f18f3c93","year":2020},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.255935Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:849b6958a4ad86d4af6754c6abc1fc1818e11b8d4b6c8718596c8794afa25888","observation_id":"3eed6b07-0e34-43c2-9df8-8d9f1575263d","resolution":{"observed_at":"2026-08-15T19:30:12.746796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.535121Z","title":"We denote these settings asAdv*, where * indicates the adversary rate","venue":null,"work_id":"fc69949e-b641-4127-af4e-29c52de6def0","year":1953},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.329943Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:4a2cfebe80ab3eee2ad2d35346e96d231518b383f2f4a2236b2cc334d765d97a","observation_id":"b9797397-b95e-4e70-9522-feab1d3950f9","resolution":{"observed_at":"2026-08-15T19:30:12.539060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.793557Z","title":"B., Andrychowicz, M., Zaremba, W., and Abbeel, P","venue":null,"work_id":"56bf7798-ccc3-4f20-b5b2-15f6eb4d4958","year":2018},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.225167Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:8152acdc5f89af83abf28879635dc461a7eee56dafb76b2b7ef2746f844cd278","observation_id":"124ec24f-4704-4ef5-8836-31de9203e49d","resolution":{"observed_at":"2026-08-15T19:30:12.796874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00420","last_updated":"2026-06-09T13:25:29Z","snapshot_observed_at":"2026-08-16T14:13:48.563749Z","submitted_at":"2024-03-01T10:16:46Z","title":"Robust Deep Reinforcement Learning Through Adversarial Attacks and Training : A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00420","snapshot_observed_at":"2026-08-15T19:30:12.228815Z","title":"Robust deep reinforcement learning through adversar- ial attacks and training: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.228815Z"},"links":{"cited_paper":"/paper/2403.00420","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:e4ff3c38226b7e45ac8469fadfe54772d3f66b8af6bc3a77dbb0b5ca2b13bde5","observation_id":"ef5b6cc1-b2c0-4482-bfd0-f62f49c8c9ca","resolution":{"observed_at":"2026-08-15T19:30:12.228815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.783563Z","title":"L., Esfandiari, Y ., Lee, X","venue":null,"work_id":"83e5ada8-576d-4460-b462-061b6752b006","year":2020},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.236304Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:b58e57d403212db6324831cec3ae06d77e52239692ca90b5e1d8013ea1451c19","observation_id":"8f57e79b-8927-4729-a277-9d5fa1459075","resolution":{"observed_at":"2026-08-15T19:30:12.787041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01825","last_updated":"2020-09-22T22:41:54Z","snapshot_observed_at":"2026-08-19T09:33:52.250302Z","submitted_at":"2020-08-04T20:57:32Z","title":"Robust Reinforcement Learning using Adversarial Populations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01825","snapshot_observed_at":"2026-08-15T19:30:12.244026Z","title":"Robust reinforcement learning using adversar- ial populations","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.244026Z"},"links":{"cited_paper":"/paper/2008.01825","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:693baa72bf39417421449bcc729d39fe8bd64b8b8ea929e23135f93bae0d48c1","observation_id":"57ed649e-24f4-40ed-849d-59373fce1789","resolution":{"observed_at":"2026-08-15T19:30:12.244026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.753402Z","title":null,"venue":null,"work_id":"e91a635d-6512-4c48-9d79-8f26341b44f1","year":2005},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.251858Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:33bf3194b5c4e806529f3f789fac6d34a329ee14ee3d3e40894a325dd81119b7","observation_id":"799698de-26a9-413f-8b7b-89774f2ecdc9","resolution":{"observed_at":"2026-08-15T19:30:12.756719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.733689Z","title":null,"venue":null,"work_id":"955e7ae9-49ea-4bb6-847a-444c3975dc9e","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.259790Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:7c02aa1dd42f9e159d263ac46d0738e27a4369ea0b4239e60a9113347ea2b080","observation_id":"b724273f-62e5-4a8e-bb22-43275a72e863","resolution":{"observed_at":"2026-08-15T19:30:12.737090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.713596Z","title":"Sincef(Q,st) is a monotonically increasing function for Q, then we can say: f(Q1,st)≤f(Q2 +ϵ,st) =ϵ +f(Q2,st) =∥Q1−Q2∥st,˜at +f(Q2,st) ↔f(Q1,st)−f(Q2,st)≤∥Q1−Q2∥st,˜at","venue":null,"work_id":"a46c9bd4-82dd-4021-9c3d-ecad8deb10e8","year":2017},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.267806Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:87e2fa79400e8dd922e44f245cdf17c7b621d55aa68d086b41ec31c9017221b2","observation_id":"04b25261-974c-48a1-a00b-ddc3eb1deb40","resolution":{"observed_at":"2026-08-15T19:30:12.717295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.663523Z","title":"While its effect is only slightly better in some tasks, we do not observe any disadvantages to using PER","venue":null,"work_id":"35a2aa98-492f-4ded-b54e-3b092f7294ff","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.286523Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:488ae3872a8f92bf8a1ad35ed8fcefb441b2958bffce64a9856dde7b8ea6af21","observation_id":"d05cc4d2-c1d0-43be-a17e-5c27d94b8a90","resolution":{"observed_at":"2026-08-15T19:30:12.667191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.653490Z","title":"However, we observe that the agent’s learning became critically slow in HalfCheetah due to delays in updating the running statistics","venue":null,"work_id":"4c21a1e3-97a9-4b17-841e-d8d0aafa7cbe","year":2022},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.290245Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:73df7a2fa3d8bd578ad07c610693d0019007425e822271d8c03c45f2efbf308c","observation_id":"1a90eaa9-ff76-45f2-b7c2-9475746be696","resolution":{"observed_at":"2026-08-15T19:30:12.657131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.643399Z","title":"EnvironmentEnv","venue":null,"work_id":"1f63728a-a50c-46e1-b5ad-9209f1a676e1","year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.294069Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:4741c7b7c49bb69511e7c692aff8f373310c1d23629c36c76ba30266c35db68f","observation_id":"da42e9a6-1e9d-4a19-93ef-1f2aa25b2e64","resolution":{"observed_at":"2026-08-15T19:30:12.647100Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.632804Z","title":"The SAC (agent) component retains the same settings as the base SAC, while the PPO (adversary) component follows the adversary settings of ATLA-PPO (Zhang et al., 2021)","venue":null,"work_id":"3b1858a1-c22a-4c1c-af2a-76df6e4ef0a5","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.297574Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:20c3531a646b8ba6a84e446aa09614ee3e4da02bafa08d7b556eff9cae9d5a2c","observation_id":"837462b4-866c-46ff-ac59-7a08ef9cad52","resolution":{"observed_at":"2026-08-15T19:30:12.636900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.611355Z","title":"The solid lines represent the average evaluation scores, and the shaded areas indicate standard deviations across different seeds","venue":null,"work_id":"7d4eab4a-167a-4493-b4e0-b8ecec581049","year":2018},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.304369Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:6b572d85d9bbcfbaf235d5e041bae3b815281028a5564696152f06fbccf46b24","observation_id":"5b2d8083-6b5a-41c6-a14c-916e318863a9","resolution":{"observed_at":"2026-08-15T19:30:12.615158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.600470Z","title":"Compared to V ALT-EPS-SAC, V ALT-SOFT-SAC introduces more hyperparameters due to adversary policy training","venue":null,"work_id":"0d20c1a7-a596-47ec-97df-377842654308","year":2018},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.308042Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:0fca837d708dc5e0c21445ab2d80778d6e19065374da8801f7b2e549cf42de2e","observation_id":"0f58721f-51fc-4565-8b18-087b95c39f80","resolution":{"observed_at":"2026-08-15T19:30:12.604239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.590015Z","title":"We perform multiple training runs to tune robust critic parameters (perturbation scale and regression term) around the benchmark’s attack scale","venue":null,"work_id":"d3697a42-0812-4013-874d-44e0ce5a5ae3","year":2021},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.312017Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:39be212f38bc7b89dd56d1c2fc347dd863d7d70f4bd84b0fa149e96d616dcec5","observation_id":"e8e3b7c4-c509-4e7a-8e9f-61d06d0d37b3","resolution":{"observed_at":"2026-08-15T19:30:12.593830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.557664Z","title":"We denote these settings as w/o PE and w/o PI","venue":null,"work_id":"e1fd4667-e573-492c-a32f-37db7354e1cc","year":1953},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.322610Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:35e90d385557838f44f9eb6a41487a9031818f43995021ddf2aad5b636e356e9","observation_id":"60900cd9-585e-4287-88b1-c3dd1dbebb09","resolution":{"observed_at":"2026-08-15T19:30:12.561623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.512650Z","title":"Adv1.0 assumes full adversarial influence (˜at∼π◦νsoft), while Adv0.0 uses the agent policy alone (at∼π).α = 4 const","venue":null,"work_id":"8a10d6bb-df96-46f0-8406-cd14702f9481","year":2022},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.337359Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:9c0b7bd4e6fca398ed9149e49cd22b1a9291a8835507b99a31c709191c7aa05f","observation_id":"64f00d96-f918-42e2-972c-782d38a969c3","resolution":{"observed_at":"2026-08-15T19:30:12.517546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.500995Z","title":null,"venue":null,"work_id":"8d2e586a-85fe-4092-9f8a-6245083ce2b1","year":2000},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.341086Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:8c0a0d5ec4fd4492ded006123bd1d27acff0334cce95c2c4f07e8868daf21a63","observation_id":"8005e069-78af-4755-a9ee-f364aea26137","resolution":{"observed_at":"2026-08-15T19:30:12.505561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-08-14T21:17:29.796866Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-15T19:30:12.202401Z","title":"Adversarial attacks on neural network policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":1972,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.202401Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:d0c15c089e9e44afe123831e821df8bd913f0f18796926848bcd6f1a466639d1","observation_id":"f5047eff-1cfa-4559-bcf1-72b3e6b1fe04","resolution":{"observed_at":"2026-08-15T19:30:12.202401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.693596Z","title":null,"venue":null,"work_id":"a70a4355-f442-4cad-b7d9-ee92922c74f2","year":2016},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.275342Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:775f3a5c38f96fe84fae11ae504922ee32573209cb978cb18dbeb580419be930","observation_id":"d93ac52b-5d6b-43b8-9e3a-4b6b75750782","resolution":{"observed_at":"2026-08-15T19:30:12.696834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09344","last_updated":"2017-12-23T23:57:55Z","snapshot_observed_at":"2026-08-19T05:04:58.679428Z","submitted_at":"2017-12-23T23:57:55Z","title":"Whatever Does Not Kill Deep Reinforcement Learning, Makes It Stronger","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09344","snapshot_observed_at":"2026-08-15T19:30:12.176065Z","title":"and Munir, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.176065Z"},"links":{"cited_paper":"/paper/1712.09344","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:5b0887fec570d7c7ea996d84e855744f73e7572b15ba4e7234ccdc28354a807a","observation_id":"7832744d-ee2e-4b48-b3d2-59112542e08d","resolution":{"observed_at":"2026-08-15T19:30:12.176065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.01866","last_updated":"2020-01-09T19:08:09Z","snapshot_observed_at":"2026-08-11T23:21:08.502885Z","submitted_at":"2020-01-07T02:59:59Z","title":"Reinforcement Learning via Fenchel-Rockafellar Duality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.01866","snapshot_observed_at":"2026-08-15T19:30:12.214036Z","title":"and Dai, B","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.214036Z"},"links":{"cited_paper":"/paper/2001.01866","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:0fc27f879e495c6d502e45d20983c83f1cd5131d3c0f57c2972b40b6a4ba4359","observation_id":"e35784f0-25fd-487b-81b7-c6de09dfa5ad","resolution":{"observed_at":"2026-08-15T19:30:12.214036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-15T19:30:12.185268Z","title":"Openai gym","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.185268Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:c15daa69da857b465e135643e0779aa14e859644097b0b5c6cd5d7378ae50758","observation_id":"0c3720f9-ec5f-4dff-a113-3f2bd8c9dc66","resolution":{"observed_at":"2026-08-15T19:30:12.185268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.02533","last_updated":"2017-02-11T00:39:39Z","snapshot_observed_at":"2026-08-16T03:14:49.760924Z","submitted_at":"2016-07-08T21:12:11Z","title":"Adversarial examples in the physical world","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.02533","snapshot_observed_at":"2026-08-15T19:30:12.210101Z","title":"Adversar- ial examples in the physical world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.210101Z"},"links":{"cited_paper":"/paper/1607.02533","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:debf3ce34d7ecd6f789f7a584d7e6a7f1a50e580394b3f35a8630432d2fa2ebc","observation_id":"7eb69763-072f-4380-b53b-c2f645dbbef4","resolution":{"observed_at":"2026-08-15T19:30:12.210101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06452","last_updated":"2017-05-18T08:01:53Z","snapshot_observed_at":"2026-08-14T20:59:53.433695Z","submitted_at":"2017-05-18T08:01:53Z","title":"Delving into adversarial attacks on deep policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06452","snapshot_observed_at":"2026-08-15T19:30:12.206466Z","title":"and Song, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.206466Z"},"links":{"cited_paper":"/paper/1705.06452","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:c7073c2a45b76ad90155e8cce1c85a51f60e56a5915c32ece58ba36d55e553db","observation_id":"62cd38ce-eda0-4063-b6a3-155a2d2b074c","resolution":{"observed_at":"2026-08-15T19:30:12.206466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12715","last_updated":"2019-08-29T12:23:52Z","snapshot_observed_at":"2026-08-14T18:07:07.555009Z","submitted_at":"2018-10-30T13:12:47Z","title":"On the Effectiveness of Interval Bound Propagation for Training Verifiably Robust Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12715","snapshot_observed_at":"2026-08-15T19:30:12.193798Z","title":"On the effectiveness of interval bound propagation for training verifiably robust models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.193798Z"},"links":{"cited_paper":"/paper/1810.12715","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:3c41438cccb8cc37466f320c4158a37cba2041768e97cab68e27f646e1bf0bd1","observation_id":"f38e2ea4-f007-4003-b5f1-923ab23c0f7b","resolution":{"observed_at":"2026-08-15T19:30:12.193798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T19:30:12.232612Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.232612Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:4eebabbe05c35cd29a20ed3696c992716469846934b6ca7d76e372827f736661","observation_id":"dfdeffd3-b782-4701-961b-cca68da1e72d","resolution":{"observed_at":"2026-08-15T19:30:12.232612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.803240Z","title":"Practical black-box attacks against 12 Off-Policy Actor-Critic for Observation Robustness: Virtual Alternative Training machine learning","venue":null,"work_id":"d43cd6c5-ac33-4fb6-bc55-67f7dbc22741","year":2017},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.221604Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:d95ad2b74bdd9ffe28c7a9536116877552b0fec4994ea33b0e97724690e01cdc","observation_id":"9d590071-ed2f-48ad-abb6-a4218fe1bf0e","resolution":{"observed_at":"2026-08-15T19:30:12.807109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00056","last_updated":"2018-04-04T11:36:12Z","snapshot_observed_at":"2026-08-14T19:59:09.735977Z","submitted_at":"2017-12-29T23:07:26Z","title":"f-Divergence constrained policy improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00056","snapshot_observed_at":"2026-08-15T19:30:12.181202Z","title":"and Peters, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.181202Z"},"links":{"cited_paper":"/paper/1801.00056","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:63b8217e21e4f29b379096c42a869f40da5df0935f900c45995fe39371aae1da","observation_id":"eb18e4d5-08a8-4f09-94c2-5e69bd3e69b2","resolution":{"observed_at":"2026-08-15T19:30:12.181202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-15T19:30:12.189554Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.189554Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:3ed7296c0b480967bc24e635023e485ae979134cc6e33be6cd7be67f6d8d261a","observation_id":"49fcc47c-4f03-46a8-ad2b-4151366b8ad4","resolution":{"observed_at":"2026-08-15T19:30:12.189554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.773024Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"d99bbcea-c8ad-4ba4-a09a-1a680a2baec7","year":2012},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.240172Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:8505dba46859203daab720102faa4336f3b5264b50108144ac733580b64353d2","observation_id":"c144b36e-3e1f-4f92-847c-0be805b0ea9f","resolution":{"observed_at":"2026-08-15T19:30:12.776546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.622713Z","title":null,"venue":null,"work_id":"69fe213a-8632-4e5f-a92a-f9befe16d22e","year":2000},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.301038Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:f4975054e03ad25a2638846f23602315e6e2cf5c9e7db77b47ee20f0514f37f5","observation_id":"79195780-b7e0-4635-84f8-b0844585f1c0","resolution":{"observed_at":"2026-08-15T19:30:12.626030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.723686Z","title":"Furthermore, Liu et al","venue":null,"work_id":"6743b29e-f40c-4d96-b27e-f00228b093b0","year":2023},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.263778Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:b212a62ec26a80070c471cf8ccf3b474dbedac13e4f3576a4df46dc3d409018c","observation_id":"782021d3-6eed-4c5e-a70c-c2180bce2b6f","resolution":{"observed_at":"2026-08-15T19:30:12.727222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.813597Z","title":"The limitations of deep learning in adversarial settings","venue":null,"work_id":"a880d1bf-cbf6-4499-aeb0-b03cfbe5ec74","year":2016},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.217835Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:5c114fe775bf95633f39b3cee95f9a798a70c27473da59795c6fdc0d5595163d","observation_id":"64e57ba0-bf54-4121-942e-e2ca3ae7dcdb","resolution":{"observed_at":"2026-08-15T19:30:12.816986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:30:12.763118Z","title":"In the following, we temporarily set aside strict notation and represent expressions like ” R a∈A·,da ” as ”P a∈A·” when discussing continuous action space","venue":null,"work_id":"67cd42d4-c208-44a2-9209-1aa4473748af","year":2011},"citing_paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T19:30:12.248032Z"},"links":{"citing_paper":"/paper/2506.16753"},"observation_digest":"sha256:06e956a347e89f18e8fdcca7c6ef8011968edaf478514744c250227adefcfae4","observation_id":"7d1abe1c-cd0f-4f89-8225-c58d6d6f2082","resolution":{"observed_at":"2026-08-15T19:30:12.766718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16753","last_updated":"2025-06-20T05:13:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T23:41:15.565844Z","submitted_at":"2025-06-20T05:13:10Z","title":"Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.16753."}