{"as_of":"2026-08-09T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57e77b955e9dc8c80088547ccddabebc00fa6f4fabfc7ead64d872e9d09e51df","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:25:09.694462Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03372/citation-record","integrity":"/paper/2507.03372/integrity","json":"/paper/2507.03372/citation-record.json","paper":"/paper/2507.03372"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:15.179398Z","title":"Reinforcement learning based recommender systems: A survey","venue":null,"work_id":"eec74d7b-281d-4502-818e-9a3b0e3ac154","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:06.596567Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:c1305f5d0409ffe702c52b1d70c503e503c850d46194d778907d05bb6b004b4a","observation_id":"98c75044-eebe-4946-94c5-7ce03341af9d","resolution":{"observed_at":"2026-08-06T20:25:15.221666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:15.029156Z","title":"Safe learning in robotics: From learning-based control to safe reinforcement learning","venue":null,"work_id":"a5ab9234-6eb0-48ac-83fd-a3edf1948e5e","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:06.686440Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:d1edcf4236d1d25e3d5275b5e6c1f58565cd14e543842981d2e84ef35adcb8c0","observation_id":"9c0cddd7-2873-4880-b392-cd6d4553824d","resolution":{"observed_at":"2026-08-06T20:25:15.105289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:14.890805Z","title":"Certifiable robustness to adversarial state uncertainty in deep reinforcement learning","venue":null,"work_id":"28ffabcf-cade-4fd0-92e9-ea36844a910c","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:06.828541Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:6a26f0d4165a7bf573a8c86bc919189a8f598c1e02c431d0f1c6e6a96c1a7d13","observation_id":"6ea39787-c015-42f7-97d4-87ef7aa49182","resolution":{"observed_at":"2026-08-06T20:25:14.960200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:14.635784Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":"3df5151d-4329-409a-9e80-0d2364de7999","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:06.954194Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:6a1acc3c764c2562acdf171b43e5f5641506d36b4e9a0eed27107a1ab7138300","observation_id":"caff1573-0394-4bcb-b9fa-a300889a184c","resolution":{"observed_at":"2026-08-06T20:25:14.759489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00887","last_updated":"2019-11-22T07:12:00Z","snapshot_observed_at":"2026-07-06T08:34:21.494347Z","submitted_at":"2019-11-03T13:44:42Z","title":"Online Robustness Training for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00887","snapshot_observed_at":"2026-08-06T20:25:07.041555Z","title":"Online robustness training for deep reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.041555Z"},"links":{"cited_paper":"/paper/1911.00887","citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:cc8f5352f77f0c1a9113011a1a927ade74691fd9486376f24a51b7bf7ffd0dfc","observation_id":"7d63bf7e-49bc-4d6c-b52e-e2b52d525f58","resolution":{"observed_at":"2026-08-06T20:25:07.041555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T20:25:07.152922Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.152922Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:5253a3377653756665d36fbd3ad10d4f33df9296c597e9810d907d5ee9e5c277","observation_id":"9943ad94-02b5-4333-bd8c-c41cc21ea8b6","resolution":{"observed_at":"2026-08-06T20:25:07.152922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:07.297412Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.297412Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:a3e8f04810665afae4ee9d9a9533e7693ca6ee64e67a7a6afb65c2f607df0497","observation_id":"dbc958f2-f026-4e4a-ba4b-5ff51183c325","resolution":{"observed_at":"2026-08-06T20:25:07.297412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:14.387413Z","title":null,"venue":null,"work_id":"b7e4dddd-9fef-4aa2-a07e-735cd37da244","year":2017},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.392711Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:f1f79638ab5a43c16bcf6583fc7b2edbcc52c67a247e8e7543fb25e9996dc5de","observation_id":"1cba9500-13f1-4507-9147-7826c7103d52","resolution":{"observed_at":"2026-08-06T20:25:14.501113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-06T20:25:07.512173Z","title":"Adversarial attacks on neural network policies","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.512173Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:1181d690d3e002f1f817b80de5685a62241b07f82a57ca2a22d7e3809aecbac3","observation_id":"2dcf1263-1545-4cc2-b7d7-93d9f92998be","resolution":{"observed_at":"2026-08-06T20:25:07.512173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:07.618873Z","title":"The 37 implementation details of proximal policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.618873Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:8e4003777731f0d4daf9531bf42fbf9a7c1b6cf9385de77bb2227555def23bbd","observation_id":"9a6075f1-d532-4554-b8a6-80ae8c4bdf95","resolution":{"observed_at":"2026-08-06T20:25:07.618873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:14.201618Z","title":"Cleanrl: High-quality single-file implementations of deep reinforcement learning algorithms","venue":null,"work_id":"049adbea-0c17-4894-a744-da97557dc22b","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.772234Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:7f200be97184bc62686a57ef9108b7914d4858daf4c212f1480afb9d25f37163","observation_id":"53f44c71-7d3a-441d-b1aa-caa90f6f63e8","resolution":{"observed_at":"2026-08-06T20:25:14.252479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:07.885692Z","title":"Challenges and countermeasures for adversarial attacks on deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.885692Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:ff2f1b9a253505af41ab3315f8cf3075907db910810ce691abf921af6a48d9b3","observation_id":"e464de02-4f51-4883-a397-cc3af2a83e52","resolution":{"observed_at":"2026-08-06T20:25:07.885692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:07.996826Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:07.996826Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:fcab4e3d2a13c29ca28bf07ad66bda39d916460065097e6b8a4c5b4a5c337bcd","observation_id":"a3cfaeaf-d03f-4b78-af8a-57a8459b7479","resolution":{"observed_at":"2026-08-06T20:25:07.996826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:14.031621Z","title":"Spatiotem- porally constrained action space attacks on deep reinforcement learning agents","venue":null,"work_id":"191ea207-b402-4350-9731-d8f913371f5d","year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.066905Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:d04afb9a67330513b3a51c55be6ca53c51fb4862654fc167f27b63b0dcdbe1c6","observation_id":"44e43070-404d-4db8-bdd2-7d4cb313cc98","resolution":{"observed_at":"2026-08-06T20:25:14.094582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:13.897169Z","title":"Efficient adversarial training without attacking: Worst-case-aware robust reinforcement learning","venue":null,"work_id":"7752e333-2b44-4f28-a70b-c190ffc1d935","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.139880Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:9eb4c8cb2ab502aeee6eb0aeaf7c06624088281e9d6bae93ab364da4ecf5d9dc","observation_id":"a10a8786-ad85-484e-b1cc-423d7da93dcb","resolution":{"observed_at":"2026-08-06T20:25:13.974490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:13.762311Z","title":"Provably efficient black-box action poisoning attacks against reinforcement learning","venue":null,"work_id":"e201db84-5ca8-4ab2-ac20-b6fd95195e72","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.198726Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:7611c451ad4ec99fb0bb6b4841d313069feb1a976c4c6b7f71a188975036f0f8","observation_id":"0b0ba7e6-65fc-4a8d-b3a3-8a788f77ac76","resolution":{"observed_at":"2026-08-06T20:25:13.807962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:13.613415Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"daefb3b2-1bac-43ae-953a-a68b48706cb2","year":2018},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.277644Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:0be5408c9b08027e5be530a32f53595e05b59e1fc0a82faa6cff25a5b99e3f5e","observation_id":"c7fdbf05-08ce-4686-8335-78b600678f61","resolution":{"observed_at":"2026-08-06T20:25:13.649352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:08.372071Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.372071Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:e44c714c6275c120146acff593fcedad850096a7f037b5c0d51990116fbd2283","observation_id":"c0c52c15-98af-43dc-b174-6a9692e6d100","resolution":{"observed_at":"2026-08-06T20:25:08.372071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:13.445706Z","title":"Robust reinforcement learning","venue":null,"work_id":"b201695d-5ed4-4286-ab5c-ad1089649143","year":2005},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.460059Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:e88b328e29b20e053354cd196960b8332277c857a31472ac2f3c37639fb5516a","observation_id":"47840ea9-ebe9-4d31-a407-a54d4a0d794d","resolution":{"observed_at":"2026-08-06T20:25:13.511735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:13.205377Z","title":"Assessing transferability from simulation to reality for reinforcement learning","venue":null,"work_id":"38bfc8a0-50b0-445b-b51e-844d71bab8de","year":2019},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.546420Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:cc1c4ee7060512becd10a2fa23f7da7b78b36abfba897cbad05689c356b49a84","observation_id":"87f4595a-ac59-4e40-88b9-c9c7c1bd5633","resolution":{"observed_at":"2026-08-06T20:25:13.350240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.977567Z","title":"Robust deep reinforcement learning through adversarial loss","venue":null,"work_id":"8247669a-de4a-4177-975d-9646c09b6fd1","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.594896Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:3366afa6f43821c0a010fd286ed37537eb6cb216d16824c8afe724aa241c9902","observation_id":"0d15a0f3-b53f-4456-b67d-291feaba836a","resolution":{"observed_at":"2026-08-06T20:25:13.050191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.812174Z","title":"Characterizing attacks on deep reinforcement learning","venue":null,"work_id":"fca3c319-a1c9-4639-ad23-8011df44c7aa","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.651218Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:1ef51b081299218b260258dcba1465d6b99e891d1ed193ba7c764192aa2a5d78","observation_id":"e6659db3-eda5-44b5-b5d2-b16b34babfa5","resolution":{"observed_at":"2026-08-06T20:25:12.900816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.674022Z","title":"Policy teaching via environment poisoning: Training-time adversarial attacks against reinforcement learning","venue":null,"work_id":"e670e055-6343-4169-bea4-207d2fb666d2","year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.722490Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:724ddfc0606c82001f31b567a2dd783a1181bb120d6bc3656e9a63dce4015e6c","observation_id":"3815608d-00c1-4f3d-b6af-766565bfedc9","resolution":{"observed_at":"2026-08-06T20:25:12.720848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.516358Z","title":"The security of autonomous driving: Threats, defenses, and future directions","venue":null,"work_id":"ac328d25-ffc3-43b5-81b3-c966ab9a39bc","year":2019},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.795215Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:3d304c83cd0a239b243e3f05fa9bfe14649f335e383a380c2b88b5e5f9ba017b","observation_id":"94d03389-a69b-4bc9-b3ad-29fe3d273a85","resolution":{"observed_at":"2026-08-06T20:25:12.587133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:08.834445Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.834445Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:b373d12f3c20721c1abc6cad5e8df70671db5a4a0a1a455d55829c2a4c9d5a02","observation_id":"3bbd293c-bd7a-49d5-ba9e-9413aa00170f","resolution":{"observed_at":"2026-08-06T20:25:08.834445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.344343Z","title":"Improving robotic machining accuracy through experimental error investigation and modular compensation.The International Journal of Advanced Manufacturing Technology, 85:3–15, 2016","venue":null,"work_id":"8094e563-9346-45ed-9375-4bc0ba0f0eb1","year":2016},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.885713Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:a130b5074414f215ad233318f8c74777d194b5f57ec6250212a99df9d2d3130c","observation_id":"3611f0eb-36b1-410b-b54d-49b501b96fe0","resolution":{"observed_at":"2026-08-06T20:25:12.445899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:25:08.934071Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.934071Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:ed789bf9bdd4bc511facfba30142f36ab6b43dcdc401285bfccddfde79488fef","observation_id":"a7d3b7ca-75f7-4bcf-8e53-e080d83928f5","resolution":{"observed_at":"2026-08-06T20:25:08.934071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:12.180518Z","title":"Towards facilitating empathic conversations in online mental health support: A reinforcement learning approach","venue":null,"work_id":"e03ca7f4-bd90-49cd-bd75-315c180a0555","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.949626Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:a3f75a704a678032d22eeed819d37d31031f9fec245bab1d12808c2e206b69ee","observation_id":"44a3e993-a13a-4438-b3c0-8aaf2e46b642","resolution":{"observed_at":"2026-08-06T20:25:12.264004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:11.994421Z","title":"Certifiably robust policy learning against adversarial multi-agent communication","venue":null,"work_id":"71194efa-36c7-4179-b850-1d97eddb212b","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:08.990285Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:84c5fe49501de1a2ee0417037843810944e059dc2e5daef98fd17bde0b021bcd","observation_id":"b967c140-f346-4417-b157-dbb834955c42","resolution":{"observed_at":"2026-08-06T20:25:12.092515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:11.822073Z","title":"Certifiably robust policy learning against adversarial multi-agent communication","venue":null,"work_id":"a2750158-7545-475f-8218-ec6a4177613a","year":2023},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.047922Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:1b058cd6677392443575a2ae14ccbb4b70a4126ad20b80a19a825bc6885e1e36","observation_id":"33ec714b-5e8c-447e-b95f-3630aa23a6ec","resolution":{"observed_at":"2026-08-06T20:25:11.940979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:11.630059Z","title":"Who is the strongest enemy? towards optimal and efficient evasion attacks in deep RL","venue":null,"work_id":"4f331640-2f11-499e-87a1-987a178707c0","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.087983Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:f1c09aaa2fe752c0b16491487cdeb8a28dfefdf13386909de500760c788ce366","observation_id":"ea130755-e901-474a-8744-0245ecee41df","resolution":{"observed_at":"2026-08-06T20:25:11.706675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:09.150195Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.150195Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:fbc29820a0493a7ce56e1b1b340b147a89b9fe20bd502da570b8fe8f2946296d","observation_id":"f76b6a1e-e35c-444f-9a36-5e76b5e90792","resolution":{"observed_at":"2026-08-06T20:25:09.150195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:11.431194Z","title":"Action robust reinforcement learning and applications in continuous control","venue":null,"work_id":"26c9b7e6-8fc0-4c42-92d4-41c50a2bf549","year":2019},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.207310Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:d884d0717b92805680f43168a1019b807a278c42da19099a5d96c7cb773754d7","observation_id":"2b867fe0-f00b-40ac-a803-ad3a36575da2","resolution":{"observed_at":"2026-08-06T20:25:11.495463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:09.241906Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.241906Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:989a2ddf6baf4efbb95c908733547425b12f1bff1ccc0b63e543dea2b5f2632e","observation_id":"6323ea20-c761-4d13-9fbf-80fb45deebed","resolution":{"observed_at":"2026-08-06T20:25:09.241906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:11.197254Z","title":"Policy gradient method for robust reinforcement learning","venue":null,"work_id":"5ff848da-00f7-4ab5-993f-1f84d9031da9","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.294486Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:aaf1e749b2810fc79231eb98f01a9a903b49aa95c2e55e2a1b011e3377af26b7","observation_id":"4086eb8d-ac23-4e96-9a29-ee8438a40774","resolution":{"observed_at":"2026-08-06T20:25:11.323799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.982439Z","title":"CROP: Certify- ing robust policies for reinforcement learning through functional smoothing","venue":null,"work_id":"f9907401-4e14-4bd0-9937-7ec7162fa850","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.363296Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:51949ee158fa872320d05d955a1bfb5e6fb7699f044067518b4d6d19e7e7d988","observation_id":"e99860d5-e676-412f-b7bc-4ca207a87a21","resolution":{"observed_at":"2026-08-06T20:25:11.035690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.828775Z","title":"Robust deep reinforcement learning through bootstrapped opportunistic curriculum","venue":null,"work_id":"9ed631a0-8abf-4b88-97fa-f64bb84f91d0","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.388391Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:a3db099cb8fd614f7c48180db86d0cef1e8a3b35af39490a22ffbcdc1feae59d","observation_id":"ca13e76a-64db-4e37-9bd1-b275932fc9a5","resolution":{"observed_at":"2026-08-06T20:25:10.903033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.660797Z","title":"Taac: Temporally abstract actor-critic for continuous control","venue":null,"work_id":"4c01e9cd-6771-4f4c-a509-0120c96102a2","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.444717Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:628f82cce2b67ddce1a2e6a51e0924bd0ec19056684d5428bbecc544632590f2","observation_id":"b5b0e446-6c9a-4989-a042-cd08b4221c80","resolution":{"observed_at":"2026-08-06T20:25:10.739145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:09.492261Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.492261Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:03fc6763a1146db895b30fb5e99888709c0b5f25c855e162e2da9a0b24d5957f","observation_id":"1664edd7-da4d-4e27-bbde-ce91f91b6f18","resolution":{"observed_at":"2026-08-06T20:25:09.492261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.504471Z","title":"Robust reinforcement learning on state observations with learned optimal adversary","venue":null,"work_id":"69c68742-f820-4eca-ac6f-36ca5c95800b","year":2021},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.519045Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:f467f1db32f39c4be45aad98030f04f93756a420a05346a06ac442f0cd5f3e3e","observation_id":"92a427cb-3d4c-4772-be7c-b26a64e2dedb","resolution":{"observed_at":"2026-08-06T20:25:10.561888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.371589Z","title":"Robust deep reinforcement learning against adversarial perturbations on state observations","venue":null,"work_id":"cc498a31-bb8b-44d3-b81b-cfe79c4c0a46","year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.578035Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:2b08154ea5b718e39c85207e53c18e913adbc68bb78cfa36ed2045f8c220074a","observation_id":"c07a37e2-7e1f-4c66-9f37-2339c35d2183","resolution":{"observed_at":"2026-08-06T20:25:10.429921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.159730Z","title":"Adaptive reward-poisoning attacks against reinforcement learning","venue":null,"work_id":"9ec87385-78e0-4bc8-8977-2a702fd0cf61","year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.635734Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:3b8742772859ad24c1c4c28e9cae661a5765e40bc29761948eb6459b35cfb3b2","observation_id":"9d2ed019-a327-4c39-9998-5c210206e090","resolution":{"observed_at":"2026-08-06T20:25:10.215720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:10.007601Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":"c6ec5638-287b-4a05-acce-a5df69bd7a68","year":2020},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.661163Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:1514019ff7baf35e5113414b1e5da0de9b09d557c9ca0817f2424ec291c9d377","observation_id":"dac71140-d879-4c66-acb0-e7b5eb92cdcb","resolution":{"observed_at":"2026-08-06T20:25:10.069216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:09.819595Z","title":"Cadre: A cascade deep reinforcement learning framework for vision-based autonomous urban driving","venue":null,"work_id":"b7b6a43b-d0fb-4b54-9c70-e5da20d54a2f","year":2022},"citing_paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:09.694462Z"},"links":{"citing_paper":"/paper/2507.03372"},"observation_digest":"sha256:9f1f5770d846c78d9a0866fb1ccec93862b09ba7ba6cc5515d124eb0f3a490d9","observation_id":"cde022d4-24c3-4039-9dc4-a14562d2e012","resolution":{"observed_at":"2026-08-06T20:25:09.926141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03372","last_updated":"2025-07-04T08:11:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:33:21.286270Z","submitted_at":"2025-07-04T08:11:15Z","title":"Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2507.03372."}