{"as_of":"2026-08-09T01:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1850d1a99c97e727bc27cc1aa73276e4891cc461b26653fe5c62afea35c9cc78","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:15.975362Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08961/citation-record","integrity":"/paper/2506.08961/integrity","json":"/paper/2506.08961/citation-record.json","paper":"/paper/2506.08961"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:21.575313Z","title":"Robust deep reinforcement learning against adversarial perturbations on state observations,","venue":null,"work_id":"e1d80157-fba0-4e05-bfee-338dbbf91d62","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.198412Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:72b9e23c7e92fce82624bb19f2ef6129b024fda1782c8316f5d7079c88dd0d5d","observation_id":"d86470bc-fb3e-4885-a094-9d41c24b40ec","resolution":{"observed_at":"2026-08-07T05:03:21.654923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:21.406916Z","title":"Robust deep reinforcement learning through adversarial loss,","venue":null,"work_id":"94aa09be-944b-4a13-b392-6a69aebda0df","year":2021},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.244355Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:080a7fb148512341b661af86c237841e1867a573cf33433351d133fece9e5e76","observation_id":"3a2f803d-7889-4b63-a00f-acfe202b24e7","resolution":{"observed_at":"2026-08-07T05:03:21.491341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:12.367753Z","title":"Robust reinforcement learning on state observations with learned optimal adversary,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.367753Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:55aef791c8e8b77308cb186ebb7de5c99a7e2f8434dceef2a5a2548212256e68","observation_id":"86991475-09d8-413b-9bd0-95fdbdafb009","resolution":{"observed_at":"2026-08-07T05:03:12.367753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:21.283105Z","title":"Efficient adversarial training without attacking: Worst-case-aware robust reinforcement learning,","venue":null,"work_id":"b7d47489-bcc5-4068-8a37-396ded8f392f","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.467254Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:1695a613e09670a09e500d8b9a3c5b2d6f6f6b27cb67ed543579e3e2d306d91b","observation_id":"4777871b-18f6-4438-bc4f-7c0734928890","resolution":{"observed_at":"2026-08-07T05:03:21.349230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:21.136878Z","title":"Spa- tiotemporally constrained action space attacks on deep reinforcement learning agents,","venue":null,"work_id":"a1abbc62-060a-4b6c-8b80-a55ace5a27e7","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.578776Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:203aad520e8be42b700420795625905d2f061f5ace21bb7630d77bceed28f675","observation_id":"9043475f-c826-4ee5-aca5-d3c67a3f36cd","resolution":{"observed_at":"2026-08-07T05:03:21.200116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.933163Z","title":"Ad- versarial poisoning attacks on reinforcement learning-driven energy pricing,","venue":null,"work_id":"d01cec37-9820-416a-a983-b6dd3b46400a","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.673721Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:b78521fd3ef9143a95e47b3e844abac1673d1aeb46f4f4ebd96f3db4c2c4036f","observation_id":"85866c22-13cc-452d-8ee8-7b642fd93c73","resolution":{"observed_at":"2026-08-07T05:03:21.011935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.803593Z","title":"Trojdrl: Trojan attacks on deep reinforcement learning agents. in proc. 57th acm/ieee design automation conference (dac), 2020, march 2020,","venue":null,"work_id":"d2a225e9-ad74-4d3e-af3d-df8ffe41137c","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.752649Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:f944cb2467b3b860feaa036b3f75fae235450e42b8a903e56baf639eaa4c2c3b","observation_id":"0654172c-0177-49f8-b598-ca75df466d35","resolution":{"observed_at":"2026-08-07T05:03:20.859490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.652088Z","title":"Adversarial policies: Attacking deep reinforcement learning,","venue":null,"work_id":"c97033c5-c77b-4944-b4d2-71814a8485f9","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.826950Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:e39b4c4d65d4b8c64428d45440fc5f3593dfb5d3a231f08320e3afaccd0e8b3d","observation_id":"34df9b24-27bb-447c-bf8d-0c4e5782f511","resolution":{"observed_at":"2026-08-07T05:03:20.700087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.461017Z","title":"On the robustness of cooperative multi-agent reinforcement learning,","venue":null,"work_id":"5819295c-7179-49c4-8687-7e442fce03aa","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.934912Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:807fce04d10408d02902d6aa5e5a9a4e23a095ca717ff2c32f53bc9dd388dddd","observation_id":"ef9b26a1-8be2-465e-a4d9-e1be8816d921","resolution":{"observed_at":"2026-08-07T05:03:20.528830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.250940Z","title":"Towards comprehensive testing on the robustness of cooperative multi-agent reinforcement learning,","venue":null,"work_id":"b7138567-6508-4003-ad8b-97c240f3a0d9","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.012340Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:06e505862f106fbc68435ec0bd47ac62e251bf18e45713dc71962d421dc7fd8d","observation_id":"69ea1c28-07c6-4b79-a00c-503cacb2fa1b","resolution":{"observed_at":"2026-08-07T05:03:20.353758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.100989Z","title":"On the utility of learning about humans for human-ai coordination,","venue":null,"work_id":"91f074a2-3367-4fa8-98de-ac205910268c","year":2019},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.098957Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:176028369d9e57566e6c24782b84879fc8bc6922eda99aa0775ba0c3f803f352","observation_id":"b9e84063-cb85-4c49-af03-05d45a2b9312","resolution":{"observed_at":"2026-08-07T05:03:20.177787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.896376Z","title":"Collaborating with humans without human data,","venue":null,"work_id":"60153383-7a88-4ef8-bf9c-6c217d4711f4","year":2021},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.194458Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:6ea34e60c5d1c0084317b5ff43566b53dda524b767e0436ea18cd5c2e7f9f926","observation_id":"3c9b74c5-f20c-4fab-b1f7-5f9e03aebb5d","resolution":{"observed_at":"2026-08-07T05:03:20.027578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.762813Z","title":"Coordination with humans via strategy matching,","venue":null,"work_id":"35daf3e4-116b-4e18-96f5-5a3f22816627","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.295509Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:6a570ed24ab406cae8a40671ba430903bfc0c7ab06f06234ce7f71647014cd71","observation_id":"f85f9fee-99df-4a47-8f60-a09d2fa8536f","resolution":{"observed_at":"2026-08-07T05:03:19.810030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.655329Z","title":"Learning zero-shot cooperation with humans, assuming humans are biased,","venue":null,"work_id":"bd68d204-d080-4a70-814b-a996bee3ee75","year":2023},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.392744Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:2354835174909bd7732ac6a1906be279b41c61d24e9fe553a75642ac7da3469e","observation_id":"0f0ea020-9984-4cff-bda6-a70902d37c49","resolution":{"observed_at":"2026-08-07T05:03:19.727973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.541236Z","title":"An efficient end-to-end training approach for zero-shot human-ai coordination,","venue":null,"work_id":"a7eddc56-e812-4eec-ad82-8ec6dfc051ef","year":2023},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.487564Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:c57f8f50bbb05c35adec7f3ad691c0b2d8d21a5b75535d7e7bc4ce4046a43e13","observation_id":"9859d6e5-4c23-4c4e-aa0f-ca557749d00a","resolution":{"observed_at":"2026-08-07T05:03:19.597617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.412636Z","title":"Intriguing properties of neural networks,","venue":null,"work_id":"a365d2ef-cce1-4019-8491-2103b4754181","year":2014},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.572705Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:a8b60efb2dbea187df417e9300f345271f130399c94e46f11506368538da7cad","observation_id":"b7603da6-4b28-42b4-b152-27c5a3a3f9c7","resolution":{"observed_at":"2026-08-07T05:03:19.489573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:13.650786Z","title":"One pixel attack for fooling deep neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.650786Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:ed5f6c75f955cda9213df766cf42630e83924aa7ae93f98b3bcd9ea80bbcc9f3","observation_id":"4672a7fd-39dd-41b4-ac1c-2a22002c3379","resolution":{"observed_at":"2026-08-07T05:03:13.650786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-07T05:03:13.753714Z","title":"Adversarial attacks on neural network policies,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.753714Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:ee96a419c47fef79a632d71c2df6933baf9cb1cf206c3c4b87acb095386b6374","observation_id":"78038869-8382-416d-914e-cf6bcac3c975","resolution":{"observed_at":"2026-08-07T05:03:13.753714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.338589Z","title":"Vulnerability of deep reinforcement learning to policy induction attacks,","venue":null,"work_id":"771c2e6c-3ed8-4b2d-a4b6-4543101ce496","year":2017},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.852632Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:29e11cf7a20f69996aee2302282588733fef40099390c8864f9ea6b6d98c9e3e","observation_id":"c1d73234-198a-4860-b5d9-af46f6316265","resolution":{"observed_at":"2026-08-07T05:03:19.365662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.152536Z","title":"Tactics of adversarial attack on deep reinforcement learning agents,","venue":null,"work_id":"e98cb2c8-0372-4a7a-ba71-51ac0505ae79","year":2017},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.949887Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:57b00f447c799dabd7f37b9e1d6ae2ddaf70ebbebca0a252281277b326163583","observation_id":"a2ea2805-2002-4096-b762-926bd15c5ba8","resolution":{"observed_at":"2026-08-07T05:03:19.236167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.991736Z","title":"Toward evaluating robustness of deep reinforce- ment learning with continuous control,","venue":null,"work_id":"420d5d6f-781f-46a1-a666-889e425a41b3","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.044032Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:c8003a63c65f1b285ee7fbe014967e984fe166d3a8e1b5b1fbeaefd9b52dd867","observation_id":"b3b790fe-0f87-4db3-96a0-9e8254a4c0a7","resolution":{"observed_at":"2026-08-07T05:03:19.091973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.806455Z","title":"Real-time adversarial perturbations against deep reinforcement learning policies: attacks and defenses,","venue":null,"work_id":"a37ae10e-006c-423e-94ca-e732dfc8564a","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.140454Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:2381968f5e8a70c76a64e35e81d0dafd81828c1aa943f93a7ee5aed274be6629","observation_id":"368c462c-4147-4a19-9346-d020765c110f","resolution":{"observed_at":"2026-08-07T05:03:18.902479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.650204Z","title":"Targeted attack on deep rl-based autonomous driving with learned visual patterns,","venue":null,"work_id":"9441a43e-4b2a-4845-b752-bc066ea32524","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.233747Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:fed6aecf0d492deb2d47de259dcd2d41e79c9b1590a2329d8bc959e91d591209","observation_id":"ebcade81-9881-4600-8d6f-c06dd7caecc0","resolution":{"observed_at":"2026-08-07T05:03:18.727676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.484978Z","title":"Improving robustness of deep reinforcement learning agents: Environment attack based on the critic network,","venue":null,"work_id":"2cba82a6-9164-41d3-aaad-a953423926b3","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.332651Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:e09ce3a6a99ce9335e7f79f3dc4e458434db063bdf4afc57d5b25aaa02623d9a","observation_id":"a0b4727d-9103-49f4-a2b5-9190bdd750c8","resolution":{"observed_at":"2026-08-07T05:03:18.568617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.331467Z","title":"Characterizing attacks on deep reinforcement learning,","venue":null,"work_id":"f3c34baf-8cbf-44f0-a992-b7fbf22ce5eb","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.428494Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:68212401a4a75d9fe8cc0e90a5e402ce7a656ea0b0190005e2f076bafc0819df","observation_id":"3a4285d2-6748-40dd-8c6b-b28073caae17","resolution":{"observed_at":"2026-08-07T05:03:18.410635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.167891Z","title":"Rigorous agent evaluation: An adversarial approach to uncover catastrophic failures,","venue":null,"work_id":"215d89b6-6e2c-4c23-91ce-9ab066b78efa","year":2019},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.501162Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:6346f98d1a48b03a5f97dd1aab5ac9102ba95229d07a530808095babca486a36","observation_id":"32d7a96e-f068-42fa-bcec-e86aae427f12","resolution":{"observed_at":"2026-08-07T05:03:18.240929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.964617Z","title":"Scalable initial state interdiction for factored mdps,","venue":null,"work_id":"dd19548a-bd86-489c-9ef1-f5829adc62a5","year":2018},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.617489Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:d048d5d70adadb5a7c0f87427af17543afbc2f462ac5fe1cc823decd77e43cae","observation_id":"dea8501f-af24-467a-86b3-b090ae75febf","resolution":{"observed_at":"2026-08-07T05:03:18.078622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.738849Z","title":"Robust adversar- ial reinforcement learning,","venue":null,"work_id":"4c659893-1685-40e2-97bd-919b23be74ac","year":2017},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.750823Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:b6da2fccbcb733bba41d09803491d5156d743749369536d6292d4b4e8f187441","observation_id":"a0401835-36a0-452c-b6b6-5e4e8d79ebea","resolution":{"observed_at":"2026-08-07T05:03:17.848904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.535313Z","title":"Robust deep reinforcement learning with adversarial attacks,","venue":null,"work_id":"3fc3695d-377f-40af-9a75-c202eeac5a65","year":2018},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.876051Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:4caf20d62ee491abd1837ab88815082d01f9b9041cb9b645f6547473dd7bd772","observation_id":"e57059be-a9b9-4d55-860f-ae78ba4ad68e","resolution":{"observed_at":"2026-08-07T05:03:17.603667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.268485Z","title":"Robust deep reinforcement learning through bootstrapped opportunistic curriculum,","venue":null,"work_id":"4aef37da-8f2d-4291-968f-c2cb3fdf4a89","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.944884Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:6f50494675b45b62ec533e39e9b792bb2e924a21fe313d3409f678e6582337e2","observation_id":"22854399-6b65-4b8e-85e6-aac6e4e7d4a3","resolution":{"observed_at":"2026-08-07T05:03:17.384756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00887","last_updated":"2019-11-22T07:12:00Z","snapshot_observed_at":"2026-07-06T08:34:21.494347Z","submitted_at":"2019-11-03T13:44:42Z","title":"Online Robustness Training for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00887","snapshot_observed_at":"2026-08-07T05:03:15.071223Z","title":"Online ro- bustness training for deep reinforcement learning,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.071223Z"},"links":{"cited_paper":"/paper/1911.00887","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:0242ae80d98956fdf8c0cd9532f67ffe6ea7fbff93cb3d8741cf0f9eb5ec86e4","observation_id":"93235302-0c37-49af-8fb0-29ccd104eaa9","resolution":{"observed_at":"2026-08-07T05:03:15.071223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.044757Z","title":"Certified adversarial robustness for deep reinforcement learning,","venue":null,"work_id":"99eb9374-5b69-4eff-a2be-4736b587ea3a","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.170848Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:0316025c8ab536a38a96a8c26f4d25fdc9b63e1fc7f97f7ff6ca3d46ace6f00b","observation_id":"aa5178a7-c7c6-40b2-8023-53c16bbd01a3","resolution":{"observed_at":"2026-08-07T05:03:17.152758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.880453Z","title":"Certifiable robustness to adversarial state uncertainty in deep reinforcement learning,","venue":null,"work_id":"13a0fc88-c57d-4be1-a3f8-84fa71620b39","year":2021},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.249634Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:b7af6b31eab13fa60d88dc236610facd629f584eedcc6588ec3f4d4584bee9d9","observation_id":"00025cfc-780d-42b8-91a2-c23b43385079","resolution":{"observed_at":"2026-08-07T05:03:16.967709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.674390Z","title":"Goal misgeneralization in deep reinforcement learning,","venue":null,"work_id":"10d9ff8b-b1ae-4aef-bcb5-78d5646ae95f","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.330444Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:198da2ec4fd41dc8b71bd757b6934ab0a186fbb767dca95dd543d376f5ddf88c","observation_id":"e3e99c16-15bc-4edd-a78b-5bcaf42f474b","resolution":{"observed_at":"2026-08-07T05:03:16.782204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T05:03:15.425179Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.425179Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:8e1bccaaf082f99c2545e890452927624907b42dd3237608d8cfc38004a99a1c","observation_id":"5a54132e-ac66-4a51-ae67-bc46b52996df","resolution":{"observed_at":"2026-08-07T05:03:15.425179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.577794Z","title":"Distillation as a defense to adversarial perturbations against deep neural networks,","venue":null,"work_id":"1fda1046-c663-49cd-9848-e4bcf7bd2bd6","year":2016},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.556759Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:7544412ab3e19402de34a83a4696368bdeb51db25aecabc04dea6e2b30cd985e","observation_id":"b9d474ec-8d1d-4d58-bfe0-fab03302aa12","resolution":{"observed_at":"2026-08-07T05:03:16.650341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:15.650922Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.650922Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:ba23faf318e05af81473c480bb46ef8ae5b685a30433ef2167f2cc08f933f70f","observation_id":"d0b4bba3-4947-4702-9f30-c8be4846aa0b","resolution":{"observed_at":"2026-08-07T05:03:15.650922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.412162Z","title":"Leveraging procedu- ral generation to benchmark reinforcement learning,","venue":null,"work_id":"bea9c7ef-2843-4d8f-a53c-7447b2653090","year":2020},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.749177Z"},"links":{"citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:c6b4d7d38a07dafe0081572c4bd243f90ee93ae3e3aa8f68ae81d124b1c0ef0b","observation_id":"c1808aaf-77e4-45c8-aa0f-8444e01b9494","resolution":{"observed_at":"2026-08-07T05:03:16.470332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:03:15.837405Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.837405Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:b91742510b70f0363d56207742cb1d62b49d05f721d017c909851437cccebf88","observation_id":"a50f11bd-3d61-4dc2-8ebb-fd4b8b89e2cb","resolution":{"observed_at":"2026-08-07T05:03:15.837405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01602","last_updated":"2022-11-19T21:28:11Z","snapshot_observed_at":"2026-08-07T17:49:50.114105Z","submitted_at":"2022-11-03T06:10:22Z","title":"Optimal Behavior Prior: Data-Efficient Human Models for Improved Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":"2211.01602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01602","snapshot_observed_at":"2026-08-07T05:03:16.100567Z","title":"Optimal Behavior Prior: Data-Efficient Human Models for Improved Human-AI Collaboration","venue":"cs.LG","work_id":"0da6d1e3-d714-4dce-a458-9cd1678f54b1","year":2022},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.913192Z"},"links":{"cited_paper":"/paper/2211.01602","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:7effb112ef7d8287a053d1bae86c98ff50b409b902af71d5bdaa79783c8425f9","observation_id":"1dfbd0f7-0f19-49c4-ad9c-7f56cb8a88f4","resolution":{"observed_at":"2026-08-07T05:03:16.193660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07937","last_updated":"2018-06-25T17:09:04Z","snapshot_observed_at":"2026-08-03T07:43:02.290638Z","submitted_at":"2018-06-20T19:27:59Z","title":"A Dissection of Overfitting and Generalization in Continuous Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07937","snapshot_observed_at":"2026-08-07T05:03:15.975362Z","title":"A dissection of overfitting and generalization in continuous reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.975362Z"},"links":{"cited_paper":"/paper/1806.07937","citing_paper":"/paper/2506.08961"},"observation_digest":"sha256:5a349ae5b4e2306e8b5c75491aa77d44f29a1706cd8fa7a98989b50bcad0df51","observation_id":"22d5cc47-f8bf-42fc-a1c9-62503c08eaab","resolution":{"observed_at":"2026-08-07T05:03:15.975362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08961","last_updated":"2025-06-10T16:32:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:55:47.839318Z","submitted_at":"2025-06-10T16:32:31Z","title":"Towards Robust Deep Reinforcement Learning against Environmental State Perturbation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.08961."}