{"as_of":"2026-08-08T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51ce534d51e4da4c42f6b55fc757d935f46dbc3994afea8a18e74d6c1e8c2a21","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:20:29.473633Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:11:29.709863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:07:28.391121Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00485","snapshot_observed_at":"2026-08-03T20:11:29.709863Z","title":"arXiv preprint arXiv:2507.00485 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20992","last_updated":"2026-07-28T03:10:03Z","snapshot_observed_at":"2026-08-05T07:14:51.726936Z","submitted_at":"2025-11-26T02:47:33Z","title":"Dataset Poisoning Attacks on Behavioral Cloning Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:11:29.709863Z"},"links":{"cited_paper":"/paper/2507.00485","citing_paper":"/paper/2511.20992"},"observation_digest":"sha256:60e20d86dd55127120660a73a800a6d1878d23a6f19389e595aae0c2e1a85556","observation_id":"e9f5d610-b76f-44a1-8cda-dbe946532e22","resolution":{"observed_at":"2026-08-03T20:11:29.709863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00485","snapshot_observed_at":"2026-08-03T04:24:01.980022Z","title":"Pnact: Crafting backdoor attacks in safe reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05121","last_updated":"2026-06-11T11:19:52Z","snapshot_observed_at":"2026-08-07T15:00:36.420880Z","submitted_at":"2026-02-04T23:12:22Z","title":"Trojan Attacks on Neural Network Controllers for Robotic Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:24:01.980022Z"},"links":{"cited_paper":"/paper/2507.00485","citing_paper":"/paper/2602.05121"},"observation_digest":"sha256:dea82474fca0cf71eb2864f12d38ee2be4635ed85d75fa1dbe90782138f2abc3","observation_id":"ed111060-4680-4267-9b22-ee791dc26641","resolution":{"observed_at":"2026-08-03T04:24:01.980022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.00485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00485","snapshot_observed_at":"2026-07-03T00:07:28.391121Z","title":null,"venue":null,"work_id":"284b82c6-9d76-40c8-98f6-1d09cc597cbe","year":2025},"citing_paper":{"arxiv_id":"2606.09559","last_updated":"2026-06-08T14:33:40Z","snapshot_observed_at":"2026-07-06T23:48:53.420827Z","submitted_at":"2026-06-08T14:33:40Z","title":"Safe-RULE: Safe Reinforcement UnLEarning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T17:28:09.686163Z"},"links":{"cited_paper":"/paper/2507.00485","citing_paper":"/paper/2606.09559"},"observation_digest":"sha256:2af83078fc810a419ca4e77654537105800746a4ab8a80d51d698b9283e93687","observation_id":"a0217317-2144-4599-956a-f6d5e1852ac3","resolution":{"observed_at":"2026-07-03T00:07:28.392658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00485/citation-record","integrity":"/paper/2507.00485/integrity","json":"/paper/2507.00485/citation-record.json","paper":"/paper/2507.00485"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.669811Z","title":"Constrained policy optimiza- tion","venue":null,"work_id":"a5a42e55-ccaf-4e05-92bf-8ec8bfe69feb","year":2017},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.382296Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:904dda953732b719e34de530e69a1a3007ba0c9a1f3aff21e52232aa91254851","observation_id":"811bcd8d-b9a8-448b-8aae-9c2e93087fd6","resolution":{"observed_at":"2026-08-06T21:20:30.673697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T21:20:29.412845Z","title":"Benchmark- ing batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.412845Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:9f8ae50cf4455aa72613d3426c7c8809694896561070dd0757a4eb0cfc8b20c9","observation_id":"7d838393-106d-4239-9e0d-dc73312485de","resolution":{"observed_at":"2026-08-06T21:20:29.412845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.671263Z","title":"Enhancing the robustness of qmix against state-adversarial attacks.Neurocomputing, 572:127191,","venue":null,"work_id":"54cc440d-97ef-4a62-9bc5-ef95d1f7043e","year":2024},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.422276Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:cb1c81493774adb2bd10d35a3eb6662ee8865b4ad67fdb3693bcbab798e2912f","observation_id":"0b917f32-af8c-465d-89e6-100f6087d487","resolution":{"observed_at":"2026-08-06T21:20:29.674761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.661738Z","title":"Robust training in multiagent deep reinforcement learning against optimal adversary","venue":null,"work_id":"daf2777c-a00d-4681-9df3-b6b9f7043e6c","year":2025},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.425982Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:c01ec21e1ba8fd74fe17ee93e2995d56000b4de7211d62e8b9042e0201879ef7","observation_id":"2cb0052d-2385-4b95-8162-4339f3f95b34","resolution":{"observed_at":"2026-08-06T21:20:29.665359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.629631Z","title":"Backdoor attacks on safe reinforcement learning- enabled cyber–physical systems","venue":null,"work_id":"a3cf0ae9-d482-4abf-95ba-c1ab556a7e8b","year":2024},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.435260Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:e53420f698fdc47febe2c5d5fc4778d8320ee13ff6c49c23059faedb8e68289c","observation_id":"cb575ed0-9d50-41b5-bbc9-64257d2373f2","resolution":{"observed_at":"2026-08-06T21:20:29.632972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.618316Z","title":"Trojdrl: Evaluation of back- door attacks on deep reinforcement learning","venue":null,"work_id":"1fb68228-2878-4f59-83a7-8f7bb183d7ae","year":2020},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.437848Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:af24d8a2f7e46078c9f00426fedda1feb15b638fef764c55dddd3bf2f9801339","observation_id":"a9bf24f5-be90-40d1-9626-508c8ce35f1a","resolution":{"observed_at":"2026-08-06T21:20:29.621937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.608009Z","title":"Con- strained variational policy optimization for safe reinforce- ment learning","venue":null,"work_id":"2a97f6cb-4681-4679-b34c-281d3d06feab","year":2022},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.444969Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:3d086fed67454f2655be80491a020ac18a42d7a1da885e75c27be7df56bae5e1","observation_id":"95836e9a-628d-41a0-afd8-5ef045ce71b3","resolution":{"observed_at":"2026-08-06T21:20:29.611753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.598682Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"9db5a742-266d-4f7d-8c09-81609cd805f1","year":2018},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.448131Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:f9e2ee8bbc4a89ab51b045eafddaa34ce301eb46d2a6dc14f2bc78468a3b5365","observation_id":"7b450561-be08-4f34-a4e9-55a1dec67e0a","resolution":{"observed_at":"2026-08-06T21:20:29.601839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.587970Z","title":"Marl sim2real transfer: Merging physical reality with digital virtuality in meta- verse","venue":null,"work_id":"81d74c61-147b-44f3-b932-fcfbfacc7f15","year":2023},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.451164Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:9aa47ed239c168df2994f91f2b86659a9299cc8decf53a82984d7f400dbfae05","observation_id":"dd5e120c-00f2-4d39-b49c-0cc62563a593","resolution":{"observed_at":"2026-08-06T21:20:29.591243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.577070Z","title":"Responsive safety in reinforcement learn- ing by PID lagrangian methods","venue":null,"work_id":"9d4c7af9-5d07-4391-bc29-4f272415c8a0","year":2020},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.454841Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:50c302454044b66d21798f8d9721c4ba613d62b6a7c5183895c06da1ab4047db","observation_id":"7b95e5ce-3118-4800-b57f-0e94d1ee0e4c","resolution":{"observed_at":"2026-08-06T21:20:29.580573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.567893Z","title":"Mankowitz, and Shie Mannor","venue":null,"work_id":"18f434a9-a467-4530-89ac-946f72d579f0","year":2019},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.458015Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:4ce2a4499efa95d52f396f9ecfcf4650801795f6fc3f7a22956a7b171b3b292b","observation_id":"23b3a5a9-d5fa-49ff-967e-d5a4953c7e70","resolution":{"observed_at":"2026-08-06T21:20:29.570764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.558205Z","title":"Backdoorl: Backdoor attack against competitive reinforcement learn- ing","venue":null,"work_id":"a5c7707f-3c8f-4527-b7b9-812c6e15e583","year":2021},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.461226Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:9caf98b9dc398199ecaf067c51e4991f1a6aa6532fd96454bd1f2c6d493990e5","observation_id":"318e91ba-365c-41eb-aefa-2ba262f9fbc5","resolution":{"observed_at":"2026-08-06T21:20:29.561421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.548852Z","title":"Partially observable mean field multi- agent reinforcement learning based on graph attention net- work for uav swarms","venue":null,"work_id":"5a4a1e87-d413-4aa9-9981-e1da87a9df05","year":2023},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.466839Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:d7870d7f3c7b4ea973ea0ec518a75469f202899d52861f8d3dac2782cd57b7eb","observation_id":"6c2d81ce-7fbd-4c6a-97b1-bac205a7e6c5","resolution":{"observed_at":"2026-08-06T21:20:29.552002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.538804Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"0122f4ec-5c5c-4dcf-882e-8e40dc9ad27b","year":2020},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.469695Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:7f092b48810f810649d9952f3b13aeccba2427589f1e4491fd1135ea1ccb1aa8","observation_id":"ca4b967f-7f06-4d96-b152-23f71921dd26","resolution":{"observed_at":"2026-08-06T21:20:29.542180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.526454Z","title":"A robust mean-field actor-critic rein- forcement learning against adversarial perturbations on agent states","venue":null,"work_id":"4fd4d12f-59d7-4fa7-8dfe-879046420840","year":2024},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.473633Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:40204dade118369106595f67df05b6a9f3bfa38a4ff2e5e62933e636695dd675","observation_id":"97f76f8e-0a90-4f66-9a50-aacb331ddb06","resolution":{"observed_at":"2026-08-06T21:20:29.531670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.639410Z","title":"Safety gymna- sium: A unified safe reinforcement learning benchmark","venue":null,"work_id":"a46e1681-c8e0-462d-bc86-ee40862e2cdf","year":2023},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.431771Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:32c50c27617fda4e037f1ff9ee16f89df153865915e6e05781a15645793e315b","observation_id":"3ebc93a3-82df-491e-a0d5-d1d7ab5a2b9c","resolution":{"observed_at":"2026-08-06T21:20:29.642657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.647399Z","title":"Constrained policy optimiza- tion via bayesian world models","venue":null,"work_id":"86de594b-ca68-4dbc-8ba7-cfc04419747a","year":2022},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.388852Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:021e551d9edd873cc124ee04b5daef3bbe30053c3bf81662bcf1ed51b0ebbfb1","observation_id":"6f5a24a6-b521-4a36-b29c-d2e8c3d88137","resolution":{"observed_at":"2026-08-06T21:20:30.651583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.615112Z","title":"Context-aware safe reinforcement learning for non- stationary environments","venue":null,"work_id":"35bef860-53c3-4c5f-820c-3540236cd092","year":2021},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.399212Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:4b26388bcc705bb9f633f58c6dbf644914751497a885004244c7dddf99cdc2c7","observation_id":"c2955608-c556-44a5-96dd-e1e86def435f","resolution":{"observed_at":"2026-08-06T21:20:30.618862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.625417Z","title":null,"venue":null,"work_id":"355e32c8-454c-4753-bd72-186d097aea82","year":2005},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.396002Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:e71c1188e4588f2aefd7d0ba53ea6dbce5fa51df6cb1233af4e1f251e446ad35","observation_id":"0b3580d5-cdf5-45dd-8836-748dda812fe9","resolution":{"observed_at":"2026-08-06T21:20:30.629309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.682188Z","title":"Policycleanse: Backdoor detection and mitiga- tion for competitive reinforcement learning","venue":null,"work_id":"ea6ba9a1-7bd3-418f-bae7-135061081c6a","year":2023},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.419570Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:6dae7619b4a5da96617ee5a6dd3806e30676155b37431d60800c6ae56c3b09ac","observation_id":"b5722f24-2869-49cc-9651-df085326ca0d","resolution":{"observed_at":"2026-08-06T21:20:29.686052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.658540Z","title":"Constrained markov decision processes with total cost criteria: Lagrangian approach and dual linear program","venue":null,"work_id":"677b8fbf-2cb1-4ead-b7e9-e9db08fcc3bf","year":1998},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.385947Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:223b830f702a9a5005a4a92f1bf535ba072d1ab67165f3b1ad6df07c8deee3d6","observation_id":"67b1924f-a84d-4766-b9f7-3a45409974a0","resolution":{"observed_at":"2026-08-06T21:20:30.662359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.702682Z","title":"Badrl: Sparse targeted backdoor attack against reinforcement learning","venue":null,"work_id":"a1ed6c40-ce3b-4f13-abfc-4e6e1883545e","year":2024},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.409436Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:01a1f19167cfe5ce3149d95740d842a708aded649e66dd0c5ebe4be371a75873","observation_id":"66f54b19-7271-4baa-84ea-a223e1c319cc","resolution":{"observed_at":"2026-08-06T21:20:30.585085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.692039Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":"1c782869-42a0-4c91-be08-5c20206bba9c","year":2015},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.416677Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:a962171f2249227ebe7e9b67b486de4ff58eaf5298ef44484104a61b56942b81","observation_id":"2eaad8fe-ae38-46ee-bc78-4adf6c952ebe","resolution":{"observed_at":"2026-08-06T21:20:29.695760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06480","last_updated":"2018-02-19T01:25:26Z","snapshot_observed_at":"2026-08-07T14:58:21.647457Z","submitted_at":"2018-02-19T01:25:26Z","title":"Accelerated Primal-Dual Policy Optimization for Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06480","snapshot_observed_at":"2026-08-06T21:20:29.441050Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.441050Z"},"links":{"cited_paper":"/paper/1802.06480","citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:3881bf412176d2771f468638f4b58d2794757e54df5d7e3a2bc2a031c45fd573","observation_id":"7f1d205e-0fd2-4481-bc3e-a208e4e89b08","resolution":{"observed_at":"2026-08-06T21:20:29.441050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03152","last_updated":"2020-10-07T04:22:45Z","snapshot_observed_at":"2026-07-06T10:02:11.078138Z","submitted_at":"2020-10-07T04:22:45Z","title":"Projection-Based Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03152","snapshot_observed_at":"2026-08-06T21:20:29.464007Z","title":"[Yang et al., 2020] Tsung-Yen Yang, Justinian Rosca, Karthik Narasimhan, and Peter J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.464007Z"},"links":{"cited_paper":"/paper/2010.03152","citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:39910f2630ecd17daeb1822fb8bf1d4b864075f2d27334fd8207be14a3c16806","observation_id":"c45262ad-fe4e-41fd-b2cf-23cf9243c6ec","resolution":{"observed_at":"2026-08-06T21:20:29.464007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.636408Z","title":"An online actor–critic algorithm with function approximation for constrained markov decision processes","venue":null,"work_id":"92ac004e-53e4-4b32-bb80-d64f7775a9a3","year":2012},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.392517Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:1f083b8ef2b63e79148373ec4d8ea6552fa74d6f727f0a951b6bac8289a21f69","observation_id":"07ac8b65-1c42-4f9a-994f-04fea91ff6ba","resolution":{"observed_at":"2026-08-06T21:20:30.639990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.604084Z","title":"Robust multi- agent reinforcement learning method based on adversar- ial domain randomization for real-world dual-uav co- operation","venue":null,"work_id":"ef2d0282-7f71-48ee-9947-34cb9ef34fad","year":2024},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.403636Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:8f59323f69ae2b84fd44a2e9f5c550855f6333a591d83c0ef3cd734f986cef30","observation_id":"3a957276-6d76-4cf5-89eb-9270ba8b54bd","resolution":{"observed_at":"2026-08-06T21:20:30.607737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.593773Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":"baf53d65-9a87-4adb-8b77-4d5f6b7a7a9a","year":2018},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.406412Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:bd494c7294ebebf2f299310a37104d2e9e71a62f41827047ed51e390abab6f72","observation_id":"f538e655-37da-4bcc-b5d4-43d5ddcaee51","resolution":{"observed_at":"2026-08-06T21:20:30.597019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.649584Z","title":"Consideration of risk in re- inforcement learning","venue":null,"work_id":"09548f7b-8533-496a-9332-3f0b682abf89","year":1994},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.429077Z"},"links":{"citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:d68e136f4dcacaed33d1e790cc09f93cddd1303dd54ee12ebe003fcac5c2e2d5","observation_id":"a0ef48ee-e03a-45d8-917b-b50a1fb35b02","resolution":{"observed_at":"2026-08-06T21:20:29.653990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:58:55.028615Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2507.00485."}