{"as_of":"2026-08-06T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc75278a6c661159e59337dec2675d7c7f8b8865e2fadb645195d5668a0a74a6","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:21:18.863056Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00270/citation-record","integrity":"/paper/2606.00270/integrity","json":"/paper/2606.00270/citation-record.json","paper":"/paper/2606.00270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:ee9b44ebfc785f463fa0a8a5488aa385fd38d971708ccfdd054e4c7fee5b7a55","observation_id":"ce0577be-1b1d-4d92-8c8a-1ae23b36e3a2","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Bagnell, and Jan Peters","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:f27086bfc48751cc1341a582431ede2eada84ddbf458d21905627bc81931734c","observation_id":"d17ff19c-0a4a-4d91-ae44-0429fc5f8c12","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:15b66abeeb4fa6460a48c83a1e10577d32372054ed1eaed15b4d14caaec93b37","observation_id":"4fc5b070-1932-4047-8dce-93836db5b28a","resolution":{"observed_at":"2026-06-28T22:22:43.380661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Ravi Kiran, Ibrahim Sobh, Victor Talpaert, Patrick Mannion, Ahmad A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:ed6b997ff6f02f91b73b721cbfa5e20796972686661830a1556b24b362e5df0d","observation_id":"1f62b9a3-9f1b-4fc8-ba76-1b42f1523bed","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:4ace44cd10b7ef0bd9ea6227c06999bc9cca79eda19741262b347c7dce162fd9","observation_id":"13aea4b8-6ff9-4fb0-a254-2ac77af18284","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.08611","last_updated":"2017-09-03T20:35:33Z","snapshot_observed_at":"2026-07-06T05:57:03.852252Z","submitted_at":"2017-08-29T07:16:54Z","title":"Safe Reinforcement Learning via Shielding","version":2},"cited_work":{"arxiv_id":"1708.08611","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.08611","snapshot_observed_at":"2026-07-03T12:48:11.098500Z","title":"Safe Reinforcement Learning via Shielding","venue":"cs.LO","work_id":"f8d9458b-2559-478a-b180-3f0daea682ae","year":2017},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"cited_paper":"/paper/1708.08611","citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:72245e083af2a73bd304f96960cc2396e50766f390646465541b291f80c40729","observation_id":"b8d2f4be-a950-4273-b4a5-796e9901a4e4","resolution":{"observed_at":"2026-06-28T22:22:43.383279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:73b28c51a3beff83b55bc56304cb73e4dc869431b1b277bf190b89a7c93e7517","observation_id":"27f8097c-5285-4ae7-b313-100c7694dd89","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Safe reinforcement learning using probabilistic shields (invited paper)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:46fcc1641da42f101b77f53f0d678934ae4b38d1594648739328e20fec3871fd","observation_id":"de4b09ec-8e73-46c9-b9ce-5ff0c582983f","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Safe reinforcement learning via shielding under partial observability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8584c0519a73a8d29683c8a1378725116cd6b2e7c375adcc147a4e8f2efc5e4f","observation_id":"71aa8bc3-1141-45b6-afea-67922944aaaf","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Tsitsiklis","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:54e8811cfc5fa5593b5e59ae4a772f573da0a39a8f030f1b0236998e29d5f106","observation_id":"e11f6bba-57f4-40f2-9a3c-78dd67b0dd32","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Robust control of Markov decision processes with uncertain transition matrices.Oper","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:76bd6a7840329b921d3d2a7b0d3247ea8395d085be6fe40fbff2789d14c336c8","observation_id":"5e22b803-e770-4c18-8cd5-5e9d4d352bd4","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Bovy, David Parker, and Nils Jansen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:fe081b50fe3ad7b72e57fcaeb0bee517b2e47b678cbc8a40bca19437336b449c","observation_id":"b8c5fe6d-e060-42e0-817d-3f8c2be023c7","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Robust Markov decision processes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:ee9523b73930aeeac0734e0d0db4626dfb7e310c823338f0f638c02f0073d062","observation_id":"ac785e77-2069-47f5-93d0-3235501d7ec5","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:d6e41d893dc8bc6f27c575429ef728dc83920696208b714722580e5b1e0b7222","observation_id":"477b6da7-a5ae-4b82-b04d-2e9fbf2ae387","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Hall, Zhaocong Yuan, Siqi Zhou, Jacopo Panerati, and Angela P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:a9afbb9e86e93a60afbc9308c51674bc3233fa7cf083d5eb1c6d685106dd033c","observation_id":"3b0416b9-41de-49fe-a0a2-cc335b23e419","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"A review of safe reinforcement learning: Methods, theories, and applications.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:473b5010df0f45a4d189bb521f34602810710d50b828a26016090e9756b1fe16","observation_id":"9fd790f4-3c63-4147-998e-330cf5795d89","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Shielded rein- forcement learning: A review of reactive methods for safe learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:09503256b002b14fd8f6e12d482bfc39423443a5fa31b59726fd50d0b8540636","observation_id":"c3a10ee1-984c-4dce-9b6e-20e99262e275","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Safe reinforcement learning via probabilistic logic shields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:de820db78e26416b4e5e2b800c66582473ac794c95487e2b2bfbb061ec390b96","observation_id":"b56b7022-45d2-432d-a0f0-b9c44bc49339","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Safe multi-agent reinforcement learning via shielding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8eb5303d1c30d2002f2a9bcfc192f62ba1f1eb4b0ff3d9b62bbb5c19b5d65fb5","observation_id":"8038ff36-2d01-4c6d-86b5-c0529b88f0d0","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Online shielding for reinforcement learning.Innov","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:68f5c4342f68e7cf94373abe468659a239f771929406d636448199036f67a84c","observation_id":"b4a8b5c5-5553-4c53-be2c-fece36050a70","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Shields for safe reinforcement learning.Commun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:5bcb8e08091a252ad96f1b43ec67b6f78e0bfac1a0db6be1af8a556d7077126f","observation_id":"9fcf4fe5-1195-4219-b22c-b419a9903f41","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Goodall and Francesco Belardinelli","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8d1417115d5098f6c8e32f52e7cc274bf16b4323854de114770a951425ea0ff5","observation_id":"c3943bc4-385f-452b-81e2-858ded2ad5cf","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Safe reinforcement learning in black-box environments via adaptive shielding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8db282b97dd4a2589dbc31853506a8bca22bcda5fded66cb5e8de9099ba509be","observation_id":"d10d7944-72f2-4442-9fe3-87a64e7c6012","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Learning-based shielding for safe autonomy under unknown dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:7b177cf1c9d007a0844bead9be81cda6c5d4a12e77e21eb77cb7c8bf76a57309","observation_id":"50f4470b-2379-488e-b072-72baa18e2604","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Optimization-based robust permissive synthesis for interval MDPs, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:852866f31ab0b907d00cfb61916a006fb3cde82e755bb7e82599f3030b1c7631","observation_id":"e16d9690-8f62-4826-bd9b-138dc806323b","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Risk-constrained reinforcement learning with percentile risk criteria.J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:b6c309f541d5b9eeef113917a711cad1b64f3376fe09406041138d79128d57d1","observation_id":"73865658-3428-4a0a-8429-e360d9b22f13","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Responsive safety in reinforcement learning by PID lagrangian methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:15e139f8128620f83bd9d51ab15f0b9c67158a91c98f6a06838ca68f28257838","observation_id":"56fc2446-974f-4350-b7b0-ba15e1a1c6df","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Efficient policy optimization in robust constrained MDPs with iteration complexity guarantees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:ea554e50e6e90009251fdb550debbe520b64888ad409f2e23dfd6ab16a93833c","observation_id":"e9e53553-aa10-42c1-873c-188a77b2310c","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04870","last_updated":"2020-10-10T01:53:37Z","snapshot_observed_at":"2026-08-05T13:52:51.371051Z","submitted_at":"2020-10-10T01:53:37Z","title":"Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty","version":1},"cited_work":{"arxiv_id":"2010.04870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.04870","snapshot_observed_at":"2026-07-02T11:06:53.384574Z","title":"Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty","venue":null,"work_id":"bad21a25-eab2-4415-aaac-0cf3fdd0e584","year":2010},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"cited_paper":"/paper/2010.04870","citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:1346407325d7fbeef2435e322bd9abc1078d466d74fb38e4fcc134e902199896","observation_id":"06f6d7ed-143f-4930-aab7-b72ddb9c24b2","resolution":{"observed_at":"2026-06-28T22:22:43.380251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Duéñez-Guzmán, and Mohammad Ghavamzadeh","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:87d0ee1ccb738edfc9c995f1d5ce2d3f1f53f3f90be3fbee40aeef7e66762be4","observation_id":"a078195e-fedb-48d7-b424-15fde20ce79f","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":"1901.10031","doi":"10.48550/arxiv.1901.10031","metadata_source":"pith","pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","venue":"cs.LG","work_id":"7ceaad76-df09-47a9-8289-f1e1b6704e25","year":2019},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:be61a02245a6310b2caf9634eebd1257849cdedbf37411f9084babfa62d70c37","observation_id":"3da81817-04be-4d89-afdc-8f630c1217a5","resolution":{"observed_at":"2026-06-28T22:22:43.387873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Schoellig, and Andreas Krause","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:7630cc6022b51595a59da9be1b27c93db2d639ce1cd94263ccf92482cffc7669","observation_id":"b8dfe6ce-2db3-4cee-9b1b-ce4987235442","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:c515bf480ae11e3d6199ce660866ca84eb434ecca3552edb21ebb9ec21f0e6d5","observation_id":"2b52fe5c-5ae0-47a7-92fd-8e222da09ea2","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:eba7a1278f8f09bcc93f40664c34a81362145cc596703d36f4b0e656257be876","observation_id":"a7fddf10-8d55-45c0-875b-4db38dc0068e","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Trust the model where it trusts itself - model-based actor-critic with uncertainty-aware rollout adaption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:dfb8a5fc93e447c5b2658d68e624b270c423619bf59df4acbba579bc2ed1d9c1","observation_id":"a315c0cd-f49d-40a6-9372-19fabc559c11","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"MIT press, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:1f6d416556c7e67b09bbd574709f9d0cbcc75f292c75edfebe9e930f41ecfcc6","observation_id":"518d42ff-dcbc-43be-a1a2-f40cafc87c8f","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Bertsekas and Steven E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:b5f213067cf61f067fd0b311fdf615ebedb8cdb96d5564f0a77128f77a2eed82","observation_id":"09ead503-8ee9-4a5f-ba38-17910a180183","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"The temporal logic of programs","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:bf50b7e1440123d1ab73c929bd38b04dea41c6d491ba975dba0c0120ffc2bd14","observation_id":"4f8a9959-e5b4-48e4-b44e-bbe86e2e2cd2","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Runtime verification - 17 years later","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:35dbe718dd62ec26dcc3ec074e7d593a1496201c06f603f624680f68badbd9b5","observation_id":"8cc3b92b-df6b-4e99-81b1-f570eca27c26","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Deshmukh, Alexandre Donzé, Georgios Fainekos, Oded Maler, Dejan Nickovic, and Sriram Sankaranarayanan","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:79bf488312acffb185be57edba4bb95f3616b17cf7e5207ce93dbccfed18134e","observation_id":"0343cb4f-7318-487d-ac06-35daf8b5a59a","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"What are the odds? improving statistical model checking of Markov decision processes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:355d0eafa910753f37ecdbdae94bc02cb009570c52010c6eea85b9ddb36af8cd","observation_id":"16c97f2b-c520-4095-9c9c-77333648ee84","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Data-driven abstraction and synthesis for stochastic systems with unknown dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:b39c12ac7472f1e9a82a53ccd4ff458f9d18fe799e6180206c957f0afcd82f39","observation_id":"6ef820ae-eb83-4d79-bfdb-9f04e8941eed","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Poonawala, Mariëlle Stoelinga, and Nils Jansen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:5679b72ef80cb900c22d6d7789dec481b8536143580679f917deee54bd41c3e9","observation_id":"efba3b2b-70d2-4a63-bab8-255ccc052119","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Simão, David Parker, and Nils Jansen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:4f07c0f03edff9b975a4e35d061fcb2c4064eea9e0dca9acdbcb64e7be658a13","observation_id":"eb396f91-4c75-4ff8-a07a-2cccbcc923b9","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Certifiably robust policies for uncertain parametric environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:45abdaf4b1ef1e81225a36fa1df574d2a944e66fbcdf7eb96993a888dd248be7","observation_id":"8c3ab334-fe77-4e8f-b0fb-033ed95b8268","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"The use of confidence or fiducial limits illustrated in the case of the binomial.Biometrika, 26(4):404–413, 1934","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:c16c3063e050b94b4fb04e194f0181e2ed8e423984a0b6cbc7c7e140238547d0","observation_id":"f62f4de0-3543-43b1-add9-b469b9b06be6","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Henzinger, Jan Kretínský, and Tatjana Petrov","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8eb82fd66b98fcd3b950699b9c3f9140c958337080764062df55db76e155dc28","observation_id":"44cf08c1-de43-416a-bea5-efa21038d718","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:1841099c58417f2d69b0a131516f9ebc6da2c4f841fea14e04cb615b93cb616d","observation_id":"92fa07e0-bf59-4b3d-9956-cf71ad6f6ba7","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:9213ffccbb001fc6c400de0bf3d584823b9b07a932a13e2da5f146b0b287223d","observation_id":"a7004950-2790-431e-aaa4-a931f3c42957","resolution":{"observed_at":"2026-06-28T22:22:43.385736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Goodall, Omar Adalat, Edwin Hamel De-le Court, and Francesco Belardinelli","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:26063dfe0ad8e056b6cd4ce0340799538f77300dec16e9b10418ee25bf417be5","observation_id":"013af4a1-7c88-48c3-a46d-bbbebbad59e1","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Simão, Marnix Suilen, and Nils Jansen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:eac27970ab6d85a8ac7055a36bea78eaa5fbfbb40fbc84729b23348ce1d588aa","observation_id":"f19afac9-e3aa-4d41-9bca-740a78fddb1d","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"Bertsimas and D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:84c8abd9b8c8c85cf9f95afbfc299a3703400d14b6371ee6706baef19e3ea7cf","observation_id":"a327b1a5-80d3-4740-b03d-94987c771f81","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"DOPE: doubly optimistic and pessimistic exploration for safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:77e065c929fde6497550df06fda5d479b21718b2dc137253e212977d03229e8a","observation_id":"06753848-a5d4-4be4-afbb-176d5dfb7dba","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:9c55ae6bc705f69c5d840b00b4feff713f3376b05894fbc013b8c24ffca89d2c","observation_id":"5834b1d4-67bc-4e2e-bea9-51a76364e849","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:d6cb853660ddc8e48390cb2cd9384118bbcbccb678e5c901177c4af0980300f3","observation_id":"06bc0e3f-019d-4fcb-a4c1-7c434cc3d5f5","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:d56f4ea5559a18e23456104f1828b85adb1fc37a9862b570bc0211a5f136d60c","observation_id":"93a95186-870d-4ba1-9a42-67a3e48fa688","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"∞X t=0 γtR(st, at) # −E s0a0···∼ν","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:340f2a34035d9f39bf5d1def5c9a626f47e8b9fb7bee9206c7de59c257dc742b","observation_id":"ba2ca4e9-dad7-4364-98f6-676f1cce05a7","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"ThenSis C- 2Zϵ 1−γ , γ -optimal over(M R, α)forΦ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:e95dad18ce499ca092a0b08894c7532e5e17f50a0fd6f5c2a693b7b148c16ffb","observation_id":"7e798b27-35fe-44b6-a991-b0ca0116a769","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"ThenSis C-(2Bϵ,1)-optimal over(M R, α)forΦ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:faa37c1e7a3a1e275dac7e8da51f8cd46fbab602ccffb282844568177792582e","observation_id":"fd056d68-8902-4788-a731-db0f71588bdc","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:f16fdd3fbe7f5c1d4021cfdcce3fce5c72f10725df8be22dfdba0a830e774857","observation_id":"ab086a31-470c-4fd9-8209-f92ff16f6b19","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"In particular, the shield S(MR/α,A, β ∞) is HR-(0, γ)-optimal for every γ∈(0,1] for which the corresponding return is well-defined","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8b6945e1084ee4316fd8474a66b1e578650180973cd685db416005dca0ba76ae","observation_id":"037965a4-c41e-46dd-b663-acc43c44fd91","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:bfd7b3f7c048867d8c7780127a6ef788388504717ab5025aad56b444403a170c","observation_id":"e32c32bf-1ee2-43d0-ad12-c5e889bdb296","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":"∞X t=0 c((st, qt), at) # is the probability to reachGfollowingπ, so the constraint M, π|=P ≥1−p(φ) is equivalent to Eπ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:30e1e52e5adbc74abca63cf03be0cce18aaac9abd0b39b4d4a4ab0396f61a077","observation_id":"2d0a5dbe-f5b2-41f5-a402-5a6807cc9f85","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:40680cb3da6fed236a75e9cfb159a188d10d4bc90ffbae8ea58229168be1259b","observation_id":"c40027d8-9c0f-4380-af57-c143dd2adc40","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:8a823ef890a3355751c1b7b8cc437de43acdcb30e77808d8316efb1b901e7e44","observation_id":"35d7b8fb-5d08-4cf8-ba51-27f479f7641d","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:05c32ebc86b086904138c33febbbc95c7aede3b63ad6b9994489b72560123fad","observation_id":"c76d6fad-97e9-413c-b2c3-e7d1a0d8320d","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:21:18.863056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T22:21:18.863056Z"},"links":{"citing_paper":"/paper/2606.00270"},"observation_digest":"sha256:93eb834a0a51c6f3933754620daca3eebe511ab1d5d36d17b89a3f39156aebfe","observation_id":"0d79d067-9576-4ac9-acf8-5c99fd3db0dc","resolution":{"observed_at":"2026-06-28T22:21:18.863056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00270","last_updated":"2026-05-29T19:01:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T21:44:00.781064Z","submitted_at":"2026-05-29T19:01:12Z","title":"Robust Shielding for Safe Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2606.00270."}