{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd137f3c6dbe37d996a683089f5d9fa818e9954412a4e0592b9547b126238618","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:26.255011Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21852/citation-record","integrity":"/paper/2505.21852/integrity","json":"/paper/2505.21852/citation-record.json","paper":"/paper/2505.21852"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.794681Z","title":"Achiam, D","venue":null,"work_id":"bc6b0d53-3c47-4ced-9453-96ddd2c226f6","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.727315Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:fd63301cda0c62a5bed8fbc105015f3262150282ff4d4bd045a3434ee83dc2da","observation_id":"5caa45fb-6d24-48eb-8d23-c96a11334fb7","resolution":{"observed_at":"2026-08-07T13:30:37.889234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.605745Z","title":"Alshiekh, R","venue":null,"work_id":"0bc584fc-ca66-41ad-8c18-75575b6fd948","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.857266Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:af08c3732b1891fe11210ffd9cc4f210556ad69e39f7464ab49cc1513096361f","observation_id":"1ea45edf-8f6a-4412-922d-31cdef7e8a52","resolution":{"observed_at":"2026-08-07T13:30:37.708658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.407253Z","title":null,"venue":null,"work_id":"89f48d72-0c6d-4435-9e91-933abbc42d48","year":1999},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.994834Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b99d50021d485ad64b2bba0da47358cf4238a941a8a63fa26c77d5bce6ac0e6e","observation_id":"4ef9eeff-cff6-48f8-a334-a5a74e082f37","resolution":{"observed_at":"2026-08-07T13:30:37.456951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T13:30:20.092151Z","title":"Amodei, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.092151Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:723f6e3d242989dafd8e907808b5c01fb0305daa69d82b14b486e03f180261d6","observation_id":"7a62189b-0e02-41e8-b30e-bfed14d055d6","resolution":{"observed_at":"2026-08-07T13:30:20.092151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.109975Z","title":"Berkenkamp, M","venue":null,"work_id":"c32e4314-f87a-449c-bd1a-8e388d73210d","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.255035Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:fcc94170f75b95e585886d310a1acfc58b0a00fc6ef5e46c49045d32b7b97680","observation_id":"fc6ff8e2-20c2-4c3b-86b9-90bfad22a305","resolution":{"observed_at":"2026-08-07T13:30:37.287804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.892006Z","title":"Bhatnagar and K","venue":null,"work_id":"25cd0b84-b946-4403-95a0-ba3c5aa9ce45","year":2012},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.443200Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1cf296876a9e69234e31d8890ee4ce34f01996908e4d711550c4ca9194b6ebfa","observation_id":"74ccda11-804f-4a36-9ef6-bd3f6e011539","resolution":{"observed_at":"2026-08-07T13:30:36.998638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.708309Z","title":"Black, M","venue":null,"work_id":"558046ff-3009-455f-881d-438f625fee66","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.564755Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:81cfe66cffaee5bbb528e8b1b3e212a2ac46d101d311435a8ad3ceeeb7a5982b","observation_id":"5a2a7343-b76f-4fad-ba6e-a7991a8f7ccb","resolution":{"observed_at":"2026-08-07T13:30:36.763546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.544292Z","title":null,"venue":null,"work_id":"9ffe181c-fd90-46f6-a3ac-36d528a36cd1","year":2005},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.657269Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:5875fc7c7d246c4466a7e0e952c5d9ea4a0ad09f44b50146904c147299397cc6","observation_id":"32c8fa42-bdd5-451d-86ac-026819081ba9","resolution":{"observed_at":"2026-08-07T13:30:36.610803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.352091Z","title":"Brandfonbrener, A","venue":null,"work_id":"7abaeee2-893a-419c-a1e1-68220031d581","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.882152Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1974f034f5a6f2b79b154834f8439b51c058cd02510f1aaac7d6aa0e0024c7b5","observation_id":"8d0dea74-9e4d-4cc5-a7a2-0adfaa9148bc","resolution":{"observed_at":"2026-08-07T13:30:36.444884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.105527Z","title":null,"venue":null,"work_id":"2385b9bb-73c5-41ff-a835-66eeed5301bc","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.964019Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:6365b0d612256cb8d5426340b1c9a073084aa328b925694a99ec659dc903039f","observation_id":"4f6df005-2369-4bd7-a90c-d7466538cc85","resolution":{"observed_at":"2026-08-07T13:30:36.211969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.916849Z","title":"Cheng, G","venue":null,"work_id":"fcb66fca-a5c4-4b8f-9b60-a941a553fc3a","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.094841Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:eb5eb0ad95419f978f4fa5fb94a16efa6a4d7c266387cfdba1b2bf2ad3168d5a","observation_id":"c9dddd1d-31a7-4780-9147-a4281bd3b44e","resolution":{"observed_at":"2026-08-07T13:30:36.005293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.764193Z","title":null,"venue":null,"work_id":"f5915234-1294-493a-89e4-3dffc0f7e0bc","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.171133Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:ad036802d8a83d4c7aa398d53c20b34aa2d26ae4dababb173552633d2030ea67","observation_id":"6e2775c4-5441-4b23-a1c7-88659cd599c9","resolution":{"observed_at":"2026-08-07T13:30:35.833182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:21.294753Z","title":"Da Costa, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.294753Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:214f53ed738c60c49db3286ccfae63b41f19e02590453fddbf2438c9e3d09787","observation_id":"674dfce5-6ac5-4f54-bc8a-68d633f7205e","resolution":{"observed_at":"2026-08-07T13:30:21.294753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.636480Z","title":"Emmons, B","venue":null,"work_id":"0f5e65ea-ae51-4e2d-9e2e-a0e83f7ef7e3","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.394376Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:903fe484923fcbda9d20abd458fa3dbc79951cbc110baa795e38efe82a97cd7d","observation_id":"b13a745c-023b-40b8-8a72-08602e0cbedc","resolution":{"observed_at":"2026-08-07T13:30:35.700611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.382575Z","title":null,"venue":null,"work_id":"6938ee25-a943-4af2-a661-12c21cf993d3","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.491943Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:5e8342a49fb316d0282e793b269c6bd61f1b4e05b8a4607bb991ff5cbd618db4","observation_id":"1e5e9932-f7f1-489a-bb75-3eba8f490110","resolution":{"observed_at":"2026-08-07T13:30:35.525264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.183736Z","title":"Fujimoto, D","venue":null,"work_id":"03f33a29-8c9d-4759-8dc4-a9950c237262","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.614956Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:871ecabcb4c1827e37c61da0e0690b203cbd989fe8aecf4d98c122313deb4ba4","observation_id":"092bc828-ae16-4493-8bed-b153b1723c04","resolution":{"observed_at":"2026-08-07T13:30:35.288966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.998395Z","title":"Fulton and A","venue":null,"work_id":"5f00587b-f7d8-4b9b-a39e-e669a7eca772","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.692574Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:f015c0b4a5ef6a158fb5cdf727f3b789eebe6cc7efeccff9ecd55feb3845ee66","observation_id":"f5e404af-41b3-4494-966c-3c5cc3b0f525","resolution":{"observed_at":"2026-08-07T13:30:35.105286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.814979Z","title":"Garcıa and F","venue":null,"work_id":"f78b7ba4-2dd6-4d9c-81a3-f93cb46ca045","year":2015},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.790603Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b7bb987e6ef845ae5ae7c257eb9f1f17f3872e7c292f2a4ef3898b8e13fe4c68","observation_id":"a7274ed4-4e90-4f4e-83fa-9173b709f53a","resolution":{"observed_at":"2026-08-07T13:30:34.901866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.587074Z","title":"Gronauer","venue":null,"work_id":"d19c125c-5ae2-420c-89dc-e7fb50b2436e","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.937413Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:e2194618df7b64d5a1a5b560282216d9f7765e3dfba267de309659b9e4a11a3d","observation_id":"97fcee7b-9fd3-4b4c-8a43-f7e7b001e6aa","resolution":{"observed_at":"2026-08-07T13:30:34.699316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.409088Z","title":null,"venue":null,"work_id":"eaced940-ad3e-41b8-9746-82b03b8850d5","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.049343Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:ea3ff7684ee28871593a0abb193b7afcef2e0ba838b8506e82a9296a26764f69","observation_id":"c32c7df1-e8cf-4c9d-b28f-55a1f4bf4c8d","resolution":{"observed_at":"2026-08-07T13:30:34.500351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:30:22.159218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.159218Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:0b2f04f353fcfc90c02cbb6ea0c879d74bc822d84692555d2366f30bb1907514","observation_id":"adbed44e-9a9b-4514-a306-d885ac1df103","resolution":{"observed_at":"2026-08-07T13:30:22.159218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.221871Z","title":null,"venue":null,"work_id":"bd8f82bb-8aaa-488c-b083-d903c20aa8ad","year":2025},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.245173Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:ebee629327b159b19fae43bb12deb593e9e7e29988fa5534434ba5b14899bf01","observation_id":"690ac445-dd81-405f-8f18-d5424fdf5081","resolution":{"observed_at":"2026-08-07T13:30:34.344303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.995443Z","title":"Hambly, R","venue":null,"work_id":"c2d48c3b-d7f7-4dcd-aab8-5663706ae517","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.326144Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1af5e4eb6f59d8b3e959a6a9f29925ce1ac3f6aab2d1829c08b90552718d6b50","observation_id":"dc55872e-60ae-495a-90c6-99f555156613","resolution":{"observed_at":"2026-08-07T13:30:34.049121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.815474Z","title":null,"venue":null,"work_id":"b70f0c0a-dd3f-4be5-b283-16c7e5ba8222","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.391642Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:18bb76822570557e38e75abe5dc343e1984901dfc82c40a1a3c0fc5b5b4831c5","observation_id":"00fbdec3-2754-4655-acb8-94c756ce42f1","resolution":{"observed_at":"2026-08-07T13:30:33.895147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.659503Z","title":null,"venue":null,"work_id":"900952fb-3577-4f8f-b9c9-b575e220db76","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.504885Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1df5724afdf01f98fdf02404312f623175051c4204668cc2c8d4a849eaf6ab04","observation_id":"6897be8e-84ed-4d96-868a-a3899270c6c7","resolution":{"observed_at":"2026-08-07T13:30:33.732780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.462951Z","title":null,"venue":null,"work_id":"fe200598-4965-4991-9b00-0266e6d0443c","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.637476Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:aeceb52628dd42919aa1291c0bbf5cba768bdc5b2ab9cd4ae9dc46b21fe8baca","observation_id":"8e5fce55-3c99-4ee3-a2a8-9332af96a67c","resolution":{"observed_at":"2026-08-07T13:30:33.570967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06750","last_updated":"2023-11-18T13:19:55Z","snapshot_observed_at":"2026-07-06T13:09:43.029055Z","submitted_at":"2022-05-13T16:34:36Z","title":"Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06750","snapshot_observed_at":"2026-08-07T13:30:22.701820Z","title":"Krasowski, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.701820Z"},"links":{"cited_paper":"/paper/2205.06750","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:c5c67db7bef4acacb4ad39bb1593cc99dadf0b7a1771d2153a7c6a20209e7b62","observation_id":"cb9f6868-d166-4fd2-9fb6-db9ed9a6026c","resolution":{"observed_at":"2026-08-07T13:30:22.701820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.254296Z","title":"Kumar, J","venue":null,"work_id":"384158ae-0880-4566-b8eb-6146e942def6","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.786585Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:0c1aa363dd32946b7f4f8c1a181cdbd4c4d4119b988cf737565e0ecef5babcdd","observation_id":"02dac6d4-7dbd-4165-993c-83a9995dff40","resolution":{"observed_at":"2026-08-07T13:30:33.369305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T13:30:22.843583Z","title":"Kumar, X","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.843583Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:c4a3d63f7a0cbf6426a62bdb7128a5243c67c422613bf14adeca8d7677c76027","observation_id":"0124c1ed-df2a-44cc-8b23-59c16ca05f04","resolution":{"observed_at":"2026-08-07T13:30:22.843583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.973725Z","title":null,"venue":null,"work_id":"3585c4bd-56ba-472a-ae0f-7dbc8a2fdeef","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.975095Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:2368ae751a9dc241fcc1ff9e836439cfd6fca3c3226a3b3f8ecf2ecdbe7239be","observation_id":"139671e5-860b-468f-97ce-5e25eb919d11","resolution":{"observed_at":"2026-08-07T13:30:33.098066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.750787Z","title":null,"venue":null,"work_id":"54757f64-5fe3-433c-8eef-125a7537a15c","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.089264Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:3e12507e6739301af805dff7bf303188b739305bb051fa9289b7192305492976","observation_id":"febdd373-fd80-472d-9a82-065076405ea4","resolution":{"observed_at":"2026-08-07T13:30:32.875494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.550600Z","title":"Levine, C","venue":null,"work_id":"599604ec-a78a-4581-8cf9-966878c461e9","year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.184252Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:2cb77e84267bb60ecaf295ded33b7a7966fe85f32b25b7616a11d7a802a0624d","observation_id":"6ea14459-59f1-4823-b1e6-d0a9d8720cdb","resolution":{"observed_at":"2026-08-07T13:30:32.638209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:30:23.279554Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.279554Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:419cfefe0c40cfff9469376eaf1444ae909c616bae952c0e1cf50d4eab5af343","observation_id":"dd2a1b61-3e23-49c2-97e9-7bb23ee939f8","resolution":{"observed_at":"2026-08-07T13:30:23.279554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.305975Z","title":null,"venue":null,"work_id":"cee9d281-3208-466c-98c8-b6b1fd891552","year":2002},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.333956Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:177f65bf4a3111609611dac6d06c688bd0273a29ff75f67c9926af0033b70df3","observation_id":"dc0847ab-7a35-4193-904f-bde708311a34","resolution":{"observed_at":"2026-08-07T13:30:32.392354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.112823Z","title":null,"venue":null,"work_id":"b7c711bf-2e9c-4c81-bcd9-5d91002ff2cf","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.434878Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1dd787809f6b7ad7c4338385725aa2fac0af73bc0738c099560c59cda65a6382","observation_id":"93140e8d-fce0-41ad-a807-5a00ac9cbac0","resolution":{"observed_at":"2026-08-07T13:30:32.244747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-01T17:34:24.826409Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-07T13:30:23.525259Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.525259Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:abeb87d08fec0732a0db41c953b266f1f783665fe8fa47dac02c93e5378c2dc4","observation_id":"f0751b9c-ed33-46ac-bf04-49112ec2ab7d","resolution":{"observed_at":"2026-08-07T13:30:23.525259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.904759Z","title":null,"venue":null,"work_id":"11ecb9c9-be68-4fab-9d8f-2553bcb2de5b","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.654841Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:5e993a3d2ff7da47aa01e2c944c4799d858d1d101df4683546342cbc3bc848c7","observation_id":"da4a3e35-5a01-478f-b769-9c6494246e5e","resolution":{"observed_at":"2026-08-07T13:30:32.017371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.664485Z","title":"Ouyang, J","venue":null,"work_id":"55425bfe-4cc3-41a6-8c47-dc9316df452b","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.724974Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:139208472f44b94d2aae4cdd18a9a3f9f1a23a82da95996c1cefb31820548ead","observation_id":"dc6ab268-0dca-444c-80f9-9dea7274a561","resolution":{"observed_at":"2026-08-07T13:30:31.804742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09101","last_updated":"2022-01-12T20:00:13Z","snapshot_observed_at":"2026-07-06T08:38:33.799230Z","submitted_at":"2019-11-20T17:56:39Z","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","version":2},"cited_work":{"arxiv_id":"1911.09101","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.09101","snapshot_observed_at":"2026-08-07T13:30:26.934736Z","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","venue":"eess.SY","work_id":"96a5ece9-da3e-48f7-97f1-00f15f99da82","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.813683Z"},"links":{"cited_paper":"/paper/1911.09101","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8db11b05c0e9aaf4e5aed69b7345f6ef69940e612e3fb53857371d19b7e74d0b","observation_id":"10e93eee-0ed5-4ce2-8e51-32cbdd160ab2","resolution":{"observed_at":"2026-08-07T13:30:27.002527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.872152Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.872152Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:835ec48b5271d5639c60a498529d11bd23c7d9d0838d80b0076a5eeeefaee342","observation_id":"4d25c2c2-a451-4962-96da-cd2e252c5317","resolution":{"observed_at":"2026-08-07T13:30:23.872152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.447337Z","title":null,"venue":null,"work_id":"efd0261b-fafa-4a78-95f6-5faedae08c39","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.963485Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:50c0d944d2e9e28b8e8261766e5d669851eca81ce73ce32acf7e630a4d02764a","observation_id":"3871230a-2563-4852-b4bb-ec764f5f4fae","resolution":{"observed_at":"2026-08-07T13:30:31.514817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.236411Z","title":"Satija, P","venue":null,"work_id":"3ed52609-e631-4101-9c62-e683f59f4d35","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.009443Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8b59d9a069cb13fcafaf08ff05dfba3643e283ff3b07c1fac6afa34660f945f4","observation_id":"4ff7817e-ca91-4258-844d-b00f8440da8f","resolution":{"observed_at":"2026-08-07T13:30:31.347590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-07T13:30:24.086262Z","title":"Schmidhuber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.086262Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:34032d3e8e04ad3036bf0047fb40d074fa44185c3f47a19a4073155b545ce6f1","observation_id":"90cddf7c-eeb2-4a7d-bc5b-4a7371aa3876","resolution":{"observed_at":"2026-08-07T13:30:24.086262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.072727Z","title":"Sootla, A","venue":null,"work_id":"0ac77677-6dce-41a3-8af6-f855ed49c055","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.163137Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:ca17a5c82bbd1ee7a44324b98d0c509fd4d963a736f39784b03ca87637b84f39","observation_id":"add3ead9-d96b-4ea1-8ec3-d1b2e0eb72dc","resolution":{"observed_at":"2026-08-07T13:30:31.171392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.911306Z","title":"Srinivas, A","venue":null,"work_id":"98f0219e-7207-442a-9ded-f41bb0506f66","year":2010},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.214658Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:fbd13add28b7cc9d58344e7c7e0ca6f3799d73b345a8f4bcd515661635635685","observation_id":"d66c4c7e-dc5a-4ada-9017-3768a69efe62","resolution":{"observed_at":"2026-08-07T13:30:30.974743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T13:30:24.270417Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.270417Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:125d734320bff5c7ec3717bc039b847570ba643fe98b579153c6500fb0ca56f8","observation_id":"fc5c38cc-235b-47fc-a44a-eabe153027c2","resolution":{"observed_at":"2026-08-07T13:30:24.270417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.688246Z","title":"Stooke, J","venue":null,"work_id":"20388c8f-9a8c-452d-9ae2-527a693d9c22","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.345683Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:a90105931ddea5ffba414463a00c60c06ba727276112bb222b178ca9c5823f0f","observation_id":"926187b4-167e-4697-8738-b0f9704de70d","resolution":{"observed_at":"2026-08-07T13:30:30.791525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.511705Z","title":null,"venue":null,"work_id":"f9cb4f9f-72ec-4980-8c6f-e35f6f8f3d31","year":2015},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.514869Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:c9ce6f42cb2b7150e5ba44ed27164a692a2543fa8331015f62e8ff101e79e465","observation_id":"d7812556-4fad-48c9-89e9-0720b8ceea70","resolution":{"observed_at":"2026-08-07T13:30:30.584763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.348990Z","title":null,"venue":null,"work_id":"089245a0-a60c-4290-9dfc-10c4bae5ee53","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.636311Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:d042acbb456de341d39861f5b90a14a683b8da89a9bbc66093007f7983bbfc9c","observation_id":"3469f3d0-0a5b-49e6-8e86-57cabe6f424d","resolution":{"observed_at":"2026-08-07T13:30:30.442925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.213757Z","title":"Turchetta, F","venue":null,"work_id":"2a018791-3fc1-4a59-810b-046f90c5ac90","year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.735023Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:d0b14fbee582f8dace76971c535e617f72560952ded8d8326202c45ce6935e10","observation_id":"47120573-a122-4411-92b6-ec129f9b34d5","resolution":{"observed_at":"2026-08-07T13:30:30.277183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.804655Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.804655Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:ca10e398e71e13f2533a01782019651fdaf20f5c90654f4253097fb486352706","observation_id":"b1411c21-861b-4134-81b4-67a501ca461e","resolution":{"observed_at":"2026-08-07T13:30:24.804655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.977851Z","title":"Wachi and Y","venue":null,"work_id":"e45ce169-2ddb-4326-abe8-8de80a9ed9f3","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.914873Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1ab5841efc6bcf4817d172f5ceedef43af0f067ed1d53a6b5fe239eab938a00c","observation_id":"d32a2ba4-93e9-441a-a0b4-beb49d816e7d","resolution":{"observed_at":"2026-08-07T13:30:30.104278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.800347Z","title":"Wachi, W","venue":null,"work_id":"9b281455-f043-4503-84e1-c8e0a86f9f1d","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.018298Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:35d357df6f73cd2552a5fa614acc74188ef28e3fb983ada187f364280b951417","observation_id":"a0062dd8-7c4c-476a-aea2-d501f869a7db","resolution":{"observed_at":"2026-08-07T13:30:29.874805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.634490Z","title":"Wachi, X","venue":null,"work_id":"9af3918f-80e8-424e-878e-d283268a0baa","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.234827Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:573de5f4f0eee9dce4946a26b70be98ba3d5cfd6a298dbfe32c5e9b82b4f7d07","observation_id":"327c2ee6-cc89-40f5-8722-4dfe318abc7f","resolution":{"observed_at":"2026-08-07T13:30:29.713700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.414879Z","title":null,"venue":null,"work_id":"8e26eed3-421c-4f34-8cf6-50e4fd66e28c","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.375135Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:5709738815a8c722a9148275a9f7a752ec8887e45b9e9ee56f47f573dd1ab4d8","observation_id":"3cfc6953-bd2c-471a-80eb-5e8de9f2eb1b","resolution":{"observed_at":"2026-08-07T13:30:29.524828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.204808Z","title":null,"venue":null,"work_id":"4922e78c-2d51-408e-bec5-f3e423a353d5","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.644735Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:0c419c3ed502bd2f7931a962d2945e3cdaaa6fe2ddf3b4da9ae8c16fde36456f","observation_id":"4400f6c7-0285-4bb1-9c33-50dd9d5be1a7","resolution":{"observed_at":"2026-08-07T13:30:29.299540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.953341Z","title":"Yang and M","venue":null,"work_id":"a947639b-66bf-4b18-96d6-6b426408be82","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.815177Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:33f55fada2b852d61174e79bdae8ab661fd746f1f95a087340144bb48dd1c841","observation_id":"23b55a16-b18d-49ce-a66f-b55830d03c47","resolution":{"observed_at":"2026-08-07T13:30:29.074292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.835688Z","title":null,"venue":null,"work_id":"b28b231f-06a8-4426-9e2a-77b44f37268d","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.934915Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:72c660bace4cd9edd068039e859116b0abc7937c1b3cac800480f29b79a93a76","observation_id":"701d1300-f321-4120-aba9-54be7671f6b7","resolution":{"observed_at":"2026-08-07T13:30:28.892426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.698205Z","title":null,"venue":null,"work_id":"7f9ce713-28a3-432b-8a6a-8e4095807d92","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.009155Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:304d95e92f33ce3e245f6ab9f0757d09630eefa7b5c3cd25562532dcaf80484b","observation_id":"92c4b7fb-3b1e-4c95-9a80-e8f6a8c5dfe6","resolution":{"observed_at":"2026-08-07T13:30:28.742128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.547593Z","title":null,"venue":null,"work_id":"127823b0-af48-4f2b-ac10-a7682f14778d","year":null},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.125071Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:a14bdc35a3557881df144e98975b3e59f54a1997a815d35dc597f90538a61681","observation_id":"d7a6d77d-4f82-41b8-9618-8e2501cd0dcc","resolution":{"observed_at":"2026-08-07T13:30:28.579001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.141570Z","title":"Let β : X → ∆(A) be a behavior policy and D := {Ξ(i)}n i=1 ∼ (Pβ)n be a collection of n i.i.d","venue":null,"work_id":"5fd004aa-0e48-460f-8372-fc6a4bc9550f","year":2000},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.255011Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8ea66d5670028809091a1d378bb75005136757c298c89479b581f460566cd1d8","observation_id":"6362a78c-7d61-49b9-95da-5e8cb5b3a191","resolution":{"observed_at":"2026-08-07T13:30:28.467897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:19:00.694537Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.21852."}