{"as_of":"2026-08-08T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:786726c601f55baff48a4f4260459cda38fae43c99485b06db1695c7d796a2a9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:13:38.190951Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T19:13:53.357631Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:497de08f9ec80793bdc48723bd27be6c30901903e3a54e317dc4ad4e2d705f0b","observation_id":"0e7ef777-33c8-4ce3-9e4b-c3910318b4b4","resolution":{"observed_at":"2026-05-23T01:32:22.511123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2503.05724","last_updated":"2025-10-01T13:23:12Z","snapshot_observed_at":"2026-07-06T20:48:45.592525Z","submitted_at":"2025-02-17T19:05:55Z","title":"Addressing Moral Uncertainty using Large Language Models for Ethical Decision-Making","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T02:59:59.917462Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2503.05724"},"observation_digest":"sha256:b1bf442daa4383f13a15967acf4e7ba2c64a3fd96b86b4d054fc6dda611d7cfe","observation_id":"cd92cda9-e161-4f1d-9247-3f3d6251f600","resolution":{"observed_at":"2026-05-23T03:02:27.022470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-07T15:13:38.190951Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15793","last_updated":"2025-05-22T04:48:12Z","snapshot_observed_at":"2026-08-07T15:09:16.633906Z","submitted_at":"2025-05-21T17:47:24Z","title":"HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:38.190951Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2505.15793"},"observation_digest":"sha256:84fa5fc6c40a73cf74c3cb0286a87742d659f6c7325bc329c3d243c31563106d","observation_id":"dd28ad47-5f5d-446c-9af6-b2b9d975e6f5","resolution":{"observed_at":"2026-08-07T15:13:38.190951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-07T13:58:11.528104Z","title":"A Review of Safe Reinforcement Learning : Methods , Theory and Applications , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20621","last_updated":"2025-05-27T01:59:25Z","snapshot_observed_at":"2026-08-07T13:48:14.571565Z","submitted_at":"2025-05-27T01:59:25Z","title":"Multi-level Certified Defense Against Poisoning Attacks in Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:58:11.528104Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2505.20621"},"observation_digest":"sha256:2cd98eb4167c32a99de108eaf32dcccab9c9a643b154645793640115de8150b6","observation_id":"4720fc79-0604-4f11-8fca-7d0a01f03ca0","resolution":{"observed_at":"2026-08-07T13:58:11.528104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-07T11:32:01.311859Z","title":"A review of safe reinforcement learning: Methods, theory and applications.arXiv preprint arXiv:2205.10330, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02255","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-07T11:25:20.437026Z","submitted_at":"2025-06-02T20:59:45Z","title":"SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:01.311859Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2506.02255"},"observation_digest":"sha256:0089390009d07d2e3fdb59b59a27daa7f7f9e09143a601cc662ff07f50ef1cfb","observation_id":"0d6cb76d-128d-48dc-990e-0fad61852665","resolution":{"observed_at":"2026-08-07T11:32:01.311859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-07T10:38:20.430333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04828","last_updated":"2025-06-05T09:50:02Z","snapshot_observed_at":"2026-08-07T10:30:13.757796Z","submitted_at":"2025-06-05T09:50:02Z","title":"Safe Planning and Policy Optimization via World Model Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:38:20.430333Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2506.04828"},"observation_digest":"sha256:66b25c843419716825f3c024cda3bd8e416b83c45c346e36cf936d0deeb63a8e","observation_id":"6c8fa168-2129-44b3-88b2-720865288466","resolution":{"observed_at":"2026-08-07T10:38:20.430333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-07T05:03:03.922702Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08983","last_updated":"2025-06-10T16:53:00Z","snapshot_observed_at":"2026-08-07T04:55:14.049965Z","submitted_at":"2025-06-10T16:53:00Z","title":"Online Learning Control Strategies for Industrial Processes with Application for Loosening and Conditioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:03.922702Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2506.08983"},"observation_digest":"sha256:13b4e614098db064693f30067b6643b4dd494114f586a40d0272713c7b08c95d","observation_id":"f6f8ac98-85ba-4bfc-982c-2837f6a708bc","resolution":{"observed_at":"2026-08-07T05:03:03.922702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T21:07:11.562147Z","title":"A review of safe reinforcement learning: Meth- ods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00951","last_updated":"2025-07-12T02:50:17Z","snapshot_observed_at":"2026-08-08T07:11:19.635744Z","submitted_at":"2025-07-01T16:52:25Z","title":"Thinking Beyond Tokens: From Brain-Inspired Intelligence to Cognitive Foundations for Artificial General Intelligence and its Societal Impact","version":3},"reference_index":264,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:11.562147Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.00951"},"observation_digest":"sha256:9b483a80645df2489a3033ae159fec8bf130ff826c6f1f20160dc33ae9412571","observation_id":"09a248d6-fb45-4bf9-bb6f-fdd6f58333e2","resolution":{"observed_at":"2026-08-06T21:07:11.562147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T21:54:43.614688Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02953","last_updated":"2025-06-29T16:55:17Z","snapshot_observed_at":"2026-08-06T21:43:26.115912Z","submitted_at":"2025-06-29T16:55:17Z","title":"Closed-Form Robustness Bounds for Second-Order Pruning of Neural Controller Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:54:43.614688Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.02953"},"observation_digest":"sha256:6f1b38dc60416b3d4c33f96875496d7716f4a4df7041c44f09ba6302245c2dc4","observation_id":"11fa7e59-32c5-40c5-ba11-5618b2dcd1be","resolution":{"observed_at":"2026-08-06T21:54:43.614688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T18:16:20.319931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08793","last_updated":"2025-08-27T12:33:06Z","snapshot_observed_at":"2026-08-06T18:06:41.404197Z","submitted_at":"2025-07-11T17:54:54Z","title":"Optimistic Exploration for Risk-Averse Constrained Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:20.319931Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.08793"},"observation_digest":"sha256:af41a1eeaed9af3db0b0f6192ef7bcad56a9b127b448c235c11801113699a62b","observation_id":"ad4d0621-b059-413d-ba5f-73b60461ee9c","resolution":{"observed_at":"2026-08-06T18:16:20.319931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-06T17:42:53.625181Z","title":"A review of safe reinforcement learning: Methods, theory and applications.arXiv preprint arXiv:2205.10330, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10142","last_updated":"2026-07-22T04:23:01Z","snapshot_observed_at":"2026-08-07T20:29:46.771527Z","submitted_at":"2025-07-14T10:39:17Z","title":"Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:53.625181Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2507.10142"},"observation_digest":"sha256:39c1a40193e5932ac0c31d9cc0ce1fb5a0f132fb7a3915eb03f0e28b6a68cc39","observation_id":"6d5ebb4b-2f56-4c4c-a0b4-c539cb611fa1","resolution":{"observed_at":"2026-08-06T17:42:53.625181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-05T22:05:09.471156Z","title":"A review of safe reinforcement learning: Methods, theory and applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07611","last_updated":"2025-08-11T04:33:04Z","snapshot_observed_at":"2026-08-08T03:19:03.885510Z","submitted_at":"2025-08-11T04:33:04Z","title":"End-to-End Humanoid Robot Safe and Comfortable Locomotion Policy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:05:09.471156Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2508.07611"},"observation_digest":"sha256:a1697d3d015b87670de4d78973eb6888813bcdcb5cc8313a624b58af4cf24c5a","observation_id":"e7955322-735e-4a0f-8da2-cfe62c31fec5","resolution":{"observed_at":"2026-08-05T22:05:09.471156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2508.09128","last_updated":"2026-05-12T01:20:33Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:55:36Z","title":"A Review On Safe Reinforcement Learning Using Lyapunov and Barrier Functions","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T22:37:32.388931Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2508.09128"},"observation_digest":"sha256:273d3290e16949cd0176a65b9474da07179f5508ca4bbdd6edb7d1d6857d931c","observation_id":"e30d4525-03d8-4250-a809-93b09f70bd28","resolution":{"observed_at":"2026-05-18T22:41:53.839548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2509.01728","last_updated":"2026-04-16T14:35:52Z","snapshot_observed_at":"2026-07-06T22:21:53.366107Z","submitted_at":"2025-09-01T19:17:40Z","title":"Constrained Decoding for Safe Robot Navigation Foundation Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T19:07:18.832187Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2509.01728"},"observation_digest":"sha256:fc8a24d76066b5ea8e5567b7bfed03e8ccb7fa680e1e12cf7f39850fafb4b2e2","observation_id":"7384d603-4702-4eac-ab1f-8a2cce5348fa","resolution":{"observed_at":"2026-05-18T19:11:47.450231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2510.01020","last_updated":"2026-05-02T10:25:43Z","snapshot_observed_at":"2026-08-08T07:40:33.666469Z","submitted_at":"2025-10-01T15:28:00Z","title":"The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T10:27:40.188511Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2510.01020"},"observation_digest":"sha256:f5f2f3eb67d74fa55dd49d5475043dd4b0fd07791467521b8c8b1b1364c0a6e1","observation_id":"0546dd58-1a88-4fa5-8ce0-c78e6cfdbac0","resolution":{"observed_at":"2026-05-18T10:31:14.918174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2604.02727","last_updated":"2026-04-03T04:40:39Z","snapshot_observed_at":"2026-08-03T09:30:20.424495Z","submitted_at":"2026-04-03T04:40:39Z","title":"Data-Driven Synthesis of Probabilistic Controlled Invariant Sets for Linear MDPs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:03:22.406198Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2604.02727"},"observation_digest":"sha256:0d70d64558dd298b506eed89803bd5b29e30365e9252cd6f5adc44cf85f3ee88","observation_id":"01cb3e5b-e3c4-46fd-864a-be1e7fc96127","resolution":{"observed_at":"2026-05-13T20:08:13.116164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2604.17240","last_updated":"2026-04-19T04:02:17Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T04:02:17Z","title":"Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T06:42:57.319962Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2604.17240"},"observation_digest":"sha256:6f05d11fe9fca1f98cb947256fe9da3f4e121156fcee9fee12c5d693a5102d38","observation_id":"daa9f1eb-efa6-48a0-8914-230f31fb0c9c","resolution":{"observed_at":"2026-05-10T06:46:37.334147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2604.22244","last_updated":"2026-04-24T05:39:56Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:39:56Z","title":"Learning Control Policies to Provably Satisfy Hard Affine Constraints for Black-Box Hybrid Dynamical Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T11:36:39.916952Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2604.22244"},"observation_digest":"sha256:0aec64e3396e026db91a3c2bbff082868fd1091eb7aca59697ef4e8914558c5e","observation_id":"b39aad05-ae4b-438e-a82b-3dc8a40481e9","resolution":{"observed_at":"2026-05-11T19:36:13.090999Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2604.27861","last_updated":"2026-04-30T13:44:01Z","snapshot_observed_at":"2026-07-30T08:45:44.179299Z","submitted_at":"2026-04-30T13:44:01Z","title":"TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T06:12:37.845017Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2604.27861"},"observation_digest":"sha256:c86589d5aaf5af4e26a96e5dba8c87238d3afeaa80319df7fa381d9592b2e656","observation_id":"8cc66a4a-7e89-45b3-9229-08d90494eaf7","resolution":{"observed_at":"2026-05-12T10:26:29.254565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2605.18841","last_updated":"2026-05-13T03:34:13Z","snapshot_observed_at":"2026-08-05T22:27:31.931509Z","submitted_at":"2026-05-13T03:34:13Z","title":"From Cumulative Constraints to Adaptive Runtime Safety Control for Nonstationary Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-20T21:48:43.143169Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2605.18841"},"observation_digest":"sha256:f4802fc116fbf0d428389ad5a2b08bd2f44fc609218290441ff4827ade61ea85","observation_id":"0d8300f2-8bab-48e2-8947-c09ccf4297dc","resolution":{"observed_at":"2026-05-20T21:49:05.138755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2605.18842","last_updated":"2026-05-13T04:10:10Z","snapshot_observed_at":"2026-08-07T21:40:01.056353Z","submitted_at":"2026-05-13T04:10:10Z","title":"Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-20T21:36:33.206033Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2605.18842"},"observation_digest":"sha256:4c25477aa4679910676b31754adeb1a90e9419bc7654c13f725c77db2b63dc26","observation_id":"e385ecf4-4da5-4b10-8ae9-717027c3d98c","resolution":{"observed_at":"2026-05-20T21:39:03.469594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":"2205.10330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-06-29T19:13:53.357631Z","title":"arXiv preprint arXiv:2205.10330 (2022)","venue":null,"work_id":"d03271e9-88b8-48c6-8eb9-e42d4d27e112","year":2022},"citing_paper":{"arxiv_id":"2606.28152","last_updated":"2026-06-26T14:50:16Z","snapshot_observed_at":"2026-08-07T15:18:57.065433Z","submitted_at":"2026-06-26T14:50:16Z","title":"Regularized Reward-Punishment Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T04:49:28.330471Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2606.28152"},"observation_digest":"sha256:ba7b4c85df5ad02eed1aae85b8545d7e8921d8a64ddcfa24ecbb355b70b6eac4","observation_id":"016af7b0-4758-45d8-949a-520f9247e3e7","resolution":{"observed_at":"2026-06-29T19:13:53.359054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-01T12:15:37.928524Z","title":"arXiv preprint arXiv:2205.10330 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21646","last_updated":"2026-07-21T23:52:07Z","snapshot_observed_at":"2026-08-05T15:35:37.445197Z","submitted_at":"2026-07-21T23:52:07Z","title":"Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T12:15:37.928524Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2607.21646"},"observation_digest":"sha256:f47867f49033c102c3cb6167b26cbede1904b65bdd3308c27a1571e94d4accf4","observation_id":"760398c0-5514-4ab2-bf6d-0123d24aeaec","resolution":{"observed_at":"2026-08-01T12:15:37.928524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2205.10330/citation-record","integrity":"/paper/2205.10330/integrity","json":"/paper/2205.10330/citation-record.json","paper":"/paper/2205.10330"},"outbound":[],"paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","latest_version":5,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T09:15:33.903637Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2205.10330."}