{"as_of":"2026-08-09T23:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d911688b9f24868ce2c6665f3bb7a92e9825282b7c0629fae4b0678baf7b9ab","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:12:07.125494Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.31320/citation-record","integrity":"/paper/2606.31320/integrity","json":"/paper/2606.31320/citation-record.json","paper":"/paper/2606.31320"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1903.11199","last_updated":"2019-03-27T00:27:57Z","snapshot_observed_at":"2026-08-06T13:11:46.209532Z","submitted_at":"2019-03-27T00:27:57Z","title":"Control Barrier Functions: Theory and Applications","version":1},"cited_work":{"arxiv_id":"1903.11199","doi":"10.48550/arxiv.1903.11199","metadata_source":"pith","pith_arxiv_id":"1903.11199","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Control Barrier Functions: Theory and Applications","venue":"cs.SY","work_id":"c379c8a0-efa1-4441-a34c-58244492226a","year":2019},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/1903.11199","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:e4d68cbcd6c171c3fbad7ffecf4a2343aa1a85c9791ea47518633627dad2ad17","observation_id":"5c4f1ad0-9cb6-446b-bef9-689b86ce0c60","resolution":{"observed_at":"2026-07-01T09:45:40.499189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3744351","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1145/3744351","venue":"ACM Transactions on Cyber-Physical Systems","work_id":"c52176fb-0288-4de4-a203-df2b310396d6","year":null},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:c61392b9be36bd5a3ee1aa04c9ffbd98b175a5a596e2f913f246309a75f678c4","observation_id":"7f051ca2-e846-4547-8969-46da3a60e246","resolution":{"observed_at":"2026-07-01T06:15:26.390161Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8506.2021","doi":"10.1109/icra48506.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lee, Matthew Tan, Yuke Zhu, and Jeannette Bohg","venue":null,"work_id":"fa6757b4-908a-45ef-8673-8cd2a926e54a","year":2021},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:61555dfbf2502f27d540933e381c2320953c6880058773d57d538741bf9515a2","observation_id":"38be1716-538c-4c67-aee2-ab0b15a0d9bc","resolution":{"observed_at":"2026-07-01T06:15:26.394256Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-07T08:54:28.901497Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":"2002.08550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-07-01T13:45:45.929703Z","title":"Learning to walk in the real world with minimal human effort","venue":null,"work_id":"2834aca6-55a3-4ffc-b6a5-845bdf129608","year":2002},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:c5f51fcf0028c906c68f816c3eb8b64bb234f5c06eab4f93935060baa8b65d4a","observation_id":"ceb67701-16a4-4252-8dda-dade35141081","resolution":{"observed_at":"2026-07-01T09:45:40.491380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1146/annurev-control-071723-102940","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Annual Review of Control, Robotics, and Autonomous Systems7(2024).https://doi.org/10.1146/ANNUREV-CONTROL-071723-102940","venue":"Annual Review of Control Robotics and Autonomous Systems","work_id":"2184fab2-a916-4551-9e0d-452c56bc12b0","year":2024},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:e2356e523123098925cf4f72e7e42432273c22a8e3a69f0dbf6b68e086785e3b","observation_id":"8615bfd7-5425-4501-bc16-d0f9940f54e9","resolution":{"observed_at":"2026-07-01T06:15:26.400128Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/0278364920987859","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ibarz, J","venue":"The International Journal of Robotics Research","work_id":"d6813d13-3bb8-4fee-ae3f-68dfe2d93f76","year":2021},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:9d7158a75387a5b0da2e10d4ea9ae3e29a571ee7dfce55948110429e02a2a8ea","observation_id":"18af1742-2420-49d3-b5e6-59d05959123d","resolution":{"observed_at":"2026-07-01T06:15:26.386008Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.864201Z","title":"cc/paper/2021/hash/85ea6fd7a2ca3960d0cf5201933ac998-Abstract.html","venue":null,"work_id":"2cd203a7-a54a-4650-b07f-a255f02fb8fe","year":2021},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:1069d4ee7638716522d92add27016807a3cafcf11da845c06e3c91ac2e2ed366","observation_id":"cb52c102-f21b-463e-8509-e94104ead8ff","resolution":{"observed_at":"2026-07-06T19:12:50.865649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06750","last_updated":"2023-11-18T13:19:55Z","snapshot_observed_at":"2026-08-09T07:50:43.395585Z","submitted_at":"2022-05-13T16:34:36Z","title":"Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking","version":3},"cited_work":{"arxiv_id":"2205.06750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.06750","snapshot_observed_at":"2026-07-01T09:45:40.500395Z","title":"arXiv preprint arXiv:2205.06750 , year=","venue":null,"work_id":"d16147d6-3f3c-48ed-92eb-544e5a0d18b1","year":null},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2205.06750","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:e436e64d078e8d337299edaaabc43dd1947281736fee8dfde632bbc257a77e25","observation_id":"210dbb4f-da32-40ff-ba46-b8ffdd8c9943","resolution":{"observed_at":"2026-07-01T09:45:40.501783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-08-07T22:24:02.030848Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"cited_work":{"arxiv_id":"2509.12833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.12833","snapshot_observed_at":"2026-07-01T09:45:40.502853Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","venue":"cs.LG","work_id":"59ffe6f8-5a83-4890-a206-74f01197ec73","year":2025},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2509.12833","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:5e8fc10839c329b89c148680458d5c200934714c0d396c8b2d772f7d6febf0c0","observation_id":"20ef1545-8009-4f72-abe6-15934da4e59f","resolution":{"observed_at":"2026-07-01T09:45:40.504080Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T09:45:40.486841Z","title":"arXiv preprint arXiv:2509.21014 (2025)","venue":null,"work_id":"412c47b9-09d8-43d1-a3b3-146ac10481bc","year":2025},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:97dc2f47d5e8307d3381022a05a07dabdeea6fbf5a0388fa689cc25d544f459a","observation_id":"ee1fb851-bcdc-4668-9f5c-065fe208ec7b","resolution":{"observed_at":"2026-07-01T09:45:40.488515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-55754-6_6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: NASA Formal Methods Symposium","venue":"Lecture notes in computer science","work_id":"5cef6c58-4112-427c-a875-6379dec72c67","year":2020},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:b50cd523817b879d93f3a7561b6762fa7cd3eca33e5a742dcf3ac06f55544203","observation_id":"da4d45d8-3c5f-4df3-8dd0-cdea7da1886a","resolution":{"observed_at":"2026-07-01T06:15:26.418657Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:b1b4ccd069c087022434adcdde8e25991b0c19cb1b8e3b3c87956c0ac0a56225","observation_id":"637a075c-bb27-4f0c-89b6-dc5bcad91686","resolution":{"observed_at":"2026-07-01T09:45:40.506809Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:38aedb695a41078a0eef378e83b761475afc2b96f27d6db6e3a4d02fce657a8e","observation_id":"22ee596a-adbc-427e-9425-0243d819bfc2","resolution":{"observed_at":"2026-07-01T09:45:40.493661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/ms.2001","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T06:15:26.395028Z","title":null,"venue":null,"work_id":"35394e52-c017-4894-95ba-5dac1b24b7af","year":2001},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:ce6e3d953f4e2d59c0ada8426b051d036f7ceb7e430dcff36efeae3102d9a039","observation_id":"5a60eb90-bd82-4a9d-ad67-aaf7218c74dd","resolution":{"observed_at":"2026-07-01T06:15:26.396724Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15199","last_updated":"2024-10-31T12:44:50Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-23T16:35:14Z","title":"Reinforcement Learning with Adaptive Regularization for Safe Control of Critical Systems","version":3},"cited_work":{"arxiv_id":"2404.15199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15199","snapshot_observed_at":"2026-07-01T09:45:40.496844Z","title":"Reinforce- ment learning with adaptive regularization for safe control of critical systems","venue":null,"work_id":"37fb7065-6ce9-477b-bdec-ce6d1cd54a5b","year":2024},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2404.15199","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:9728641204368d7e5f8acbedad2b887e8488e67334a87620007440dce4518552","observation_id":"d106a98a-4357-401f-8c5a-21a19dc16afe","resolution":{"observed_at":"2026-07-01T09:45:40.498343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08552","last_updated":"2019-04-08T11:39:34Z","snapshot_observed_at":"2026-07-06T06:29:45.935030Z","submitted_at":"2018-03-22T19:19:09Z","title":"Linear model predictive safety certification for learning-based control","version":6},"cited_work":{"arxiv_id":"1803.08552","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.08552","snapshot_observed_at":"2026-07-01T09:45:40.494461Z","title":"Linear model predictive safety certification for learning-based control","venue":"cs.SY","work_id":"2f8449e3-0ade-4c11-b12d-0abe0177298c","year":2018},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/1803.08552","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:8cd215fd73a7242ceaeb50afcebec51690ff77535b6498ff91f07a8e1f13608b","observation_id":"66b11d40-83c4-4d4a-8b22-81ff3d9dd91e","resolution":{"observed_at":"2026-07-01T09:45:40.495697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/2502524","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 978-1-4503-1996-6","venue":null,"work_id":"aba54c8f-55e6-4cab-b474-d86c2cfd8e6c","year":1996},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:d5259b78f67fb608b629849f3bb5efd191964abd06080229b899a132be80fe52","observation_id":"582fa6b4-6588-4cf6-910e-19f539cd82cf","resolution":{"observed_at":"2026-07-01T06:15:26.382697Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1007779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T09:45:40.502426Z","title":"Linhai Xie, Sen Wang, Stefano Rosa, Andrew Markham, and Niki Trigoni","venue":null,"work_id":"0654a55f-6eda-48f6-af57-013009b0fcce","year":null},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:170b3ef0bf8c7979cdea0068d756648a67f4b946eb5fcbf86589da886ffec3c9","observation_id":"c3aa37ef-0bb5-41e8-8925-9293bbb4cc38","resolution":{"observed_at":"2026-07-01T09:45:40.503798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04066","last_updated":"2023-09-28T19:12:03Z","snapshot_observed_at":"2026-08-06T15:00:00.575506Z","submitted_at":"2023-04-08T16:48:49Z","title":"Stable and Safe Reinforcement Learning via a Barrier-Lyapunov Actor-Critic Approach","version":3},"cited_work":{"arxiv_id":"2304.04066","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.04066","snapshot_observed_at":"2026-07-01T09:45:40.486664Z","title":"A Barrier-Lyapunov Actor-Critic Rein- forcement Learning Approach for Safe and Stable Control.arXiv preprint arXiv:2304.04066,","venue":null,"work_id":"773790e4-029f-4457-a676-eb0dfdde8b16","year":null},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2304.04066","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:ae9498ccd5fd2ede4b5b9ce1b0c099bdacf931c2dfded8aaac75c67bbbc027d3","observation_id":"498762bc-ae7e-41fc-b637-80a375a18c4c","resolution":{"observed_at":"2026-07-01T09:45:40.488370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.872472Z","title":"That is, there exist b(s)∈Randg(s)∈Rm such that ˆ∆(s,a) =b(s) +g(s) ⊤a+εlin(s,a),|εlin(s,a)|≤ϵlin(s)(22) for all actionsaon this segment","venue":null,"work_id":"f25d2c68-47be-4910-9158-42e646cc1e05","year":2018},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:69c69e9321330b036308860dc5e43685174cdd2d8d606a466c3ecd136c682231","observation_id":"1c28926c-b38e-48d9-8234-37adc57e3e17","resolution":{"observed_at":"2026-07-06T19:12:50.873816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.887334Z","title":null,"venue":null,"work_id":"31eb28e3-a3df-4932-8389-e45fc5f28484","year":1999},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:78c428bc19bb20e0597dd99ade95f1917862687ca94dfcd500f16a835ab0de90","observation_id":"cae868ec-ab63-4c34-b105-f53be0792bca","resolution":{"observed_at":"2026-07-06T19:12:50.889570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.881408Z","title":null,"venue":null,"work_id":"b6cdeaf7-80cd-4cfc-bada-b5e491ced4ab","year":2018},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:2a9bf161f8b2afff493bf897f0124079e8f337f0a3a491abb6c93fe27bff1396","observation_id":"d73eea61-3bfc-4ced-ad97-6aa64ca6c260","resolution":{"observed_at":"2026-07-06T19:12:50.882814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.883535Z","title":"qCMdcjpSuxuYQzuZyBqqjO9S8DY=","venue":null,"work_id":"6840d22f-343a-44ef-94f5-1aef8d6e21b4","year":2001},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:01a442bec277f228002f52c799a7f690d69972975f77df449dfabaae65416d30","observation_id":"b6865a8c-3410-4022-896d-835c977c9034","resolution":{"observed_at":"2026-07-06T19:12:50.886386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.880118Z","title":null,"venue":null,"work_id":"cef2d6e0-f629-4881-9f6e-72d7c701db49","year":2024},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:a4c055994c4c52c8fcb111b36f322174535b840dfef07b6e5650ab72febaff7c","observation_id":"e45dc118-bb26-487b-b5ea-27586c9bb944","resolution":{"observed_at":"2026-07-06T19:12:50.881211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.883713Z","title":"The system model can be found at (Tian et al., 2024)","venue":null,"work_id":"69849a2f-b0e2-4eb2-af30-fecb4d58333b","year":2024},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:fbdb7b8b492ae42fbd7447e3d00ba80c8a105a01e56d960115c4305ad8440da6","observation_id":"56d335bd-1817-4bf2-a3f2-c1197373fce8","resolution":{"observed_at":"2026-07-06T19:12:50.886281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.876232Z","title":"In our case study, we set the initial position of the quadrotor ass0xyz ={1.5,1.5,1.5}and the target position of the quadrotor asˆsxyz ={2.5,2.5,2.5}","venue":null,"work_id":"897f6cc7-3eef-4575-b9e0-94ce418db19a","year":2022},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:a356ae79e6f1156a2be618ea67e64e13a3b4dc0a3c74db9182a6396871831428","observation_id":"ae0de3cb-6074-4832-b6ea-d2fe5963d2c6","resolution":{"observed_at":"2026-07-06T19:12:50.878238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.874363Z","title":"We observe that training of theSimplexis graduallydivergingwitha largecriticloss, asshown inFig.11","venue":null,"work_id":"9c42dc96-b9aa-4a64-8b94-2649f1b11f92","year":2000},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:6670f22f8ab911f28c629f17045a11fdc87d45d96e4b24ba0782a8d514e8d17d","observation_id":"b7ae71bf-47ee-4e78-9539-9526fc9cf917","resolution":{"observed_at":"2026-07-06T19:12:50.875621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.881780Z","title":null,"venue":null,"work_id":"b43260d5-5521-487f-ae16-31d23ef044a6","year":2000},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:0935e6ad75fa1a2b8b2fb10f0c18d7418ca7a6d7880cf8f04480dd230423183e","observation_id":"2838b799-7e82-4d6b-97e1-696d672721dc","resolution":{"observed_at":"2026-07-06T19:12:50.883144Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.866522Z","title":"For simple tasks, such as cartpole and glucose, the agent could learn using the data generated by the safe policy","venue":null,"work_id":"3d609513-afb9-4888-a3c6-718c7e2a7991","year":2072},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:d159e3f0a1cbd7a9e347ac832e59c79922111cea645d7ccafc0ebb3a4e8d10e7","observation_id":"2e692e5f-97aa-449a-ba4a-11c885d7b2b0","resolution":{"observed_at":"2026-07-06T19:12:50.867841Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":3,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":3,"verified_exact":10,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2606.31320."}