{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6aea9018ced49c353dfff8385e5565dcb9d18476ac2981fd5447839ce9d8b716","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T02:50:40.285132Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.14246/citation-record","integrity":"/paper/2605.14246/integrity","json":"/paper/2605.14246/citation-record.json","paper":"/paper/2605.14246"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained policy optimization","venue":null,"work_id":"ace446d3-1647-4c52-860a-71a3c7d98d0e","year":2017},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:e49eb93d6716675751148910fcbfa89a3034f40d30c920e03c6704866e49e701","observation_id":"509daff0-1e78-40c3-984a-d59a6e828b59","resolution":{"observed_at":"2026-05-15T03:59:57.842397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained policy optimization","venue":null,"work_id":"dbc1e043-d69a-4f56-9bf8-4642cb64c654","year":2017},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:09d1f0a6d6e7c8210e356dc7f4e09b785d86042d3db74de14484bbbb0d10411d","observation_id":"97309639-8043-4937-8fa3-64c7b3d4dd44","resolution":{"observed_at":"2026-05-15T03:59:57.927474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A distributional perspective on rein- forcement learning","venue":null,"work_id":"f0303492-1604-45c4-aac5-a66a39390990","year":2017},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:e5c07320fa48773a8657bb621a9dd32bea7c804a532fc76833d3feaa3ed3c500","observation_id":"bb1d6be5-e525-4fd3-8de2-068cd7d41938","resolution":{"observed_at":"2026-05-15T03:59:57.879796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wayne Bequette, Darrell M","venue":null,"work_id":"f14324de-0b19-4e09-9997-3338f9d9c47c","year":2011},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:22c9981ee236f92e4d6bd3f54be334956d1137870bf2a464c7021efe1df9265a","observation_id":"7af03828-171e-4ca9-9a20-a9347d2db013","resolution":{"observed_at":"2026-05-15T03:59:57.838153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe reinforcement learning via shielding under par- tial observability","venue":null,"work_id":"a05af2ae-790a-4f85-bd85-701aeed62ba9","year":2023},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:fd23f8cf20c6020faf2db43e0ea33c59ef529a8f91c8a61d9031474b83fd2ab7","observation_id":"7c31eea9-5f70-4b9f-84ac-16c2936de62d","resolution":{"observed_at":"2026-05-15T03:59:57.914567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cassandra","venue":null,"work_id":"15ac8f9d-3e6d-44c8-b8f8-6c9cf2a1f518","year":1998},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:9202967397ae4bd40dc153d15daa268c9c6f7d4d6cffe448214522041b54fcd4","observation_id":"2e04df51-e25e-48ab-a0b6-b9bf20a5ddcb","resolution":{"observed_at":"2026-05-15T03:59:57.847323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines for reinforcement learning in healthcare.Nature medicine, 25(1):16–18","venue":null,"work_id":"0a7c70e4-9781-417e-ab0a-9740ce815e8b","year":2019},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:53bb96dc29713002b90f891dfea3ed81ad075701cbc5c95cf08464a0d17efc8f","observation_id":"ce074463-0136-4441-bc2a-69e089543082","resolution":{"observed_at":"2026-05-15T03:59:57.918607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing automatic closed-loop glucose control in type 1 diabetes under announced meals using an adaptive meal bolus calculator.Artificial Intelligence in Medicine, 83:1–8","venue":null,"work_id":"e06213d3-bce6-4a12-9774-a2a0875c16e9","year":2017},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:64187e6a92958348ff571e99217fe3689652779c691180619b546212a2d08388","observation_id":"564844c6-cb52-4e48-9764-58e3d923685a","resolution":{"observed_at":"2026-05-15T03:59:57.923062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comprehensive overview of reward engineering and shaping in advancing reinforcement learning applications.IEEE Access, 12:175473–175500","venue":null,"work_id":"0e36b37d-46fd-42ab-b3ce-66a959eef941","year":2024},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:e959e092c909944e2d57bac1bdcd987632a0f10c3e052301e5a5e1b6fd42a581","observation_id":"49b77c82-37a6-4ed8-8946-74af2cb0adad","resolution":{"observed_at":"2026-05-15T03:59:57.910120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep variational reinforcement learning for pomdps","venue":null,"work_id":"891486f2-976c-4665-8685-202fa3d06992","year":2018},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:476da8775e4a1239f32e5aa0f441363f72ef33eee4211e548f7984ebc2e97de3","observation_id":"50bf2932-675b-4894-8aec-4057ab66b02f","resolution":{"observed_at":"2026-05-15T03:59:57.830078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12567","last_updated":"2024-10-06T15:42:14Z","snapshot_observed_at":"2026-08-02T09:32:53.834678Z","submitted_at":"2023-10-19T08:19:28Z","title":"Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark","version":3},"cited_work":{"arxiv_id":"2310.12567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safety-gymnasium: A unified safe reinforcement learning benchmark","venue":null,"work_id":"615c2d71-0c8d-468a-a680-1fbed4ab6342","year":2023},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/2310.12567","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:4f2c303c119bf4331f122833ec6dd4e55223b989ca951bba444e7f575b9e443c","observation_id":"5be80014-bb8f-40a9-a418-c1dd569ac01e","resolution":{"observed_at":"2026-05-15T02:53:33.839716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is pessimism provably efficient for offline rl? In International conference on machine learning, pages 5084–5096","venue":null,"work_id":"452dfb67-d651-4fbe-9548-3a3d61b5b46e","year":2021},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:c0009167f9e1585e55562662ed21a466355f3667b9ed1b13133fbadee881c315","observation_id":"bdbe6702-2483-43a0-98bb-47cf4804f51d","resolution":{"observed_at":"2026-05-15T03:59:57.884887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:49.392267Z","title":"Littman, and Anthony R","venue":null,"work_id":"ca2f522b-d05c-4ddf-8628-52ce9634a6c4","year":1998},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:f54b4c403289d7c919631bdc62bc1a55b6a6824003c5d80c648ff45d06f298f9","observation_id":"9bfd4639-21a6-410f-9aef-5726901c245a","resolution":{"observed_at":"2026-05-15T03:59:57.825867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shields for safe reinforcement learning.Communications of the ACM, 68(11):80–90","venue":null,"work_id":"31cee9ab-65ae-435c-b548-a0bccdebe2e1","year":2025},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:80969e016b677a93d56e1c6e80e9d64bd48eafeebffbcfeb1e1c5453d6bf0a4e","observation_id":"c47e675e-f627-4f01-9f68-c1e6b2e3d911","resolution":{"observed_at":"2026-05-15T03:59:57.787444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conservative q-learning for offline reinforcement learning.Advances in neural information processing systems, 33:1179– 1191","venue":null,"work_id":"e7beafaf-7449-494f-8bcc-380660f11a1d","year":2020},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:209766e5750ffc026c334764ffea4b298d47e1677e344667fb9527dc40e79f80","observation_id":"51fbe38c-13ce-4319-909c-7605bda304f2","resolution":{"observed_at":"2026-05-15T03:59:57.777720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sarsop: Efficient point-based pomdp planning by approximating optimally reachable belief spaces","venue":null,"work_id":"f7f10670-09bd-4b86-b5b2-9c31cafc20af","year":2008},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:f74747ccf09d3bd08e8b3a44590c9fda75a028520e706613be0362d5816dba14","observation_id":"5d57f887-5e14-4f2d-aa3e-4b18fac2a182","resolution":{"observed_at":"2026-05-15T03:59:57.834159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Partially observable markov decision processes in robotics: A survey.IEEE Transactions on Robotics, 39(1):21–40","venue":null,"work_id":"20dd76e7-eee9-4adc-94d7-65d69ac43c51","year":2023},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:fb924faf6eb25a3172f1cd2df5ec9489eab2d2747b4b0a7ed2da72297368679e","observation_id":"7a7130cd-87b8-47cf-8c73-408311bdaa8c","resolution":{"observed_at":"2026-05-15T03:59:57.792098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The uva/padova type 1 diabetes simulator: new features.Journal of diabetes science and technology, 8(1):26–34","venue":null,"work_id":"f1f6982f-aa0c-43bd-a52a-00353b145d83","year":2014},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:9dfb43dc3fcdcd14b60cc90ae39085a2d184380dbc6a9b39f6aa3a2a4745931a","observation_id":"b721be15-71ce-41d0-9511-fc75e61752cb","resolution":{"observed_at":"2026-05-15T03:59:57.796853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-based value iteration: An anytime algorithm for pomdps","venue":null,"work_id":"f4c65c6e-fef2-4eca-aa5b-9632de8aa4ff","year":2003},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:abd10f8d05b0ba63609670979bdd63738951fe60e7b776b69e3da3d46b8eb679","observation_id":"b7e8233d-fd1b-4f21-9a14-5c8b044134fb","resolution":{"observed_at":"2026-05-15T03:59:57.935590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-07-06T08:26:47.571015Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:9cb6765ca715d08b005bf2b2f79c0fbe8e3021150f8dfebf9ccdbffa75f554df","observation_id":"f66ff6a4-cf26-478c-a5b5-3a132ecf6470","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One risk to rule them all: A risk-sensitive perspective on model-based offline reinforcement learning","venue":null,"work_id":"043a7c2d-c457-4aac-b221-0d5443acc487","year":2023},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:65441115b83813339a0d65ae6d3b1e4e2fef99cee0774351790caa20b9b3a272","observation_id":"6443dcf8-8833-43fb-8779-31976a667019","resolution":{"observed_at":"2026-05-15T03:59:57.851832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finding approximate pomdp solutions through belief compression.Journal of Artificial Intelligence Research, 23:1–40","venue":null,"work_id":"d845f273-e76f-41cb-963d-5165946922ba","year":2005},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:79e5072a576a9d411b7c9d531731ef1b7b39036e562a2c02639ce25814eb4c8a","observation_id":"2c56b631-a9c8-44eb-8ad0-df51d5aad547","resolution":{"observed_at":"2026-05-15T03:59:57.801113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trust region policy optimization","venue":null,"work_id":"db9da7ec-6c28-4c0c-9684-de4e986abdba","year":2015},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:affd99732587b737294332f576f467a6822dd5113d884a4ed1a274fcf5adf76d","observation_id":"5a38d9cf-a016-463e-ba96-619102ef8766","resolution":{"observed_at":"2026-05-15T03:59:57.931404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:37989ca552b593642700b66de958e908ad1c2fec06ea3f9f26c70d4340b731c8","observation_id":"ca03579a-6c2b-411d-b53a-60c6763db2d6","resolution":{"observed_at":"2026-05-15T02:53:33.824242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of point-based pomdp solvers.Au- tonomous Agents and Multi-Agent Systems, 27(1):1–51","venue":null,"work_id":"a6c12210-6dc4-4d07-ad01-f44333ed3ea2","year":2013},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:2ce8930235592b091bc3668c440440ab201d2a64a5c157f431b3b9b133302de3","observation_id":"859f5612-3c05-4281-be3f-d289fd5753aa","resolution":{"observed_at":"2026-05-15T03:59:57.870918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monte-carlo planning in large pomdps","venue":null,"work_id":"91b499e9-4a9f-4af7-a071-d64d1f5e18b3","year":2010},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:f11512d383896c63c48627e07ab719957bd0eb692972269be2bd76fb7e5aaaee","observation_id":"7fb9177f-957b-41b9-a89e-7476c5ab9beb","resolution":{"observed_at":"2026-05-15T03:59:57.945011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"d1f5178b-3246-4584-add6-98f5ecda6665","year":2020},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:74bc5149c49ef82f67d17ac1c4da38cc616a76cc3679b5d219c4ba6b54ef2c7d","observation_id":"e9978806-6774-4122-8188-6a9d73b164b0","resolution":{"observed_at":"2026-05-15T03:59:57.875194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequential decision making with coherent risk.IEEE transactions on automatic control, 62(7):3323–3338","venue":null,"work_id":"6fc5f3d2-ea83-41a5-9568-0d854fc247f6","year":2016},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:7cd00733c04b54fc5d51cdcc6a0477d11a4c24c492a49ccc9132fcc9aae754fe","observation_id":"c3c136dc-18fd-449d-85d2-76fa763c7d1e","resolution":{"observed_at":"2026-05-15T03:59:57.781861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating deep q-learning algorithms for controlling blood glucose in in silico type 1 diabetes","venue":null,"work_id":"b0bc4b70-8795-4d2a-883a-baf28b63b21d","year":2023},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:7b6f21736bbf63c591ab85ab0ab9d77e95493be1784b827c9ba8ff79c5d45553","observation_id":"dc7f9998-a36c-42d0-97e0-dd0228b81a72","resolution":{"observed_at":"2026-05-15T03:59:57.820639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":"1805.11074","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-07-04T11:39:46.348956Z","title":"Reward Constrained Policy Optimization","venue":"cs.LG","work_id":"c4fdaea7-11ae-432a-8a0c-0b650e87b855","year":2018},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:03dddeda64c0668fa885ec0c41017421de1243f931d870d922d0b6ecb0f13e1f","observation_id":"4009376a-a9d6-4b29-a161-bf7cb82c769c","resolution":{"observed_at":"2026-05-15T02:53:33.833591Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simglucose v0.2.1","venue":null,"work_id":"e22cd077-27f5-4a70-8fa6-a5034f1ceb5f","year":2018},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:39dba8e08901648437e8997a31b5a20cf076c3e6575ad26959b226b6faed6c25","observation_id":"8c24f218-6546-4b62-b9c2-91d72babb024","resolution":{"observed_at":"2026-05-15T03:59:57.953988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07565","last_updated":"2022-02-15T16:49:28Z","snapshot_observed_at":"2026-07-06T12:38:05.979914Z","submitted_at":"2022-02-15T16:49:28Z","title":"CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2202.07565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.07565","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cup: A conservative update policy algorithm for safe reinforcement learning","venue":null,"work_id":"a9d97fc6-85b8-4fe3-8890-e6a733313cd1","year":2022},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/2202.07565","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:0cb30e0b36c0caf02602c400740b395da3865192b1dc58ad7a8ff06e45af8020","observation_id":"2402e5d0-0922-48c4-84fb-38a471426a2a","resolution":{"observed_at":"2026-05-15T02:53:33.830811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03152","last_updated":"2020-10-07T04:22:45Z","snapshot_observed_at":"2026-07-06T10:02:11.078138Z","submitted_at":"2020-10-07T04:22:45Z","title":"Projection-Based Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":"2010.03152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.03152","snapshot_observed_at":"2026-07-04T08:49:42.827587Z","title":"Projection-based constrained policy optimization","venue":null,"work_id":"75762d92-0be1-48c0-853c-6ea6bcc061d7","year":2010},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/2010.03152","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:900bc58c251692c35b63145cc7b07f689021684173aa5e973e5ac5c4650c9410","observation_id":"5302c802-cf66-4d30-9860-41e11ba0c694","resolution":{"observed_at":"2026-05-15T02:53:33.836749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rates of convergence for empirical processes of stationary mixing sequences.The Annals of Probability, pages 94–116","venue":null,"work_id":"50b2f19f-1ba1-45d9-a6a2-92cf57dc921f","year":1994},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:1a8de61c41bc4bb5773695407c1b65f2310aaaf993afaaa52aed69d51777191a","observation_id":"f09d56c0-0dd5-4536-bbe1-3520fe38c439","resolution":{"observed_at":"2026-05-15T03:59:57.949678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PhD thesis, Massachusetts Institute of Technology","venue":null,"work_id":"2021e24c-954a-4326-8ce0-ed5c1c2a52c4","year":2006},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:b8d3d6467d056dde8e723aa7dffabf75b4ae869c697e320444dc6173da1cace5","observation_id":"a09e310d-f51b-441d-a6bc-50f78e9e9415","resolution":{"observed_at":"2026-05-15T03:59:57.861701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"0b481a2d-6bb3-4123-9db0-cae80deedc64","year":2020},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:821c7339fc96b0b9c74a85e37938c883ad98511b5776737e1611e87553bf2f55","observation_id":"92f99e32-94eb-445f-b4f6-76259111ef04","resolution":{"observed_at":"2026-05-15T03:59:57.816073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A safe-enhanced fully closed-loop artificial pancreas controller based on deep reinforcement learning.PLOS ONE, 20(1):e0317662","venue":null,"work_id":"b3f82323-1944-4f0e-ab21-19b86248ffcd","year":2025},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:29b27fc178a88c463a145682f102a1620c7123a8b4cbb54bfa1208b3d42dff73","observation_id":"e238fa60-063f-4da2-9aba-7cd4cd5fae5e","resolution":{"observed_at":"2026-05-15T03:59:57.940402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design and validation of an open-source closed-loop testbed for artificial pancreas systems","venue":null,"work_id":"7439e1df-20f4-469c-ba6b-e65a9bdb48ff","year":2022},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:ca72fae626bd5d2360a194ba571faf919b647614cdacd6e0e37b2d1d43ea9937","observation_id":"63c688ad-a067-48b5-ab0f-ec81f861f26f","resolution":{"observed_at":"2026-05-15T03:59:57.805950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2.Uniqueness:The unconstrained maximizer˜π POMDP(˜st)is unique","venue":null,"work_id":"b0678089-3a06-46b5-b484-d0b15702b384","year":null},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:efcdaaead1601148f08bc3176e1e1b227ffe07ab8c2f2388242dcde10842f221","observation_id":"74e64acb-7223-4d21-8099-c8c9a500aa3b","resolution":{"observed_at":"2026-05-15T03:59:57.810846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1fed178c-db81-4722-a55c-67871bb5cec1","year":null},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:e9f94e876e8e2d23b16b2a929af65aa7c41b6b218e65390feddd1b3006f6cd16","observation_id":"b732e494-d3c6-425b-8157-5bf4fbf561d9","resolution":{"observed_at":"2026-05-15T03:59:57.959061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"417b90c6-13a1-4458-8a37-39147ad64266","year":null},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:722ceeed276f9d05478821a16941e8bf1c95b822d18e76e081564f04d0125218","observation_id":"eead95bb-105e-4441-a119-2eeb37c689d4","resolution":{"observed_at":"2026-05-15T03:59:57.771490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"emergent","venue":null,"work_id":"93682d01-7839-4103-8695-f645fabcc6a8","year":null},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:f9e0e1ab9c63af548eb9b703fd0168c6e17d183f4dde45ae34fd0b6c7a0e2896","observation_id":"666a29a6-3a6d-4b74-95d5-9dc07102d4db","resolution":{"observed_at":"2026-05-15T03:59:57.856522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"gray zone","venue":null,"work_id":"4a81dbd9-71bb-468d-aee1-f2a877695985","year":null},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:dd440a8a27eda39962e36e7d25fed56d52ccb5ad14320f96ebd989ef46ec4471","observation_id":"714673e9-0512-423a-8b00-2a8deaeded1c","resolution":{"observed_at":"2026-05-15T03:59:57.866265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T16:04:07.693127Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":5,"verified_fuzzy":35},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.14246."}