{"as_of":"2026-08-18T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f859b27f289c26ee681f47684a1db168e47e0ed41b698117295d128be937724","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:27:44.219249Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15457/citation-record","integrity":"/paper/2607.15457/integrity","json":"/paper/2607.15457/citation-record.json","paper":"/paper/2607.15457"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:40.417193Z","title":"Altman,Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:40.417193Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:42cdefc73d93f3677e16292a8a20a6b7a71573f3dde86d1c63a08e322b6bced2","observation_id":"d550f721-d9aa-4d0b-bd27-d3900b92329d","resolution":{"observed_at":"2026-08-01T23:27:40.417193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:40.496655Z","title":"Towards achieving sub-linear regret and hard constraint violation in model-free rl,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:40.496655Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:baa8446461d881359a99b3978fabcf71bad8b805ac37af0c50f49ee0a266ed40","observation_id":"b61eda01-2514-4db4-9351-c36311815d6a","resolution":{"observed_at":"2026-08-01T23:27:40.496655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:40.656413Z","title":"Achieving sub-linear regret in infinite horizon average reward constrained mdp with linear function approximation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:40.656413Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:4659f75fea88ab1905a585cee91a6dff21bc013c3f6498b38136d974789f4179","observation_id":"c26db9a6-4743-45bd-a319-814d4fa18fba","resolution":{"observed_at":"2026-08-01T23:27:40.656413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:40.743145Z","title":"Reward constrained policy optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:40.743145Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:33c926eb8c9ed60b319da948cfe2a116e9ca13e2385e57ef78a58a03c5a7fc37","observation_id":"e3d03652-b9b1-4f2b-9ddd-b72284d7251d","resolution":{"observed_at":"2026-08-01T23:27:40.743145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:40.920680Z","title":"Reachability constrained rein- forcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:40.920680Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:f6d01b72c328f355c8b6c5179002747a27923831928618fd68ac7ef843734f8f","observation_id":"31754b4f-b1c8-4c3b-8456-2959d730a20f","resolution":{"observed_at":"2026-08-01T23:27:40.920680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.058213Z","title":"Iterative reachability estimation for safe reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.058213Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:29a7bc22a71c8b2ead70c25d5e91e37cbabdd301fbda423de852fa4ca46a394d","observation_id":"a139e191-a795-4eba-936c-f7282e0165f7","resolution":{"observed_at":"2026-08-01T23:27:41.058213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.194510Z","title":"Safe policies for reinforcement learning via primal-dual methods,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.194510Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:31b96b0abb86f2190222a5c413e4fbc638b8d4fae776d1e3681accda51299907","observation_id":"38a08963-a5dd-46d6-ac79-c0d42d281c08","resolution":{"observed_at":"2026-08-01T23:27:41.194510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.347329Z","title":"Responsive safety in reinforce- ment learning by pid lagrangian methods,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.347329Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:ad4ee975558182c4e5bbbfce4db62e6c53c66602dc1b3400b8bc0b08b7df5c72","observation_id":"37341d57-cd45-41c7-af60-ee570d854f3f","resolution":{"observed_at":"2026-08-01T23:27:41.347329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.471554Z","title":"Constrained upper confidence reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.471554Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:bce11b7775d40a540dfa8a875a479f031924e4ea9eee6e29a23f430d221055c5","observation_id":"a9171b69-a913-40ce-8d5f-21f35d841a37","resolution":{"observed_at":"2026-08-01T23:27:41.471554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.636006Z","title":"Natural policy gradient primal-dual method for constrained markov decision pro- cesses,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.636006Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:4a016822b6db84385b4f40ad5bd50f5d2822a370b6d39f105c68636bd875be17","observation_id":"d9c5dd50-a78f-436c-a92d-ef40ba3a59b5","resolution":{"observed_at":"2026-08-01T23:27:41.636006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.754843Z","title":"Crpo: A new approach for safe reinforcement learning with convergence guarantee,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.754843Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:7a52387ec4be43d28df2bfbba0168aadc1694d392e9d126fd7dae9a2b1f4a0cb","observation_id":"5b4699e0-fdf6-4279-b728-10bc4cc72b61","resolution":{"observed_at":"2026-08-01T23:27:41.754843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:41.899865Z","title":"Constrained policy optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:41.899865Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:030111a1e8bb3558d242540ff1ec87d1d0553104c73ec8b881b36b8c73b88df3","observation_id":"5547b983-519f-4b5b-b9d4-c8ddff7baeeb","resolution":{"observed_at":"2026-08-01T23:27:41.899865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:42.130824Z","title":"A lyapunov-based approach to safe reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.130824Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:bcdb71787d3c30bd8b0f869fe76c00bd6857f8519026d46c55d06be299b5134f","observation_id":"0bb26c26-2813-4da9-a282-e92d4c3174cd","resolution":{"observed_at":"2026-08-01T23:27:42.130824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06866","last_updated":"2022-09-14T18:29:02Z","snapshot_observed_at":"2026-08-16T16:32:29.432211Z","submitted_at":"2022-09-14T18:29:02Z","title":"Robust Constrained Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06866","snapshot_observed_at":"2026-08-01T23:27:42.254293Z","title":"Robust constrained reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.254293Z"},"links":{"cited_paper":"/paper/2209.06866","citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:998e13dfdca19080b6d5a0e10029f1bb7c14fbee9065ce38fb956e61776592f6","observation_id":"840bcb1f-cfb1-4b76-9202-9cb806b31959","resolution":{"observed_at":"2026-08-01T23:27:42.254293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15788","last_updated":"2024-06-22T08:51:57Z","snapshot_observed_at":"2026-08-17T02:05:17.046033Z","submitted_at":"2024-06-22T08:51:57Z","title":"Distributionally Robust Constrained Reinforcement Learning under Strong Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15788","snapshot_observed_at":"2026-08-01T23:27:42.392615Z","title":"Dis- tributionally robust constrained reinforcement learning under strong duality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.392615Z"},"links":{"cited_paper":"/paper/2406.15788","citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:60218c9d095afe6f31562f3ee1ce155f0c6ec382b59d9fde66453889758fbb43","observation_id":"14019e84-eacc-48bf-a23c-00787183dbe6","resolution":{"observed_at":"2026-08-01T23:27:42.392615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:42.549293Z","title":"Near-optimal policy identification in robust constrained markov decision processes via epigraph form,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.549293Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:69675c5d4c814b8343b9518ab871f2ef8d4faaf92d92203f4716fcedcc2a5435","observation_id":"ba752abe-9500-4c0a-9cb7-c48984a3d790","resolution":{"observed_at":"2026-08-01T23:27:42.549293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:42.703637Z","title":"Efficient policy optimization in robust constrained mdps with iteration com- plexity guarantees,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.703637Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:e841d948698e144b71a08de7e74bc1fb429e53b67941a148d3010110811fca98","observation_id":"df4089d0-49e6-4644-890f-cd5e3e04693b","resolution":{"observed_at":"2026-08-01T23:27:42.703637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:42.874402Z","title":"Safe learning in robotics: From learning-based control to safe reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.874402Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:2a635b717011e5ba5e6421f552483ae078e86e64fa6407fbef97f6d1ab38c2c0","observation_id":"eff7d705-78de-4b06-becb-94d81c5ba068","resolution":{"observed_at":"2026-08-01T23:27:42.874402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:42.990903Z","title":"Robust control barrier–value functions for safety-critical control,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:42.990903Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:7eb62b334c930ed8f4890fc1288efe8e2f40e285902ff9aec6386fb6a7bdfa47","observation_id":"2330380a-ca15-4416-80a5-2f433f71d4fd","resolution":{"observed_at":"2026-08-01T23:27:42.990903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.140458Z","title":"Learning barrier certificates: Towards safe rein- forcement learning with zero training-time violations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.140458Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:a1319c7a70c0d384cbfa736de040dff4ef7304059cfd6bd49e16dc27287bd63d","observation_id":"49f2e71a-0bb3-4290-b37c-6e5a6afac641","resolution":{"observed_at":"2026-08-01T23:27:43.140458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.268381Z","title":"Joint synthesis of safety certificate and safe control policy using constrained reinforce- ment learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.268381Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:9d2e24aef96dd1c8810e1e4d9fe3e0d7262f08539cb6b8fa076c9b01f0a7bb17","observation_id":"c71de5f5-f557-4f7f-b36c-21eb94c2f82c","resolution":{"observed_at":"2026-08-01T23:27:43.268381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.381756Z","title":"Hamilton-jacobi reachability: A brief overview and recent advances,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.381756Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:928741e2aeb96e708e2a23d7f428c4f9f3908e0b59586b98f7c282ab110e0316","observation_id":"9af17ba4-136e-47b5-b881-3b2d2ff44d42","resolution":{"observed_at":"2026-08-01T23:27:43.381756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.452473Z","title":"A general safety framework for learning-based control in uncertain robotic systems,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.452473Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:9962cf4d16919cb38ba07b5be1b108272137e01a180dc97a542c5fbc11d2a344","observation_id":"2a3df542-3f13-47c3-8556-376dd832015f","resolution":{"observed_at":"2026-08-01T23:27:43.452473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.517317Z","title":"Bridging hamilton-jacobi safety analysis and reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.517317Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:cd89415ed3e632f217ed60d562bf6bc442310eaac1c2a5943d85a4770b15ad18","observation_id":"5514e28a-d393-4fd3-aab0-868757cf4e12","resolution":{"observed_at":"2026-08-01T23:27:43.517317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.641773Z","title":"Solving minimum-cost reach avoid using reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.641773Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:4a07cac0cd86e9f6906659bf3346fc72872998dd24233030ceebd1bce76c8ddf","observation_id":"af89d4ae-4157-470c-b02b-8fd7fe214b07","resolution":{"observed_at":"2026-08-01T23:27:43.641773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.721240Z","title":"Con- strained reinforcement learning has zero duality gap,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.721240Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:102d1933b9858ca43a15cc0838e4b9f1aedf353c94ae3de346587aa7fc27cb14","observation_id":"871c56dd-99b2-4a86-a578-a1921f64306f","resolution":{"observed_at":"2026-08-01T23:27:43.721240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.819694Z","title":"Robust dynamic programming,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.819694Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:e5ea881bb2295b0946a68eea2c20243c777510cbdaac0b5c7d7b15338cf9c9b6","observation_id":"99e5555c-5187-4fc8-b6ba-0544f28c96af","resolution":{"observed_at":"2026-08-01T23:27:43.819694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:43.922213Z","title":"Natural actor-critic for robust reinforcement learning with function approximation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:43.922213Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:5cb6f5e5eb94952eb00fa1d92230322756e65461ade31480402135de2955de58","observation_id":"3ebef439-f9be-4f70-ba10-13e9297aa275","resolution":{"observed_at":"2026-08-01T23:27:43.922213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:44.003201Z","title":"Integral probability metrics and their generating classes of functions,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:44.003201Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:621ae38d2f9c7f08f751e5e23eadc72d2b0d67184363b55b32095a16a4f8a520","observation_id":"4f4e1c87-f47b-4989-bb82-cc54bf5f532d","resolution":{"observed_at":"2026-08-01T23:27:44.003201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T23:27:44.081847Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:44.081847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:99a0d860f947698017dc9d48a87851e328e99dd37e82343beddc64c9d6b1e69c","observation_id":"25a31f43-5aaf-42f8-b33f-8d74c1ed4f0c","resolution":{"observed_at":"2026-08-01T23:27:44.081847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-01T23:27:44.151862Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:44.151862Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:3a3d6406392caed82c702a456268dac20899784d590ceff6a3b269d900493c44","observation_id":"f4124912-88b4-43de-9145-a1fa65a24b16","resolution":{"observed_at":"2026-08-01T23:27:44.151862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:27:44.219249Z","title":"Since 1−p 2 ≤ 1 2 for allp∈[0,1], this is self-consistent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:27:44.219249Z"},"links":{"citing_paper":"/paper/2607.15457"},"observation_digest":"sha256:55567e2cfcc36269ada344fe908171eb38aca9e77ad1fdeb2370e885b7cf35ee","observation_id":"327fcfa7-676d-4281-a973-ee01690bb500","resolution":{"observed_at":"2026-08-01T23:27:44.219249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15457","last_updated":"2026-07-16T21:00:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T23:27:39.838789Z","submitted_at":"2026-07-16T21:00:50Z","title":"Robust Peak-cost Constrained Reinforcement Learning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.15457."}