{"as_of":"2026-08-05T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea706b51b6346c9925b890fa7d0189fc94dae86e5dc9a9096948630f7e06e9c5","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T21:58:56.180393Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T10:50:40.841967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T08:49:42.710069Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"cited_work":{"arxiv_id":"2408.16286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16286","snapshot_observed_at":"2026-07-04T08:49:42.710069Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","venue":"cs.LG","work_id":"9db088ec-cc31-41b0-a75a-8b5a0cd652eb","year":2024},"citing_paper":{"arxiv_id":"2604.14243","last_updated":"2026-04-17T15:08:39Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T04:53:29Z","title":"Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:36:59.355147Z"},"links":{"cited_paper":"/paper/2408.16286","citing_paper":"/paper/2604.14243"},"observation_digest":"sha256:f8bb19fc7246be06d429334f384e27cbbdeace2feadb5161830a32bb21ef09f1","observation_id":"aa1eb4c0-12a7-41dc-9a67-b4d2cdd38fbf","resolution":{"observed_at":"2026-05-10T13:40:27.187581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"cited_work":{"arxiv_id":"2408.16286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16286","snapshot_observed_at":"2026-07-04T08:49:42.710069Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","venue":"cs.LG","work_id":"9db088ec-cc31-41b0-a75a-8b5a0cd652eb","year":2024},"citing_paper":{"arxiv_id":"2606.22579","last_updated":"2026-06-21T16:29:25Z","snapshot_observed_at":"2026-08-02T07:11:59.062207Z","submitted_at":"2026-06-21T16:29:25Z","title":"Stationary Robust Mean-Field Games under Model Mismatches","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-26T10:50:40.841967Z"},"links":{"cited_paper":"/paper/2408.16286","citing_paper":"/paper/2606.22579"},"observation_digest":"sha256:f86febd682bd1513e1d372c94a39a8dee6b73296ac0551055d01a2868b1ca9ab","observation_id":"390cb399-72b5-40ff-8cdd-1ee17966621c","resolution":{"observed_at":"2026-07-04T08:49:42.711489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2408.16286/citation-record","integrity":"/paper/2408.16286/integrity","json":"/paper/2408.16286/citation-record.json","paper":"/paper/2408.16286"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7a147793c99d58943242a0ef2b89e85caa50e7fa984cb9704523bc1385da801f","observation_id":"129e1ef9-7bc7-492c-a1a0-d2e87f4ea2d8","resolution":{"observed_at":"2026-05-24T03:15:58.979602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Frank-Wolfe and Equilibrium Computation","venue":null,"work_id":"dec971c7-6fa1-4942-bbb9-3c9ebd8c60b5","year":2017},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6ccb748293850e36566978a8d3da3d46a4aa9abe0d5d27c6f16342597c7a3820","observation_id":"dc78442c-4ca0-4f03-bd47-5516f17fe567","resolution":{"observed_at":"2026-05-24T03:15:59.012306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained Policy Optimization","venue":null,"work_id":"b5292994-e773-4718-8e7d-ad1866de25c6","year":2017},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:ebedea49301f82cf22b775e167b92c6dca8e5099ce96d766c91659b5dee7dbf1","observation_id":"47932635-675f-48b7-9383-a37d031108ec","resolution":{"observed_at":"2026-05-24T03:15:58.962432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift","venue":null,"work_id":"ff64e464-7d60-4ef2-993d-668c013c7084","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:0868c3b7073540fbb1f7f0ba9ceb83b435827a6d7356ebb122b28de0bf777ffa","observation_id":"2a52e389-5b95-4acc-a539-ebe9c64e9baa","resolution":{"observed_at":"2026-05-24T03:15:59.072439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained Markov Decision Processes , volume 7","venue":null,"work_id":"b02ec90b-3869-47ab-835a-a44df4957b43","year":1999},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:beb92e6e54799e9eadc5dbb9d6bc62f6d094e4afe953aedcaa0eb9b4e7a072ee","observation_id":"a9a7c2ae-ad56-4b44-8d54-bc41cc35ffcf","resolution":{"observed_at":"2026-05-24T03:15:58.992363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System Level Synthesis","venue":null,"work_id":"b56c3a87-7d58-4c99-9453-65efa3abab9d","year":2019},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:e945fdccb33f1321c52dd899c966abe5c3f87f63a440ee402dd28020f2da4001","observation_id":"93f3cc20-6c13-4a5b-aba1-6b739e2f4939","resolution":{"observed_at":"2026-05-24T03:15:58.982573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Generation of Markov Decision Processes","venue":null,"work_id":"68021aea-81a9-41fb-823f-4f5306ddf423","year":1995},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7d7d0c13ac9cafe0c0cde9365593c893638652c09fae245fcb70410214153fac","observation_id":"229ec244-9919-4037-b280-6c692b566800","resolution":{"observed_at":"2026-05-24T03:15:58.941185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First-Order Methods in Optimization","venue":null,"work_id":"5bf33cc9-b973-4b7e-9112-f38a60b53fec","year":2017},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:aaece483ec1a11ab1a3a9d9fd164ce0601dc12808f6569e5be52f77940c350cd","observation_id":"3f5d0d96-6153-4d54-93cc-88328e41525d","resolution":{"observed_at":"2026-05-24T03:15:58.944576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bellman, R.E","venue":null,"work_id":"af69292c-b972-4b7d-8019-72f13b996a67","year":1957},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:03131608866c5dcab8003902b7a5a46a99ed8f7c1aedb4f616fd65c87b5b6bf5","observation_id":"3803a6e2-35c6-4cc6-9f6c-d5e42ddd4378","resolution":{"observed_at":"2026-05-24T03:15:58.948578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Model Predictive Control: A Survey","venue":null,"work_id":"b16fd910-1b14-4f49-b01b-fa9c2fe0ad13","year":2007},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:ae30b12e869d0a37a56c74bca168a5ee43b28bc42074f514b8208b3d1f7f8f6c","observation_id":"f051fdb7-c527-4d86-9ef4-17a696393a2e","resolution":{"observed_at":"2026-05-24T03:15:59.079204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Optimization--a Comprehensive Survey","venue":null,"work_id":"e5f90197-05f4-40f6-90cb-947fc38f7744","year":2007},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:9ef6a8134fb4bdf15668e0b9d52ce9ec4a698ca1e13e04d508e068b021217e84","observation_id":"3aae35ee-d4f5-45bb-9da1-f4ef6f852307","resolution":{"observed_at":"2026-05-24T03:15:59.075675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convex Optimization","venue":null,"work_id":"d524dd62-6135-4cef-8a33-8714c03dff90","year":2004},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:fd612e71908b9d404ba2802280a25b472676facaef21e60358b40249370f73f3","observation_id":"e0f07133-47ad-4ea9-8f15-d9fc8578e453","resolution":{"observed_at":"2026-05-24T03:15:58.968462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning","venue":null,"work_id":"ddff34fd-1f39-4b7a-8fc7-77de4eb1478b","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:8d0a1186134b7d8716c9802e64184815ec68cd86be3172b1a25e71cf5d89a32e","observation_id":"f13d1aab-de65-4901-a54f-335633b034d4","resolution":{"observed_at":"2026-05-24T03:15:59.032466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03297","last_updated":"2023-08-07T04:47:49Z","snapshot_observed_at":"2026-07-06T16:03:14.694457Z","submitted_at":"2023-08-07T04:47:49Z","title":"Approximate Constrained Discounted Dynamic Programming with Uniform Feasibility and Optimality","version":1},"cited_work":{"arxiv_id":"2308.03297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.03297","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximate Constrained Discounted Dynamic Programming with Uniform Feasibility and Optimality","venue":null,"work_id":"f1714fb6-9056-406e-8d6f-ace38427d02d","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2308.03297","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:3e489cf21d9d1d04da39448985c34dd3ad0a73931433cfedf596907cdea7e834","observation_id":"34e346e0-cd9e-4201-b4fa-db63b0665bcd","resolution":{"observed_at":"2026-05-23T22:03:30.987122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic Programming Equations for Discounted Constrained Stochastic Control","venue":null,"work_id":"ad8094a5-c13b-4a10-a9ed-ddddfdd62434","year":2004},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6e950a3ddfda43dea1574d46dc9214b697454ecbfa3ba1a35222524d3eca0d5a","observation_id":"768ee083-fc5a-4a84-b234-94f1954003d8","resolution":{"observed_at":"2026-05-24T03:15:58.976367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-Randomized Control of Constrained Markov Decision Processes","venue":null,"work_id":"a32683ec-e6de-4915-beab-d8c311475e69","year":2006},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c3eb695834a19a5fe293eb09687d3a1eb8c7150c49577434d6e69f7b7d04ab68","observation_id":"e5721103-dc34-4027-a18f-0fa2d1373cb3","resolution":{"observed_at":"2026-05-24T03:15:58.965526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.10895","last_updated":"2021-01-26T16:03:32Z","snapshot_observed_at":"2026-08-01T16:29:39.671288Z","submitted_at":"2021-01-26T16:03:32Z","title":"A Primal-Dual Approach to Constrained Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2101.10895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.10895","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Primal-Dual Approach to Constrained Markov Decision Processes","venue":null,"work_id":"d73db4eb-bfc3-4bad-90f7-1da5349e2a56","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2101.10895","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7893870cd06f13c058e70b349ddd284c936ee78f712939ec27e4ed483692590d","observation_id":"b13a324d-039d-4ade-999f-cc86ce9fe26b","resolution":{"observed_at":"2026-05-23T22:03:30.982953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributionally Robust Optimization for Sequential Decision-Making","venue":null,"work_id":"0be18233-2e65-4052-9d74-07ae0dbc12cd","year":2019},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:0daca3bdaa4bbc803457d6dd1264af62f62c63302950895120e363e1d2dd8cd7","observation_id":"0a1ca860-4511-4316-b725-d1f7788ce0dd","resolution":{"observed_at":"2026-05-24T03:08:50.035949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonsmooth analysis and Control Theory , volume 178","venue":null,"work_id":"bb0f6974-5d6a-4066-8866-071db6fdf10e","year":2008},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:fc5959733ad392eb3baee09a0a6b0d4c1ef7644d7f48f772e238c1ae2db5a647","observation_id":"6d3659c8-bf79-4b52-96ef-99a10a134986","resolution":{"observed_at":"2026-05-24T03:15:58.999288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization and Nonsmooth Analysis","venue":null,"work_id":"a76ed044-3505-49c4-b3e9-1e006098b4f2","year":1990},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:73f99c6368b528db4eb26271e9ffdd26b9f7269bcce78df4d07c5bb6470d68f4","observation_id":"c93edf99-c46e-4f92-be99-d5a2ffa67fdb","resolution":{"observed_at":"2026-05-24T03:08:50.032583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05372","last_updated":"2024-06-06T12:32:02Z","snapshot_observed_at":"2026-07-06T14:50:33.453443Z","submitted_at":"2023-02-10T16:50:40Z","title":"Towards Minimax Optimality of Model-based Robust Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2302.05372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.05372","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards minimax Optimality of Model-based Robust Reinforcement Learning","venue":null,"work_id":"1a427215-2534-45e5-8eb9-bbd5bdca1caa","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2302.05372","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:2291fb4dec2a81bb5b6de348844902a4d38b54e22b31f9e71ba945ed272d329f","observation_id":"cfd284a9-4453-4e48-8933-733180bc8334","resolution":{"observed_at":"2026-05-23T22:03:30.949925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying PAC and Regret: Uniform PAC Bounds for Episodic Reinforcement Learning","venue":null,"work_id":"b9196450-8fad-4d8e-88f5-798ca8d21c80","year":2017},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:9e5aced9c1ef60149b26f8e341859fc767be49be99ea0464ac5ebacfe345d73d","observation_id":"1b65327e-99f5-4da8-8895-4e1f7fc2f80f","resolution":{"observed_at":"2026-05-24T03:08:50.028862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Linear Programming in a Markov Decision Problem","venue":null,"work_id":"bf0c4116-f4c7-4b74-8c8f-8f5f2ac438b5","year":1970},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:1ec306bc0d533e2a7bc051e4874a13fc696eee9968c88454245267fad55660b2","observation_id":"b8d59e85-83ef-434c-8063-dc18c4674480","resolution":{"observed_at":"2026-05-24T03:08:50.024720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Twice Regularized MDPs and the Equivalence Between Robustness and Regularization","venue":null,"work_id":"4c474b74-a648-4dcb-bf91-a3b2eaaa4763","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:084e992affa09e84ec65ba9b3d70b76a4865b23947a4160c02db0b769bc81808","observation_id":"92d598cb-8dc7-4f4f-b045-b6e1044f506b","resolution":{"observed_at":"2026-05-24T03:15:59.055446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural Policy Gradient Primal-Dual Method for Constrained Markov Decision Processes","venue":null,"work_id":"fbbede54-1ea5-4bad-8041-cd82c28679d0","year":2020},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:65dff6fcc254242fb42140be76d73c2f60e4ab0d7bca75698783be540e8cf2d0","observation_id":"02607cfd-3fd6-4583-a005-eb0370df6532","resolution":{"observed_at":"2026-05-24T03:08:50.021714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs","venue":null,"work_id":"e9c7e53e-e32a-4385-bb45-dfe2286e8779","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:90bab2a99a6700c7fefb517191048336335f970668a81cbabd845ccdc7673384","observation_id":"8ea81958-9a30-4976-89ce-daac2c21e3de","resolution":{"observed_at":"2026-05-24T03:08:50.018667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysis of Feedback Systems with Structured Uncertainties","venue":null,"work_id":"bf08a08d-765b-4e70-abaa-9d1f27be47f9","year":1982},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:98d91a22046dd8cafe7fc115287155c628491b5ad515a8dfcbe7562e954a07d1","observation_id":"82e67b61-a73e-4cc4-95eb-360151defd35","resolution":{"observed_at":"2026-05-24T03:08:50.015731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilinear Classes: A Structural Framework for Provable Generalization in RL","venue":null,"work_id":"052e6643-d611-4f2f-9c18-6f090c8c364d","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7a6f29b0a26a54cf85d1ed912b685d6cf83315eb861ba5f9a1894fa60a6ce31e","observation_id":"4798f791-03c7-4f9b-89c6-470c8a46fc33","resolution":{"observed_at":"2026-05-24T03:15:59.089338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.10406","last_updated":"2018-05-26T00:39:12Z","snapshot_observed_at":"2026-08-02T03:39:55.924207Z","submitted_at":"2018-05-26T00:39:12Z","title":"Robust Nonparametric Regression under Huber's $\\epsilon$-contamination Model","version":1},"cited_work":{"arxiv_id":"1805.10406","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.10406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Nonparametric Regression under Huber's $\\epsilon$-contamination Model","venue":"math.ST","work_id":"00628bb8-37b0-4af0-a628-02a23c48d936","year":2018},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/1805.10406","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:2025f795dcb65a2f7665e844d43e9c402b97eb4c081133443b6500cb24d9f535","observation_id":"4f73b7d1-22f9-44c1-ac77-932e73cd1db8","resolution":{"observed_at":"2026-05-23T22:03:30.945007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-01T16:39:36.470460Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":"2003.02189","doi":"10.48550/arxiv.2003.02189","metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration-exploitation in constrained mdps","venue":"arXiv (Cornell University)","work_id":"fffe18c8-e4ec-44ab-8677-e8862ac479d1","year":2003},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:92543909e6d5cde9fd11f2549534832b7b53374709a764d4e350fcc6008bf3a3","observation_id":"e715c81e-a517-4504-8d2b-dd23015a0d4e","resolution":{"observed_at":"2026-05-23T22:03:30.941084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T12:50:01.323569+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T12:50:01.323569+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample Complexity for Obtaining Sub-optimality and Violation Bound for Distributionally Robust Constrained MDP","venue":null,"work_id":"de007e79-409e-4b5a-a1d5-7f6f471bfa6d","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:06748f5064d85ed54ad0fe988808311bb6d47000b424f7771478ffdd716855af","observation_id":"71699e00-a72a-4fd2-be3c-40fc4f8027ce","resolution":{"observed_at":"2026-05-24T03:08:50.012328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Markov Decision Processes: Beyond Rectangularity","venue":null,"work_id":"87bb0694-a2dc-4625-ae04-653af34fba3c","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:668fd7f8255bfc9e4718b21e11439c2afd585fbcc16a9f266c76e178327f103c","observation_id":"f5733f09-06dc-40d9-a3a6-f5743b8056de","resolution":{"observed_at":"2026-05-24T03:08:50.008639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable First-Order Methods for Robust Mdps","venue":null,"work_id":"2fe05e72-182f-4b7f-82e6-51490e3da7cb","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:a6e062124ce07c142c22d85793cfd68710928272d2431dd21be11100edefe7e2","observation_id":"190d35a3-3571-4a79-9341-6250fbbdb226","resolution":{"observed_at":"2026-05-24T03:08:50.004614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Convex Formulations of Robust Markov Decision Processes","venue":null,"work_id":"349c5a42-befd-4f33-a538-55a8ef02435e","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:35d6379615b5f193480039dae25154abd7ac083f12c816370a31b53eb9e463ae","observation_id":"bdd12b3c-58b4-4833-8d84-be5abab7005a","resolution":{"observed_at":"2026-05-24T03:15:59.059137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning with Safety Constraints: Sample Complexity of Reinforcement Learning for Constrained MDPs","venue":null,"work_id":"cb686d63-e7ac-43f3-adeb-8a5248970913","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:1c8760ea75b11882773be093aead18f70ae7b6eead4c5125fc60cfdf8389336c","observation_id":"38bc00aa-b505-401d-b335-39736adcb8f7","resolution":{"observed_at":"2026-05-24T03:08:50.000962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Constrained Markov Decision Processes","venue":null,"work_id":"ef9146af-77a2-42b8-ad61-1cfe62b68951","year":1996},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:9d74d41b3f34b2bcc57c684072064b25c071c1c51be0f07cfd30d83cfd0f04a8","observation_id":"cf52c55b-69c3-4d4b-82b0-545ef32c44e3","resolution":{"observed_at":"2026-05-24T03:15:59.086031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Partial Policy Iteration for L1 -Robust Markov Decision Processes","venue":null,"work_id":"bbbc21f8-1651-46fb-9684-1d992d0fec8c","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:9bc60725268b7560185af2d74fb0101ce3581098b8212cd23585bf8567d6da39","observation_id":"49ffaac0-d10f-47b6-a31c-892c8b44808b","resolution":{"observed_at":"2026-05-24T03:08:49.997464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Dynamic Programming","venue":null,"work_id":"cb37b7fc-1df6-4d9f-8cba-5f018dfdee80","year":2005},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:258c5360b129e56a79b396aef75b115637e7c7fc0ef5e85b39edb043dc17df8d","observation_id":"c90e0f95-f5e1-4963-8296-38ff05ae89a4","resolution":{"observed_at":"2026-05-24T03:15:58.934679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PAC Reinforcement Learning with an Imperfect Model","venue":null,"work_id":"8d2c85a2-a595-4d10-b879-fb02cc266b0e","year":2018},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:41d43929c258e4c607875107e84f2091d4414a9f71a1b2048075f51efabe781c","observation_id":"93218b0d-77b8-4621-8ed2-f8b5b9573764","resolution":{"observed_at":"2026-05-24T03:08:49.994044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17780","last_updated":"2024-07-01T12:08:25Z","snapshot_observed_at":"2026-08-02T09:21:27.139700Z","submitted_at":"2024-01-31T12:23:24Z","title":"A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees","version":3},"cited_work":{"arxiv_id":"2401.17780","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.17780","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees","venue":null,"work_id":"8a570b45-c0b8-4df0-a27f-de4e362d97da","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2401.17780","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6be8c8237fd632e637eb8891713ee6afc4d36de7ff7616eda2a82b7ff5266117","observation_id":"9b968be1-f7cf-4e00-9447-0b12d7bb831d","resolution":{"observed_at":"2026-05-23T22:03:30.959357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Fr\\'echet Subdifferentials","venue":null,"work_id":"4cb5b332-4139-4bdb-8f65-e3bd4d203475","year":2003},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:857ea5925ec5cea7fa1987ae7dfde9816d7a86fd69877285deef54527ba7dc12","observation_id":"7fb6ef4a-e93d-48ae-9103-91bf64ed2c44","resolution":{"observed_at":"2026-05-24T03:08:49.990504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14327","last_updated":"2022-10-05T11:03:29Z","snapshot_observed_at":"2026-07-06T13:14:55.899731Z","submitted_at":"2022-05-28T04:05:20Z","title":"Efficient Policy Iteration for Robust Markov Decision Processes via Regularization","version":2},"cited_work":{"arxiv_id":"2205.14327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.14327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Policy Iteration for Robust Markov Decision Processes via Regularization","venue":null,"work_id":"e163c039-0724-4504-961c-bed636fcf817","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2205.14327","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:78d7a20ffa2a84be3f7b218ae69883d889ca131ff89435b4d0ffddb5d5a30169","observation_id":"d1b634bc-3c8c-4742-8916-ec58510bf5a2","resolution":{"observed_at":"2026-05-23T22:03:30.936279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy Gradient for Rectangular Robust Markov Decision Processes","venue":null,"work_id":"e7a79130-fe36-413b-a3a5-4ec027bb8339","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:f1811ef4546f7d23b8e7023c61653ab52b929a9eb9db428a2273d17a520816d1","observation_id":"e2894738-deb9-4012-851d-09c5320ae655","resolution":{"observed_at":"2026-05-24T03:08:49.987170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch Policy Learning Under Constraints","venue":null,"work_id":"503c3c9a-5557-4fd6-bf50-e1038e158404","year":2019},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:96ad5ee26e4cefa242b6d282d1fc934133792786311215957c749cbbc6b18847","observation_id":"af79b652-80e4-4edc-ade9-3ea50c8045a2","resolution":{"observed_at":"2026-05-24T03:15:58.937936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faster Algorithm and Sharper Analysis for Constrained Markov Decision Process","venue":null,"work_id":"d77e3d5d-922e-42b5-8e71-c556d2ae75bf","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:537167d74fbfd6915468b1f5128354618f748c8547d2f397369997851bbb096b","observation_id":"66df72e6-34ab-4dd9-b302-10cda443b53a","resolution":{"observed_at":"2026-05-24T03:08:49.983924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10579","last_updated":"2023-06-10T21:34:45Z","snapshot_observed_at":"2026-07-06T13:54:53.084096Z","submitted_at":"2022-09-21T18:10:28Z","title":"First-order Policy Optimization for Robust Markov Decision Process","version":2},"cited_work":{"arxiv_id":"2209.10579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.10579","snapshot_observed_at":"2026-06-29T10:33:18.772880Z","title":"First-Order Policy Optimization for Robust Markov Decision Process","venue":null,"work_id":"90c3f7d8-1341-4353-8d55-2e93c8a02318","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2209.10579","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:56977dbda695253040549caf09ec67907d5d321f041f30e4f57b19f9d835a460","observation_id":"ad6ae68f-dc42-47b6-84b5-6ddabd41e6d9","resolution":{"observed_at":"2026-05-23T22:03:30.920726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00274","last_updated":"2024-06-01T02:40:29Z","snapshot_observed_at":"2026-08-05T04:50:40.539684Z","submitted_at":"2024-06-01T02:40:29Z","title":"A Single-Loop Robust Policy Gradient Method for Robust Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2406.00274","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00274","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Single-Loop Robust Policy Gradient Method for Robust Markov Decision Processes","venue":null,"work_id":"a73a150e-022c-4541-9cde-e5eb408c115e","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2406.00274","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:ae32796f55dd5b0c654a739fd2f9fbea07b8332afd6102b136e64a411b72f9ad","observation_id":"fd96314a-8a8a-4d8b-8fe4-0f5d2c681a29","resolution":{"observed_at":"2026-05-23T22:03:30.968838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Policies with Zero or Bounded Constraint Violation for Constrained MDPs","venue":null,"work_id":"5293091f-a509-4075-9c10-9b399fab2b83","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:dcb66f7f48a9a545d9915a63349e97e54c70c82549c6cbbf8d8208e92d78676d","observation_id":"dee680ee-99c5-4596-af3a-827535095b74","resolution":{"observed_at":"2026-05-24T03:15:58.989125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.15364","last_updated":"2021-12-31T09:50:46Z","snapshot_observed_at":"2026-07-06T12:23:45.886707Z","submitted_at":"2021-12-31T09:50:46Z","title":"Robust Entropy-regularized Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2112.15364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.15364","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Entropy-Regularized Markov Decision Processes","venue":null,"work_id":"ff06e8be-067c-43f5-9160-cf61f9b12f36","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2112.15364","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:8236a658919cf7ab37cf0b37bd40478c2acf8b3e9385dc9ab33bcab1636c482f","observation_id":"bedf5b64-3845-4897-b77b-b5de3e5e53b0","resolution":{"observed_at":"2026-05-23T22:03:30.916531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10644","last_updated":"2021-03-03T09:54:49Z","snapshot_observed_at":"2026-07-06T10:06:25.277680Z","submitted_at":"2020-10-20T22:05:37Z","title":"Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification","version":4},"cited_work":{"arxiv_id":"2010.10644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.10644","snapshot_observed_at":"2026-07-04T08:49:42.813155Z","title":"Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification","venue":null,"work_id":"67dd7f9a-68f5-4827-92f2-9440d98088f4","year":2010},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2010.10644","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:3f0ae63391df4c6eb86addd0fefb1e450504749529dcd1dd575d945e28ba5b2a","observation_id":"922c77d1-352e-44fb-bc49-6baa636530d8","resolution":{"observed_at":"2026-05-23T22:03:30.912566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","venue":null,"work_id":"b44e1551-71c0-4a92-8127-e79664b6c496","year":2020},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:77fcdbefda7fcdecd5f0e7559f845fdd4fd47fc2fd62b1349fea51b7831986e8","observation_id":"50af8e2a-640e-4ec2-aaf3-1f5110ff2db5","resolution":{"observed_at":"2026-05-24T03:15:58.985929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10406","last_updated":"2024-06-14T20:21:12Z","snapshot_observed_at":"2026-07-06T18:31:17.512404Z","submitted_at":"2024-06-14T20:21:12Z","title":"Methods of Nonconvex Optimization","version":1},"cited_work":{"arxiv_id":"2406.10406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Methods of Nonconvex Optimization","venue":null,"work_id":"6a0d0f1c-cfea-437a-9391-9efbe6fc3ce1","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2406.10406","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:203c36010b14f11b21af9ac8943b7d527025f354066cb13040b6da980f2455b8","observation_id":"2f55bbe6-c3c2-434c-aefc-cd3309bfce24","resolution":{"observed_at":"2026-05-23T22:03:30.907813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning with Convex Constraints","venue":null,"work_id":"57f51f50-ee76-4356-9df6-4e8f75b6263b","year":2019},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c47710e4ed86a4cdffe5c3da1d8ca879a4003111d7f8c5ba3a450f0cd82e4a3c","observation_id":"bb24d145-ba48-44f7-bd75-c440d9d18c61","resolution":{"observed_at":"2026-05-24T03:15:59.035862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level Control through Deep Reinforcement Learning","venue":null,"work_id":"21ce028b-cc99-4931-b05b-80bfb3d1e1b4","year":2015},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:1395f1122141ec0e74bd25aada7b08e1e42c08cb3daec6b41c5aa5a0d44a9069","observation_id":"d34578d6-75b8-4280-80bb-709383bde760","resolution":{"observed_at":"2026-05-24T03:15:59.045465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15776","last_updated":"2024-07-19T14:00:43Z","snapshot_observed_at":"2026-08-04T23:04:34.736695Z","submitted_at":"2024-02-24T09:47:46Z","title":"Truly No-Regret Learning in Constrained MDPs","version":3},"cited_work":{"arxiv_id":"2402.15776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15776","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truly No-Regret Learning in Constrained MDPs","venue":null,"work_id":"8934690a-716d-46b8-af5f-e1b9948fbd53","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2402.15776","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6460dba4160e1e958e506883bf8b8f245133fce6fa275f2bf912a847ba9225fd","observation_id":"0b112a79-ae19-4585-ad14-1282813a7f50","resolution":{"observed_at":"2026-05-23T22:03:30.898987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.01866","last_updated":"2020-01-09T19:08:09Z","snapshot_observed_at":"2026-08-05T07:33:07.748434Z","submitted_at":"2020-01-07T02:59:59Z","title":"Reinforcement Learning via Fenchel-Rockafellar Duality","version":2},"cited_work":{"arxiv_id":"2001.01866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.01866","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning via Fenchel-Rockafellar Duality","venue":null,"work_id":"52217729-5f19-44aa-a49b-7e58a59f3d07","year":2020},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2001.01866","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:f48ee5d6ae8aa1036f05a976228ea302e178cb144ee6b9c652ae67ee249fa2c3","observation_id":"94cc27a9-5b6d-4205-bbb2-c1b2d4ff155a","resolution":{"observed_at":"2026-05-23T22:03:30.932264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Control of Markov Decision Processes with Uncertain Transition Matrices","venue":null,"work_id":"77707ab2-1d51-4ccb-909e-83962d619ac3","year":2005},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7d3bb9c465e654e36a1de4d1b95c23162b6f915fd9389a4e2f735cff8e08f971","observation_id":"d2816846-5795-4640-96dd-c7b380fa72e5","resolution":{"observed_at":"2026-05-24T03:15:58.951981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample Complexity of Robust Reinforcement Learning with a Generative Model","venue":null,"work_id":"4232f2d6-49ac-422a-b5cb-86d8904edd4b","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:a896fb939f2bbe716ab854095691c02b82f645d068a87f19b597f467ef8995e7","observation_id":"af98bccf-71c2-402c-92e6-1549d6312eee","resolution":{"observed_at":"2026-05-24T03:15:59.028763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proximal algorithms","venue":null,"work_id":"c92319dd-d86d-4d7e-9554-c14f476e92e3","year":2014},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:8747c9011bb73c4a3ff712a78442fc77ea1fb8624d2f178fe9122b76da4b54a3","observation_id":"f45647cf-0c36-4662-8ad3-10c41ab25a3b","resolution":{"observed_at":"2026-05-24T03:15:58.971733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained Reinforcement Learning Has Zero Duality Gap","venue":null,"work_id":"bc6fdb37-44e7-413f-b035-0c7ce9f347e4","year":2019},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c821177341448766ad35d6cb13cf91b2a43354c595a61389443bf4daf12abdd0","observation_id":"9d928f18-f646-42eb-81da-16a3c42c1a05","resolution":{"observed_at":"2026-05-24T03:15:59.039014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","venue":null,"work_id":"51f9ea0d-e328-4d4f-8a03-4ef6dfdaabf5","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:41461581187d33ba720aad20c9cee3948ff1d52ee4785df9b990f980329c22cd","observation_id":"5ab447bc-8c44-4914-97ac-99c5b42e0901","resolution":{"observed_at":"2026-05-24T03:15:58.959407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe Policy Iteration","venue":null,"work_id":"d4f581db-7ad8-4981-b696-4a9caff58d82","year":2013},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:29200d80155cc794f5cd6684798642d77b0e7d73c493b1d725663ecc83cdf668","observation_id":"8d7d9546-1389-4c68-9eed-cdd260e13aac","resolution":{"observed_at":"2026-05-24T03:15:59.005968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05659","last_updated":"2019-08-13T00:43:41Z","snapshot_observed_at":"2026-07-06T08:14:39.851659Z","submitted_at":"2019-08-13T00:43:41Z","title":"Distributionally Robust Optimization: A Review","version":1},"cited_work":{"arxiv_id":"1908.05659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.05659","snapshot_observed_at":"2026-07-03T14:08:21.585029Z","title":"Distributionally robust optimization: A review","venue":null,"work_id":"98a2a8ec-6d3c-4959-a95a-e336fda983d0","year":1908},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/1908.05659","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:d4e164f2647415973b10214c8c0b3e1e680deda3eac47549c73535e6005d42eb","observation_id":"8370ecf0-345b-45d3-a46c-1554ab0623e6","resolution":{"observed_at":"2026-05-23T22:03:30.926217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational Analysis , volume 317","venue":null,"work_id":"4c3a1d41-025b-470b-9671-940e5381b7ae","year":2009},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:2c96c15ab2a8a1bb98215237f5ec6a91862bf7a57e920c128051e84666120eeb","observation_id":"e3b06707-cdeb-4798-bf15-0e2a2bf8b73b","resolution":{"observed_at":"2026-05-24T03:15:59.022088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04870","last_updated":"2020-10-10T01:53:37Z","snapshot_observed_at":"2026-07-06T10:03:10.192827Z","submitted_at":"2020-10-10T01:53:37Z","title":"Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty","version":1},"cited_work":{"arxiv_id":"2010.04870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.04870","snapshot_observed_at":"2026-07-02T11:06:53.384574Z","title":"Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty","venue":null,"work_id":"bad21a25-eab2-4415-aaac-0cf3fdd0e584","year":2010},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2010.04870","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:e28a1dfe817474b43240d7090e03231f81899c795d75da1c6f78a5b60eda2e30","observation_id":"b6e106d1-da69-469b-ba45-934f39ea08c0","resolution":{"observed_at":"2026-05-23T22:03:30.903662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On General Minimax Theorems","venue":null,"work_id":"eccc8c90-f8a9-4850-944f-ce3db538490b","year":1958},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6ec1031f4bd7b9fd6cedbbce8f0f975021731f89441f5ab2d718f3ac44cf1da3","observation_id":"4709763d-2593-4b28-ba0f-e238b6df8283","resolution":{"observed_at":"2026-05-24T03:15:59.062816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving Stabilize-Avoid Optimal Control via Epigraph Form and Deep Reinforcement Learning","venue":null,"work_id":"5110abb9-1d35-4cc5-8e25-47681a0f8ce5","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:b4728e2b196a32ecaba7489fa525bb117cd11491cff7e490e87f01bd38dcad0f","observation_id":"83b5a19d-d3db-4c0b-9ba3-fd38dcd2d209","resolution":{"observed_at":"2026-05-24T03:15:58.995642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving Minimum-Cost Reach Avoid using Reinforcement Learning","venue":null,"work_id":"d3303363-3de8-4b6f-855a-6b1ac9104669","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:8caaf9f6e5a7eb817974c3404ed2e65cbd7c90a4b39249598f45f9d19e2c243f","observation_id":"61bbc45d-2ea6-4e45-a06c-665c0a9964a0","resolution":{"observed_at":"2026-05-24T03:15:59.082673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01327","last_updated":"2024-05-03T17:24:11Z","snapshot_observed_at":"2026-07-06T18:08:47.546742Z","submitted_at":"2024-05-02T14:31:52Z","title":"Constrained Reinforcement Learning Under Model Mismatch","version":2},"cited_work":{"arxiv_id":"2405.01327","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained Reinforcement Learning Under Model Mismatch","venue":null,"work_id":"527d0d0e-1ccf-4d88-8a4e-cef0f1baed3b","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2405.01327","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:e74328fe2763523dce4ac194b796985077a473564a6fb9fac1bb420b3afd2d82","observation_id":"aa7ad849-f2a4-40a3-a822-d6e303af089e","resolution":{"observed_at":"2026-05-23T22:03:30.978455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward Constrained Policy Optimization","venue":null,"work_id":"bb1b058a-8856-4a15-85a7-cdb67729ca18","year":2018},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c48717830af6491b73801d1fa37d76322788d6560cbda03dd03f87c2c2734ac0","observation_id":"7053fabc-25a0-4eb7-a42e-1210694cc7f5","resolution":{"observed_at":"2026-05-24T03:15:59.065868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy Gradient in Robust MDPs with Global Convergence Guarantee","venue":null,"work_id":"167a2792-a8a0-431f-87fd-835f8bd4d725","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:7b8afacac298b7fe2177a74e2a916a2fdca1dd46d11a2457e1257b8e60335402","observation_id":"bf59b2d0-d1ec-4164-a0e6-c3c253cc45f0","resolution":{"observed_at":"2026-05-24T03:15:59.042401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Robust Reinforcement Learning with Model Uncertainty","venue":null,"work_id":"08eb91f1-f6cd-42c6-b3a9-920d75669059","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:d668af6df5f7f2fb73c12b23085b29e14df3eca2fc7ea2434f3c8ff0ecfc0146","observation_id":"4ca009c7-8fda-40f3-bbf4-40845646dcdc","resolution":{"observed_at":"2026-05-24T03:15:59.009160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy Gradient Method for Robust Reinforcement Learning","venue":null,"work_id":"8cf42c0d-c47b-45ae-b8c9-54fdcf461633","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:759eb21146e18e7310124e67d7fc2044b4c4c5af3cb44c19797c1c556a53113a","observation_id":"f357eaf3-36c2-4c49-b676-82aae3be6ced","resolution":{"observed_at":"2026-05-24T03:15:59.069063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06866","last_updated":"2022-09-14T18:29:02Z","snapshot_observed_at":"2026-07-06T13:52:20.672299Z","submitted_at":"2022-09-14T18:29:02Z","title":"Robust Constrained Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2209.06866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.06866","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Constrained Reinforcement Learning","venue":null,"work_id":"20d4b0ad-41bb-434c-9169-7d930c76cb32","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2209.06866","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:9cfb63a1ff69cfc703a88f4c7b8b35626ac61c966998196a653e8cd86c89bf97","observation_id":"1df4ecea-cd46-421f-98dd-7165b08b020f","resolution":{"observed_at":"2026-05-23T22:03:30.895012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01577","last_updated":"2021-10-23T04:56:05Z","snapshot_observed_at":"2026-07-06T11:15:26.915483Z","submitted_at":"2021-06-03T03:53:27Z","title":"A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes","version":2},"cited_work":{"arxiv_id":"2106.01577","doi":"10.48550/arxiv.2106.01577","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.01577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes","venue":"arXiv (Cornell University)","work_id":"3d532399-c6dd-4754-bcdd-b2dcccc0f81d","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2106.01577","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:68882c11d1471cf7a9b0a820fa305cc65f37e6db967621fc65cc7eda3c478757","observation_id":"5378cdf3-dd43-45ed-9659-d97273c92922","resolution":{"observed_at":"2026-05-23T22:03:30.954711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T12:50:01.570706+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T12:50:01.570706+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Markov Decision Processes","venue":null,"work_id":"ee9b6b61-35c6-4e51-b7cd-c0a3551d6400","year":2013},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c7b31d9a74f53da9766c4d60b571c55510552802150b25382b66042dbbfb82bd","observation_id":"4738e297-0b61-4de9-bbbd-3c25b96c8fb6","resolution":{"observed_at":"2026-05-24T03:15:59.048691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward Theoretical Understandings of Robust Markov Decision Processes: Sample Complexity and Asymptotics","venue":null,"work_id":"40536169-8285-4552-b727-36e46c76349a","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:81fe9a9d9a3e825503906c9baaefbb78f67386e1464ab27775bd9e0a8b49ead1","observation_id":"f961d062-3d3a-4673-9cd3-7cb53cf5d8a7","resolution":{"observed_at":"2026-05-24T03:15:59.052046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01248","last_updated":"2023-09-12T16:20:15Z","snapshot_observed_at":"2026-07-06T14:47:44.812529Z","submitted_at":"2023-02-02T17:29:10Z","title":"Robust Markov Decision Processes without Model Estimation","version":2},"cited_work":{"arxiv_id":"2302.01248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.01248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Markov Decision Processes without Model Estimation","venue":null,"work_id":"da90e402-e9d7-40e9-860c-fe8665cd2649","year":2023},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2302.01248","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:f0c5cb685208a5e3e3f48ebb6ba452b791c28ba2549f02e12b9784bcdbbf588d","observation_id":"904566eb-d44f-49e5-89f9-d9408f108001","resolution":{"observed_at":"2026-05-23T22:03:30.890063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Dual Approach to Constrained Markov Decision Processes with Entropy Regularization","venue":null,"work_id":"576ee205-9ea8-49d7-8ec8-67919ed9b01e","year":2022},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:6081511aca29dd04509554be4e8359bcdb7de9ebe818a389b7af14a205315f65","observation_id":"7922776d-1575-498d-9fa8-5b54ea2f4e6c","resolution":{"observed_at":"2026-05-24T03:15:59.025291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward is Enough for Convex MDPs","venue":null,"work_id":"1cdc8ae6-9ffa-405f-aea3-a55a86e09e53","year":2021},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:f1c42f13353f835d1b58e0f5086e1f7213275dc562859492cec389eae5d17723","observation_id":"13626867-78af-47f2-b0ad-cdda4f8fc04b","resolution":{"observed_at":"2026-05-24T03:15:59.018639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feedback and Optimal Sensitivity: Model Reference Transformations, Multiplicative Seminorms, and Approximate Inverses","venue":null,"work_id":"83d561d3-15d4-4202-b8a5-df7570d27014","year":1981},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:c83dabdde296f860652d24c60bd06945bb507cd5a82f556ef7970a3a742d2ff9","observation_id":"1d6bfaef-4e0f-463c-be4f-7355017e1334","resolution":{"observed_at":"2026-05-24T03:15:58.955755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15788","last_updated":"2024-06-22T08:51:57Z","snapshot_observed_at":"2026-08-04T16:52:15.108914Z","submitted_at":"2024-06-22T08:51:57Z","title":"Distributionally Robust Constrained Reinforcement Learning under Strong Duality","version":1},"cited_work":{"arxiv_id":"2406.15788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15788","snapshot_observed_at":"2026-07-04T08:49:42.802155Z","title":"Distributionally Robust Constrained Reinforcement Learning under Strong Duality","venue":null,"work_id":"cc150c71-dd74-42e2-b894-b073a5698d9e","year":2024},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"cited_paper":"/paper/2406.15788","citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:e163471c38a873909f23e335ed5c6dd5dd05d5e984e9d66df31f084b070ef967","observation_id":"0b6c0030-1532-494e-b032-dfeb7dfbad91","resolution":{"observed_at":"2026-05-23T22:03:30.964295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constrained Upper Confidence Reinforcement Learning","venue":null,"work_id":"fe63f4f4-0256-4d21-bbe4-33b951917183","year":2020},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:ae067a5d4698da0287a7f37264def04a204eef4198734c6fef8d5b2c1fb89494","observation_id":"df2500fa-80ac-4042-b7e0-986959c16af2","resolution":{"observed_at":"2026-05-24T03:15:59.003266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:3f98420e739ee316db113bcac47960e5fe8b9d7dcc92371a07da7dcb69031a75","observation_id":"ef2c8820-73ef-45e4-8ccc-e5440ae53d5a","resolution":{"observed_at":"2026-05-24T03:08:50.039368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:60e2de30cc77f35af771ddecce53e83b152188e82a516c4fd1684e4ac1766ca6","observation_id":"afad99e6-166d-40c3-aa7b-9079e5873e01","resolution":{"observed_at":"2026-05-24T03:08:50.043144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"sections/0000775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.518634Z","title":"Victoria Beckham","venue":null,"work_id":"cfe3a426-5686-482e-af8a-d1bcde35a5a4","year":2026},"citing_paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form","version":5},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-23T21:58:56.180393Z"},"links":{"citing_paper":"/paper/2408.16286"},"observation_digest":"sha256:2ffb26a7ed7c216ac7d5299624e027a499fe5e9bf348e2d7f14d9189c078cd1c","observation_id":"cb767936-0230-4834-a91e-20b79afa7ac7","resolution":{"observed_at":"2026-05-23T22:03:30.973878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2408.16286","last_updated":"2026-04-24T03:11:36Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T07:01:54.251485Z","submitted_at":"2024-08-29T06:37:16Z","title":"Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":22,"verified_fuzzy":63},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 2 inbound Pith citation observations for arXiv:2408.16286."}