{"as_of":"2026-08-08T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecf9f7c8bcea3e9fcbb1313fb073c3c62d47d77ba78b3fd78d6edce12d490d88","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:35:51.668145Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21841/citation-record","integrity":"/paper/2505.21841/integrity","json":"/paper/2505.21841/citation-record.json","paper":"/paper/2505.21841"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:34:28.970873Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:34:28.970873Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:a9a64ee47a285b8afc3bffb9f32d625605b601e5a5177306b841ad3285dbc35f","observation_id":"505562c8-8319-48b4-a76b-f495dc7b1a99","resolution":{"observed_at":"2026-08-07T13:34:28.970873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.335582Z","title":"Constrained policy optimization","venue":null,"work_id":"0a9e786f-b175-4f42-81a4-90a2eef504b9","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.027164Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:2787b1ab4cc3ffa1d9a6720b58418045e6ac4a11d52966d89458a9456f82e616","observation_id":"630fe61f-14f5-4025-aa51-0741d651fe4b","resolution":{"observed_at":"2026-08-07T13:35:58.539697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.141991Z","title":"Constrained Markov decision processes, volume 7","venue":null,"work_id":"974207d9-8209-4223-9e41-d20758e39144","year":1999},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.159068Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:f87940513bbf719b18b4150f0906f24b2fe80fcf3eced9945069df131b809bad","observation_id":"00939444-31d3-4e08-bcf8-9f10515a817e","resolution":{"observed_at":"2026-08-07T13:35:58.227495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.934683Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"a8556362-f748-439d-a9c0-5e07fbb75f4b","year":2008},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.450316Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:97c09546b942cc9d7d85441826d16c1ff4dd848091de4fab73e5585201de42eb","observation_id":"702aad4e-aa41-47b2-bc61-d37059c9958e","resolution":{"observed_at":"2026-08-07T13:35:58.051680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:47.683128Z","title":"G., Osband, I., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.683128Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5add85cee4e6f223324ffc6979204ff0a018b196eb3c6c61363f1073e267e40c","observation_id":"f732cb5a-352a-4cee-a1b6-46c437e7cb63","resolution":{"observed_at":"2026-08-07T13:35:47.683128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.690389Z","title":"S., Agarwal, M., Koppel, A., and Aggarwal, V","venue":null,"work_id":"198eb068-5fd3-4ccb-b22e-6b7f8b4fc961","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.767912Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:7b64a84b973d8b6494ed748da86f6621890141e3e9aa50039313c98f80fc789c","observation_id":"11fef369-1567-4313-a78b-c6b810038091","resolution":{"observed_at":"2026-08-07T13:35:57.781747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00885","last_updated":"2022-10-18T01:23:03Z","snapshot_observed_at":"2026-07-06T12:14:24.842188Z","submitted_at":"2021-12-01T23:21:48Z","title":"DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2112.00885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00885","snapshot_observed_at":"2026-08-07T13:35:53.447482Z","title":"DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning","venue":"cs.LG","work_id":"504fd8cf-6f48-430b-a480-02276df3e5b9","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:47.885604Z"},"links":{"cited_paper":"/paper/2112.00885","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:ab2ab8e731ff46a6817bc07bb58808317ce5055fc1cecb5854364f9f3eb3d8a7","observation_id":"eff5fcfe-0b06-4347-bcf2-9688eb8b64b2","resolution":{"observed_at":"2026-08-07T13:35:53.527372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05284","last_updated":"2021-06-14T07:13:54Z","snapshot_observed_at":"2026-07-06T10:40:05.875880Z","submitted_at":"2021-02-10T06:33:04Z","title":"Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case","version":2},"cited_work":{"arxiv_id":"2102.05284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.05284","snapshot_observed_at":"2026-08-07T13:35:53.242866Z","title":"Finding the Stochastic Shortest Path with Low Regret: The Adversarial Cost and Unknown Transition Case","venue":"cs.LG","work_id":"ab897678-bbfc-4318-be3c-a0c3b8b6c53b","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.002331Z"},"links":{"cited_paper":"/paper/2102.05284","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:f553eb9dec6f97c1367c6c61d228e602f6627a6e0ebff8d479268796b129d230","observation_id":"3347a759-18a2-4458-a690-11666c403118","resolution":{"observed_at":"2026-08-07T13:35:53.355079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.497902Z","title":"Learning infinite-horizon average-reward markov decision process with constraints","venue":null,"work_id":"8e89533a-bc80-4eaf-bc47-d62ceedf03a9","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.098233Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:d27a1f0ff7ac87b6e02a3b08f562d7aa87291c03cb4c363b2b028b2c2fc1179e","observation_id":"900a97dd-cfee-456f-953d-bbc0c71787bc","resolution":{"observed_at":"2026-08-07T13:35:57.621924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.172896Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":"c582c1e9-0cf1-4bc5-9231-2b2265aa9b40","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.234339Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:3a97efbb9cbcd23e3556522135276cd74fb2b367db33fc7aa79c8ad8cce696f2","observation_id":"06e5816d-1349-4dd4-b8ec-d67ed52b0e08","resolution":{"observed_at":"2026-08-07T13:35:57.335859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.897804Z","title":"Unifying pac and regret: Uniform pac bounds for episodic reinforcement learning","venue":null,"work_id":"6b0613a0-4e16-457e-9795-1c5c6384f05d","year":2017},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.336113Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:ca0c020f035ea16e2c1c14bae12b78c4a4c33f18d9db35df95f3346979d66414","observation_id":"8fcd96a9-0e4c-43af-b02f-be102f098bb2","resolution":{"observed_at":"2026-08-07T13:35:57.018850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.715880Z","title":"Provably efficient safe exploration via primal-dual policy optimization","venue":null,"work_id":"087dfb2b-1c1b-49e6-963c-66b9ed8c999b","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.467808Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:772baf3bf716aaa589eb0831aea802a77c78c2153dc3f0aab95edbfc9b4d5151","observation_id":"cdc0c94a-c330-4168-81ad-7bdc10a34556","resolution":{"observed_at":"2026-08-07T13:35:56.831806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11965","last_updated":"2022-11-19T22:54:07Z","snapshot_observed_at":"2026-07-06T12:32:06.877009Z","submitted_at":"2022-01-28T07:18:29Z","title":"Provably Efficient Primal-Dual Reinforcement Learning for CMDPs with Non-stationary Objectives and Constraints","version":4},"cited_work":{"arxiv_id":"2201.11965","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.11965","snapshot_observed_at":"2026-08-07T13:35:52.991684Z","title":"Provably Efficient Primal-Dual Reinforcement Learning for CMDPs with Non-stationary Objectives and Constraints","venue":"cs.LG","work_id":"c4d75177-aa42-40bc-ac0a-a5dfa64ae50b","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.569789Z"},"links":{"cited_paper":"/paper/2201.11965","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:6f9ce8e885999d317dff920d685f63aff1a85bee71003e99ced65f13cd7da22c","observation_id":"6e50368c-c30d-4027-b003-6cdfbcd64dc7","resolution":{"observed_at":"2026-08-07T13:35:53.098564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-05T18:34:50.706165Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-07T13:35:48.684747Z","title":"Exploration-exploitation in constrained MDP s","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.684747Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:520e519a57fb6b97daa625fd64707204d8e97b15f80c30414b90ab1c547b6972","observation_id":"9b1fab1b-2b67-43ce-a413-b9e645253a4c","resolution":{"observed_at":"2026-08-07T13:35:48.684747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14326","last_updated":"2024-08-29T06:17:11Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T16:58:29Z","title":"A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints","version":2},"cited_work":{"arxiv_id":"2304.14326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.14326","snapshot_observed_at":"2026-08-07T13:35:52.691095Z","title":"A Best-of-Both-Worlds Algorithm for Constrained MDPs with Long-Term Constraints","venue":"cs.LG","work_id":"2068b860-f1f8-47aa-935d-32096eb9e9a0","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.792791Z"},"links":{"cited_paper":"/paper/2304.14326","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:b728ef48c1893124e011c944f2c3647640489d2206bcba96dfee9eada0790ea6","observation_id":"3ad0cfde-e1bf-4a66-b104-c999d0353657","resolution":{"observed_at":"2026-08-07T13:35:52.838965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.532642Z","title":"Provably efficient model-free constrained rl with linear function approximation","venue":null,"work_id":"b7da0fb1-8bd4-40ca-bf1f-c0e1ec750833","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:48.894556Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:481e212cb371c75523a19a8890ce764da74b0e225e84b9cb19adad6b0548ecbb","observation_id":"e064fe05-10de-4988-a9a1-0ebb44156973","resolution":{"observed_at":"2026-08-07T13:35:56.615244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.359867Z","title":"Online convex optimization with hard constraints: Towards the best of two worlds and beyond","venue":null,"work_id":"ec9d0bdb-648c-4dda-8519-f239cab32a26","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.064830Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:55722eae459aa4b653744c7a76e3751cc320f6e0e5028aefdfaf869b1ae51c46","observation_id":"d06a5db2-2c72-4b9a-bcbc-5682e2b3ec77","resolution":{"observed_at":"2026-08-07T13:35:56.433971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:56.174450Z","title":"Safe reinforcement learning on autonomous vehicles","venue":null,"work_id":"e0dda4eb-bc12-4d6a-8eec-329b7e1103cb","year":2018},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.160323Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:a897495d755652acbb6afb4ce6ec0ae691cd771fc6be2a84545a5cefb95d8bea","observation_id":"55b6921b-dfe2-4b24-92c6-c7e51f6ea4aa","resolution":{"observed_at":"2026-08-07T13:35:56.252065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.988347Z","title":"Learning adversarial markov decision processes with bandit feedback and unknown transition","venue":null,"work_id":"c5cece8b-1765-4d11-8f8b-75602e70aa3c","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.233974Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:581acee5b36f17479cef3502f68b06e0e1b66bbfd9ba846f2a0d1302944d28b5","observation_id":"cd4ebc55-86eb-4332-9128-e09e759b68b5","resolution":{"observed_at":"2026-08-07T13:35:56.073085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.05944","last_updated":"2021-07-02T08:21:07Z","snapshot_observed_at":"2026-08-06T00:52:01.343606Z","submitted_at":"2020-11-11T18:01:59Z","title":"Asymptotically Optimal Information-Directed Sampling","version":4},"cited_work":{"arxiv_id":"2011.05944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.05944","snapshot_observed_at":"2026-08-07T13:35:52.532739Z","title":"Asymptotically Optimal Information-Directed Sampling","venue":"stat.ML","work_id":"a7599f03-b39c-4948-9dc7-9116d55bc5d3","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.315365Z"},"links":{"cited_paper":"/paper/2011.05944","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:7f04394b7c8822fef62525e6dcc79862b00bdf35af067bf3037b840f34d1d2c3","observation_id":"4cc7faf8-aad4-4a61-8a87-fc00818c6150","resolution":{"observed_at":"2026-08-07T13:35:52.598973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17780","last_updated":"2024-07-01T12:08:25Z","snapshot_observed_at":"2026-08-02T09:21:27.139700Z","submitted_at":"2024-01-31T12:23:24Z","title":"A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17780","snapshot_observed_at":"2026-08-07T13:35:49.425405Z","title":"A policy gradient primal-dual algorithm for constrained mdps with uniform pac guarantees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.425405Z"},"links":{"cited_paper":"/paper/2401.17780","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:50dc8007aa5e2039f9b62df5a11af65e61ffd48f7270298e2b4bc93a180422fc","observation_id":"3152b411-b341-40c6-8c39-757ffd025609","resolution":{"observed_at":"2026-08-07T13:35:49.425405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08060","last_updated":"2025-03-12T21:09:19Z","snapshot_observed_at":"2026-08-03T11:49:21.596943Z","submitted_at":"2024-12-11T03:06:42Z","title":"An Optimistic Algorithm for Online Convex Optimization with Adversarial Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08060","snapshot_observed_at":"2026-08-07T13:35:49.517407Z","title":"and Jordan, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.517407Z"},"links":{"cited_paper":"/paper/2412.08060","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:84bff569f99caf89902648a51ec5af0bc1fc86675566197fac7322b11e8fa1ae","observation_id":"a8af659f-5cf7-463d-b447-43f7d5501947","resolution":{"observed_at":"2026-08-07T13:35:49.517407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.852747Z","title":"Learning policies with zero or bounded constraint violation for constrained MDPs","venue":null,"work_id":"bf92d3b0-c0d3-41a9-aaee-cde7349e3580","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.610537Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5151aa96d1338927f641fa82aafd966cfa89617cbc4ddce332e9bc9088e9b464","observation_id":"0ae5c9b7-2a55-4a3d-8f5c-2bddaf7c3ce1","resolution":{"observed_at":"2026-08-07T13:35:55.912890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.621439Z","title":"Learning policies with zero or bounded constraint violation for constrained mdps","venue":null,"work_id":"92e362fd-8027-48d0-a614-30a38a18de20","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.718689Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5f9836b514e12b0ada3329986da75859e1f14b912740fc9d5c7adc8ee1722a93","observation_id":"43ca9dfd-247a-45e0-8f8d-a91c9e1a2c08","resolution":{"observed_at":"2026-08-07T13:35:55.746482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.413440Z","title":"Policy optimization in adversarial mdps: Improved exploration via dilated bonuses","venue":null,"work_id":"4d5fe721-7e16-4d78-868d-2eadccc8b32c","year":2021},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.844197Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:511a644aa343cdc4c5a0b47d02d653d653461e3d59dec932115efd88f3568c4a","observation_id":"30023b5d-0b14-481a-8259-27aae1a15833","resolution":{"observed_at":"2026-08-07T13:35:55.501758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07001","last_updated":"2023-08-30T15:58:45Z","snapshot_observed_at":"2026-08-03T19:55:33.572828Z","submitted_at":"2023-06-12T10:10:57Z","title":"Cancellation-Free Regret Bounds for Lagrangian Approaches in Constrained Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07001","snapshot_observed_at":"2026-08-07T13:35:49.965851Z","title":"Cancellation-free regret bounds for lagrangian approaches in constrained markov decision processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:49.965851Z"},"links":{"cited_paper":"/paper/2306.07001","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:439a7391a00b564860db0b585d649a326e9b106131531f19bc71c4bf716ce76b","observation_id":"b0a2135b-3cbe-424a-981b-d9ac16ab7d0a","resolution":{"observed_at":"2026-08-07T13:35:49.965851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15776","last_updated":"2024-07-19T14:00:43Z","snapshot_observed_at":"2026-08-05T13:09:01.112216Z","submitted_at":"2024-02-24T09:47:46Z","title":"Truly No-Regret Learning in Constrained MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15776","snapshot_observed_at":"2026-08-07T13:35:50.106454Z","title":"Truly no-regret learning in constrained mdps","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.106454Z"},"links":{"cited_paper":"/paper/2402.15776","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:2850025b8f6987201bee9356e0b21301eb5e9459f14bbbcfd49df1e189dd4431","observation_id":"132bc39d-c3d1-47da-bf21-fd3bedf6e30a","resolution":{"observed_at":"2026-08-07T13:35:50.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.135818Z","title":null,"venue":null,"work_id":"04d2a870-bb50-41a4-a32d-d6e5d5478bf4","year":2010},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.236838Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:0b2f0789816f782811d38162755b87049cbd8d8eb44eebf0889629e4c4322bb8","observation_id":"4bd08f26-9eb0-45c3-84b4-49c23f9636e1","resolution":{"observed_at":"2026-08-07T13:35:55.253773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.959075Z","title":"Upper confidence primal-dual reinforcement learning for CMDP with adversarial loss","venue":null,"work_id":"0d7b9ec9-898f-4c09-b493-fadbc483315f","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.374739Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:1cce3594b73efb56cdb942553e977b2527cbe532b82452c4cb2d457ee75b91d4","observation_id":"d496fcf0-1dd2-49f9-b471-fda868e43a9b","resolution":{"observed_at":"2026-08-07T13:35:55.038809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.664835Z","title":"and Sridharan, K","venue":null,"work_id":"33c3c427-6d7f-4af2-b121-b51b2c5a60c3","year":2013},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.535752Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:07dad60d6a0b759af8afaffa3b9620034b6313115e7905ddd539a15e9370bbaf","observation_id":"1d7336e1-2e04-4a89-9b5c-f897fe1b595d","resolution":{"observed_at":"2026-08-07T13:35:54.836763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12435","last_updated":"2022-01-05T19:21:00Z","snapshot_observed_at":"2026-07-06T09:00:46.442419Z","submitted_at":"2020-02-27T20:58:39Z","title":"Learning in Markov Decision Processes under Constraints","version":5},"cited_work":{"arxiv_id":"2002.12435","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.12435","snapshot_observed_at":"2026-08-07T13:35:52.255278Z","title":"Learning in Markov Decision Processes under Constraints","venue":"cs.LG","work_id":"8b475650-d4ef-4507-a043-30aee4d71d1f","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.654786Z"},"links":{"cited_paper":"/paper/2002.12435","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:713502ec38e117470db01e1ed081ac7d463b7026c3ba9ef19946af9766980eae","observation_id":"5435887d-aee8-47e5-be4a-1626685ea8d8","resolution":{"observed_at":"2026-08-07T13:35:52.311657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18955","last_updated":"2024-10-27T16:37:56Z","snapshot_observed_at":"2026-08-07T09:23:39.294571Z","submitted_at":"2023-10-29T09:55:41Z","title":"Optimal Algorithms for Online Convex Optimization with Adversarial Constraints","version":3},"cited_work":{"arxiv_id":"2310.18955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18955","snapshot_observed_at":"2026-08-07T13:35:52.098114Z","title":"Optimal Algorithms for Online Convex Optimization with Adversarial Constraints","venue":"cs.LG","work_id":"1f3ef9bb-ec24-41c0-a7aa-d7dbe7e34fed","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:50.768281Z"},"links":{"cited_paper":"/paper/2310.18955","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:2090f81d3688c98a02b8080503c1d2cc261e4185fc6a369819bcc8bf5c76d774","observation_id":"69f3302e-3541-4a29-b121-6ab7b2a4be2f","resolution":{"observed_at":"2026-08-07T13:35:52.145545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03672","last_updated":"2025-02-07T14:08:39Z","snapshot_observed_at":"2026-08-03T19:03:13.558970Z","submitted_at":"2024-03-06T12:49:08Z","title":"Learning Adversarial MDPs with Stochastic Hard Constraints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03672","snapshot_observed_at":"2026-08-07T13:35:51.044652Z","title":"E., Castiglioni, M., Marchesi, A., and Gatti, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.044652Z"},"links":{"cited_paper":"/paper/2403.03672","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:fecad7404555c81101ba28ac143423da7ce06eae91780970ae9ceb4d43839557","observation_id":"a182d344-fcc4-42ee-bf95-7cbc40d03d95","resolution":{"observed_at":"2026-08-07T13:35:51.044652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02275","last_updated":"2024-10-03T07:54:04Z","snapshot_observed_at":"2026-07-06T19:26:49.672415Z","submitted_at":"2024-10-03T07:54:04Z","title":"Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization","version":1},"cited_work":{"arxiv_id":"2410.02275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02275","snapshot_observed_at":"2026-08-07T13:35:51.787799Z","title":"Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization","venue":"cs.LG","work_id":"2acb72e9-0bd0-48be-acb8-fb4795419475","year":2024},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.152297Z"},"links":{"cited_paper":"/paper/2410.02275","citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:acec31e040537a638f854b6a0d8f6bf5678a5a4862edbc0a4b5cfe80a18153cc","observation_id":"b8adca20-6eb5-4929-a697-dde12424916b","resolution":{"observed_at":"2026-08-07T13:35:51.890075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.448102Z","title":"Triple-Q: a model-free algorithm for constrained reinforcement learning with sublinear regret and zero constraint violation","venue":null,"work_id":"d1642971-7ed2-4d6a-9cc0-5f6f2722c25b","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.294799Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:a33d42bc33b651c383634af868faa5741d86c022b21ba8464238f2b3bd92a9cb","observation_id":"18847069-32b1-4364-aee1-77751cd6bdd9","resolution":{"observed_at":"2026-08-07T13:35:54.549056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.277471Z","title":"A provably-efficient model-free algorithm for infinite-horizon average-reward constrained markov decision processes","venue":null,"work_id":"d9fb71fa-c2d0-4657-a6ad-67ac7f12a61f","year":2022},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.366080Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:b384e6a2cd1b5c3b9210e91e86bb00648e771eed0afd2b8ed1c1af8c70dc1306","observation_id":"ac158d50-b7f6-4f0d-928e-2102d5c876fb","resolution":{"observed_at":"2026-08-07T13:35:54.348961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.071119Z","title":"Provably efficient model-free algorithms for non-stationary CMDP s","venue":null,"work_id":"656fe4c3-6e27-4277-966a-321f786de311","year":2023},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.499356Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:2712220fd10fd1a2dbf5e1e299eb749ee94ea58fc23122405aee7c45cfd423fc","observation_id":"10b44870-fe67-4b09-aa82-f812732727e1","resolution":{"observed_at":"2026-08-07T13:35:54.171541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.865210Z","title":null,"venue":null,"work_id":"d1551b66-bd56-4781-99e1-47664e1d570c","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.570309Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:5d6cefba715981820efc4ff3cad7a9b4544313273d9e6df92d161d7ad53346da","observation_id":"531160d9-5088-45ee-a051-a9a4dcc157ab","resolution":{"observed_at":"2026-08-07T13:35:53.960811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.650305Z","title":"and Ugot, O.-A","venue":null,"work_id":"19369051-3a85-468e-b62b-90b3845b1dc9","year":2020},"citing_paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:51.668145Z"},"links":{"citing_paper":"/paper/2505.21841"},"observation_digest":"sha256:cb6942b63228178f91479659a8abff2b81afb97fb050091635599bf2c833bb92","observation_id":"42c9f1b7-449e-4905-b842-e43a45cd2e29","resolution":{"observed_at":"2026-08-07T13:35:53.728331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21841","last_updated":"2025-05-28T00:16:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:19:25.695756Z","submitted_at":"2025-05-28T00:16:34Z","title":"An Optimistic Algorithm for online CMDPS with Anytime Adversarial Constraints"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":6,"verified_fuzzy":21},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.21841."}