{"as_of":"2026-08-22T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb595211f0ac6838b530cbb617d759ee22217761d729fcc3e0f812b39060d3f3","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T15:10:49.492879Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24345/citation-record","integrity":"/paper/2605.24345/integrity","json":"/paper/2605.24345/citation-record.json","paper":"/paper/2605.24345"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.202903Z","title":"Proceedings of the Thirty-First Conference on Uncertainty in Artificial Intelligence, 1--11","venue":null,"work_id":"b6e447a6-0c04-496b-8944-4e5dcfd04897","year":2015},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:c79b6e9678420a503574d7a497d5569811fa583dcc97c033f07b5dd103188cc4","observation_id":"fce107f6-b1d3-43f8-bc1d-9c05dc460b1d","resolution":{"observed_at":"2026-07-08T18:35:27.204120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.204722Z","title":"Mathematics of Operations Research 48(1):363--392","venue":null,"work_id":"c587f899-5936-4c0c-a449-e0ed88a5ec59","year":2023},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:a396987bd245090eb2a6482cda1ace1c829839d536f7f690b00334e816651f24","observation_id":"9a8142b0-a82e-487e-b742-f98aa026c379","resolution":{"observed_at":"2026-07-08T18:35:27.205919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.206457Z","title":"Proceedings of the 34th International Conference on Machine Learning, volume 70 of Proceedings of Machine Learning Research, 263--272","venue":null,"work_id":"a78fbe77-fb2c-46fe-a6c9-b9ad3c8770fc","year":2017},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:97bef863b5938d3144c6a6ad143569e2ddd7a13a06449d008213d2735d21daf9","observation_id":"21c821f7-3aed-4057-82e9-5c58e7c3d611","resolution":{"observed_at":"2026-07-08T18:35:27.207655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.231983Z","title":"Proceedings of the 38th International Conference on Machine Learning, volume 139 of Proceedings of Machine Learning Research, 511--520","venue":null,"work_id":"658a4233-8bd9-4e0b-b25b-12066ea60f8a","year":2021},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5cc337f9de4cad8694ca372983e708cb499cbc2e33ae2903e0053dc7b9761cd5","observation_id":"4232c20d-876d-406e-8f9e-3d41ccb853e5","resolution":{"observed_at":"2026-07-08T18:35:27.233233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.183387Z","title":"Proceedings of the Twenty-Fifth Conference on Uncertainty in Artificial Intelligence, 35--42 (AUAI Press)","venue":null,"work_id":"57d5a158-e56f-47ae-b9d9-452fa545bd7d","year":2009},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5bb3fd74fef9335dea17a7de335f892ea17f5bff87ff958ce5c64280cc85c442","observation_id":"abfb1525-1f8e-4219-a9f3-d25dfbadcbcc","resolution":{"observed_at":"2026-07-08T18:35:27.184949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.146664Z","title":"Advances in Neural Information Processing Systems, volume 36","venue":null,"work_id":"1ea8abda-d965-413d-a088-a2d69467bb1e","year":2023},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:cff2aeb6ec629cb65ab23390394213c451f0c470a3fa7ace21dbba580b1c29d6","observation_id":"dfbb9c4b-be19-4b46-b3d1-d060ee3514c4","resolution":{"observed_at":"2026-07-08T18:35:27.148463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.144920Z","title":"Electronic Journal of Statistics 3:114--148","venue":null,"work_id":"49a78e9f-d8c0-4517-b251-eb3bbdc6a2d5","year":2009},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5cb7f86c8117f35b5524aa70a4b288eb0b64a5a486b4cbf8b0fe896ee583c15f","observation_id":"e40f4c44-11f2-4529-88ca-49b3e4ce1836","resolution":{"observed_at":"2026-07-08T18:35:27.146064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.146859Z","title":"Journal of Machine Learning Research 3:213--231","venue":null,"work_id":"66ab8a65-e398-4e2b-b1d8-4fed48621f7c","year":2002},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5688d82f734fea5b6652730257e9e696c30e02256b2b8d628cb94005151089a7","observation_id":"16dbf3b4-9f60-49d0-814f-534bb37079b2","resolution":{"observed_at":"2026-07-08T18:35:27.151451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1080.0685","doi":"10.1287/opre.1080.0685","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Operations Research 58(1):203--213, ://dx.doi.org/10.1287/opre.1080.0685","venue":"Operations Research","work_id":"f8268322-e99c-4eac-980a-8d490851d7da","year":2010},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:c00d89cb3bc64712d08125b9d5df67b12ab3562521ed78ce9b409ce97bc6b42b","observation_id":"1dc7f7c3-b265-4299-9d23-8948ec7dcc86","resolution":{"observed_at":"2026-06-30T15:14:46.208508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.156311Z","title":null,"venue":null,"work_id":"e81324be-d8d3-4f35-93b5-4653ab1720c6","year":2009},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:a6a21ff81ef7c8fc422598935712b01a0bfc1af2e4e06ecb025fed2036602632","observation_id":"dc26404d-ef28-403c-aa23-7b70082db56f","resolution":{"observed_at":"2026-07-08T18:35:27.157493Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13841","last_updated":"2022-09-28T05:18:20Z","snapshot_observed_at":"2026-08-16T16:29:21.315037Z","submitted_at":"2022-09-28T05:18:20Z","title":"Online Policy Optimization for Robust MDP","version":1},"cited_work":{"arxiv_id":"2209.13841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.13841","snapshot_observed_at":"2026-06-30T15:14:46.892637Z","title":"ArXiv:2209.13841","venue":null,"work_id":"ae1e00fd-f406-4922-a63e-aec316e6f3f9","year":2022},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"cited_paper":"/paper/2209.13841","citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:b1d60ae10bca4f4ac5d0dccc71283bfeff2cff072fed38c21da477e512df631c","observation_id":"dbb3e075-3961-422d-a01b-c6990061fd55","resolution":{"observed_at":"2026-06-30T15:14:46.893972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.158041Z","title":"International Conference on Learning Representations","venue":null,"work_id":"e904d76a-4b89-47a7-a487-c897f02957c9","year":2020},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:f9ee7be068bfd9e6a7abe17319afc8e02713330881296bf6391fc10c452cb1ee","observation_id":"f36cfb98-ccd3-4bc8-b3e1-66059f69645a","resolution":{"observed_at":"2026-07-08T18:35:27.159214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.218646Z","title":null,"venue":null,"work_id":"0668626c-a385-4ea1-bf41-c951d3f1958a","year":2002},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:08ddff2da23543a64d7d449dc05eaccf1d0e27280171285998b7457a06b17ac5","observation_id":"cae65240-fb93-4107-af57-7dd40386570d","resolution":{"observed_at":"2026-07-08T18:35:27.219922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.220499Z","title":"Machine Learning 110(9):2419--2468","venue":null,"work_id":"3ba33a3d-babc-4aa2-8142-752a6630df1d","year":2021},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:2dd95eed2e2f02d24e747d96ee83b513ccbf17d0a5a151abd866e4296ec019d4","observation_id":"98f886db-c3c5-4c11-a32d-dce3a2414f50","resolution":{"observed_at":"2026-07-08T18:35:27.221961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.214554Z","title":"Proceedings of the Twenty Third International Conference on Artificial Intelligence and Statistics, volume 108 of Proceedings of Machine Learning Research, 1431--1441","venue":null,"work_id":"4ba36c88-c92b-4f97-96c8-e73a7e8a5cf0","year":2020},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5bd5b9ba4c602789c9010e79b42ef93a62ee9a12ede48c8bb382e69d56e6a942","observation_id":"4f607309-7731-4017-9425-c4ee617f33f9","resolution":{"observed_at":"2026-07-08T18:35:27.216093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.212441Z","title":"Foundations and Trends in Machine Learning 8(5--6):359--483","venue":null,"work_id":"3dee6ffd-445d-4d58-9cd3-39c73dc2bcd9","year":2015},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:857edb7917c7704100700a6c42fa0c502aa3244e406b3cb7921804089ec4ce26","observation_id":"c49e8f8a-b28e-4ac9-8618-ac62c7270fc8","resolution":{"observed_at":"2026-07-08T18:35:27.213818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.216617Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence 40(25):21278--21286","venue":null,"work_id":"51b84f45-75aa-4f4d-b238-37dabc3b578a","year":2026},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:88f39f39114dec66a2c3c4cc746718abd902d34499615644557cd4f9ef60cbb6","observation_id":"72b766f7-6dca-4721-abae-c6ff742e48f2","resolution":{"observed_at":"2026-07-08T18:35:27.218107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.222551Z","title":"Advances in Neural Information Processing Systems, volume 34, 22288--22300","venue":null,"work_id":"e64b75e7-bb8b-4e0b-a572-6308a41d8626","year":2021},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:d498314b64fd343dbbe751c30b98ca1b36dcbc5a05af631c8f335b1dcb265e8d","observation_id":"c59c3afd-cb5e-47e9-8b63-89cc045e9fe7","resolution":{"observed_at":"2026-07-08T18:35:27.223967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.224526Z","title":"Mathematics of Operations Research 30(2):257--280","venue":null,"work_id":"cc1e38a2-6a61-4a31-859c-5388d122451f","year":2005},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:e1ce87f4a0f5bd263638d079c2b42c201bdcad245c54b480502be3cb4b60546f","observation_id":"15656899-95c3-4135-99aa-c1d10d313e87","resolution":{"observed_at":"2026-07-08T18:35:27.225674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.226273Z","title":"Journal of Machine Learning Research 11(51):1563--1600","venue":null,"work_id":"83df6de1-01c2-439e-bf7a-e28fa4f7ddac","year":2010},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5403a5867aaeab9b3bba369b20916e40a4481837a19c11d9315500c47da6d074","observation_id":"ad2f6106-2d51-492c-88cd-d5f373c08dd0","resolution":{"observed_at":"2026-07-08T18:35:27.227622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.210254Z","title":null,"venue":null,"work_id":"fa304bc8-e540-452f-8ce0-f74ec1dd7305","year":2018},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:2280484e5912f3d81283878926bc0379d4358afe40c180a1b3d69e1a4550825b","observation_id":"5edd6949-e480-4fbc-bb1a-cd1e1cf6662b","resolution":{"observed_at":"2026-07-08T18:35:27.211778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.208274Z","title":"Machine Learning 49(2--3):209--232","venue":null,"work_id":"e1f87bfc-79bc-46b3-b4c2-d0dfa7625445","year":2002},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:da08ba5ed85c1d8baafb40edc8f9a5a1ca521451da81056f16ebcb62b2ded24a","observation_id":"466e473f-369c-40ec-a233-b28e28d28148","resolution":{"observed_at":"2026-07-08T18:35:27.209586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.237787Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence 39(27):28195--28203","venue":null,"work_id":"dc1e3b63-e53a-4afd-bb32-773f315ec65a","year":2025},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:60a1f18215a1152c125e472de9fe1f35d431e6e8b824a21a694659a2221b505a","observation_id":"6d80bb4a-fd2e-415d-b207-5f98ea70f530","resolution":{"observed_at":"2026-07-08T18:35:27.239083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.191532Z","title":"Advances in Neural Information Processing Systems, volume 35, 17430--17442","venue":null,"work_id":"b819f301-d2c9-4aa2-810e-b40cc388a16a","year":2022},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:17b8d425c8c1c43dfccbdc2b002308f2f624169d54ef1ab5371ca452957c04f6","observation_id":"2177d0ee-14fc-400b-9a4d-254c6a217d4f","resolution":{"observed_at":"2026-07-08T18:35:27.192768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.185322Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence 39(25):26605--26613","venue":null,"work_id":"a3892f26-4030-45d8-ba1a-4aa668d07982","year":2025},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:baf7fc3688a89ce2fd2f6954206a60f8299b2d97c4b7f82c4f9a3aea2ad286e2","observation_id":"b4f5bd30-6044-4a5a-b70b-684ca731a3af","resolution":{"observed_at":"2026-07-08T18:35:27.186782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.187424Z","title":"Advances in Neural Information Processing Systems, volume 37","venue":null,"work_id":"bf705579-0a78-4d03-af3f-38a8b2d75154","year":2024},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:57092007407629323c1e0c9d138dabd68579a1a2b7bacd7b6412e9c114df2c4f","observation_id":"d2075aaa-9d31-42b4-9491-0da5e1a9b915","resolution":{"observed_at":"2026-07-08T18:35:27.188706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.189558Z","title":"International Conference on Learning Representations","venue":null,"work_id":"32a50f10-089c-4c3c-86b0-df3f9d85bf12","year":2026},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:2398eb692c84bd886e86217192fb2b75dcf1d06c74f86bc2c702cbea2b5e13a6","observation_id":"29a596fd-4f49-4090-84ac-5621ace4d1d2","resolution":{"observed_at":"2026-07-08T18:35:27.190740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.193311Z","title":"Operations Research 53(5):780--798","venue":null,"work_id":"9540e07d-db62-4ec1-98d2-33cf43fa52c5","year":2005},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:ebf1f517db36af80d0b54f6cd795052376f9056735a16d8bc3ed8063fb14dd51","observation_id":"02306ffc-428f-40f4-b936-04f5d920300e","resolution":{"observed_at":"2026-07-08T18:35:27.194414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.196906Z","title":"Advances in Neural Information Processing Systems, volume 26","venue":null,"work_id":"a555de8f-834f-4772-a4a7-9d829a03e595","year":2013},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:fa1a246281d594da6eaa2570bc89e5b17f3f37b1577b9b33dae3caff53d9a032","observation_id":"b0b80b24-1e6b-4a08-8c55-27dbc3711154","resolution":{"observed_at":"2026-07-08T18:35:27.198834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.02731","last_updated":"2016-08-09T09:01:13Z","snapshot_observed_at":"2026-08-14T21:44:53.197250Z","submitted_at":"2016-08-09T09:01:13Z","title":"Posterior Sampling for Reinforcement Learning Without Episodes","version":1},"cited_work":{"arxiv_id":"1608.02731","doi":null,"metadata_source":"pith","pith_arxiv_id":"1608.02731","snapshot_observed_at":"2026-06-30T15:14:46.902711Z","title":"Posterior Sampling for Reinforcement Learning Without Episodes","venue":"stat.ML","work_id":"97e1b037-0994-41dc-8dce-f02c2cdc64fb","year":2016},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"cited_paper":"/paper/1608.02731","citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:fab9d3b4980e11c9b5d17dc598c4a9b52778700179504ba85556ba609a7ac9fd","observation_id":"b85bddfa-fc31-444e-b801-4e1e68e1de16","resolution":{"observed_at":"2026-06-30T15:14:46.903832Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.177830Z","title":null,"venue":null,"work_id":"4ccf2e4c-4ca7-4d08-86d8-d8e3da070a5e","year":2017},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:296155907130158ff08558ec04aeebc43beb5eb4174b4a331813228b7acfcff2","observation_id":"48188fe6-b22d-400b-8044-9d11957c9a8c","resolution":{"observed_at":"2026-07-08T18:35:27.179244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.181684Z","title":"Proceedings of The 25th International Conference on Artificial Intelligence and Statistics, volume 151 of Proceedings of Machine Learning Research, 9582--9602","venue":null,"work_id":"cdb64c7d-d323-40e6-ae87-e3ce64d62e99","year":2022},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:a40ec41c6c567c31f4b3ec3db3bfac67de86c095cecdf18db7845ba999e393ba","observation_id":"f8ede60a-79b3-4114-9ac3-6b3c2610301f","resolution":{"observed_at":"2026-07-08T18:35:27.182989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.179868Z","title":"Advances in Neural Information Processing Systems, volume 35, 32211--32224","venue":null,"work_id":"762ab6de-9881-4d40-b933-c719b1702353","year":2022},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:d56a45d3ccef1d214ccc0798e238985c8d991a3cf7353ae4868181d664aaa658","observation_id":"eb47cba3-2ab8-4c5e-bb08-276492fc0c74","resolution":{"observed_at":"2026-07-08T18:35:27.181086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.183554Z","title":"Proceedings of the 23rd International Conference on Machine Learning, 697--704","venue":null,"work_id":"87be6c07-997d-46ac-a3b0-817547e4a0af","year":2006},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:aebeeb004c8e0f592ab690c7759c44cff5e06a66ec0b5c95a275df096da40e69","observation_id":"af0a346a-ae20-42e9-b31a-78f4a2a95068","resolution":{"observed_at":"2026-07-08T18:35:27.184763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.199391Z","title":null,"venue":null,"work_id":"d24f4150-6b27-4efb-8a48-3bac6656c270","year":1994},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:8cd8e2859427047af1f0e1adb030ebb7fe44fd55b480fb418aa46cc74cd833d0","observation_id":"3ade112a-8976-4fe3-9c07-16e80ca55dd9","resolution":{"observed_at":"2026-07-08T18:35:27.200442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.195002Z","title":"Advances in Neural Information Processing Systems, volume 20, 1225--1232","venue":null,"work_id":"2b01bd43-c4b9-47d2-b65f-e67157c6b0b6","year":2007},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:669898bec9161a84e83832c97510de38608df5f93cc7f75196f1c4603e712055","observation_id":"33f1db7f-2183-437e-aba8-b90e092098ed","resolution":{"observed_at":"2026-07-08T18:35:27.196353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.235706Z","title":"Foundations and Trends in Machine Learning 11(1):1--96","venue":null,"work_id":"455dd081-714d-457e-abda-f979f8be7d38","year":2018},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:e44c9aa1f8c7ad0db7699a5000ca3c8965115b4c58a7d017a6b9a7a3d2cd7071","observation_id":"f1e886c7-6c48-451c-b698-97a376048208","resolution":{"observed_at":"2026-07-08T18:35:27.237143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.152030Z","title":"Proceedings of the 23rd International Conference on Machine Learning, 881--888 (ACM)","venue":null,"work_id":"5880a04f-02d1-415d-a0cd-ef7e926577b7","year":2006},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:f88bb72952da209037e8a1565be94aed0ee0b81c712e91c6648d5577a87007ae","observation_id":"d786e6a7-f166-41b7-a275-45058984496f","resolution":{"observed_at":"2026-07-08T18:35:27.155654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.159947Z","title":"Journal of Computer and System Sciences 74(8):1309--1331","venue":null,"work_id":"7b3cebf0-0d77-4fb8-8534-df3f55fb7a94","year":2008},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:7fc5571bf4c2c7cfdd9dacd1bdaebe1e99cff7252f2b5eec08c5967f125e1cd5","observation_id":"b713729e-e110-441d-9332-f0a18d517a57","resolution":{"observed_at":"2026-07-08T18:35:27.161308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13294","last_updated":"2023-11-22T10:23:14Z","snapshot_observed_at":"2026-08-18T13:30:45.312682Z","submitted_at":"2023-11-22T10:23:14Z","title":"Probabilistic Inference in Reinforcement Learning Done Right","version":1},"cited_work":{"arxiv_id":"2311.13294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13294","snapshot_observed_at":"2026-06-30T15:14:46.897664Z","title":"ArXiv:2311.13294","venue":null,"work_id":"38107689-d758-4407-af9e-2cf3c120f264","year":2023},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"cited_paper":"/paper/2311.13294","citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5ffa19d12f90a4fcbca4e3361841fdb70e463cd473edc2a9bcb1a965080b92ed","observation_id":"50c9e89b-ac18-4f82-96e7-67dc3d9857b4","resolution":{"observed_at":"2026-06-30T15:14:46.898979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.228199Z","title":"Proceedings of the 39th International Conference on Machine Learning, volume 162 of Proceedings of Machine Learning Research, 21380--21431","venue":null,"work_id":"106f17cd-670b-4375-a74e-c79834aec508","year":2022},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5c623b8d9bb84342d6ed96df184a9a840e0997535c34bb1971a419db64d7066f","observation_id":"1c4c0c84-94ae-4569-b292-c1a705cec25a","resolution":{"observed_at":"2026-07-08T18:35:27.229521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.233766Z","title":"Advances in Neural Information Processing Systems, volume 36","venue":null,"work_id":"be5dbdb4-740d-4b05-9364-f40e7aa0bf50","year":2023},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:6343ff650ae176390fdae50a7d70b944504919b6f2a1e8b20767c49010f58c0f","observation_id":"243e2625-4cf5-4ec4-bc57-29d8b4e61517","resolution":{"observed_at":"2026-07-08T18:35:27.235077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T15:14:46.895101Z","title":"arXiv preprint arXiv:2509.14077","venue":null,"work_id":"d1fdd5fb-215c-48a0-ae5b-ccb173fedda3","year":2025},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:6bfae946ec103d87b642dbb0942e0665fc63ab0a5c0c133b7bd010ce7edef3f6","observation_id":"292d6809-e8e4-4adc-a5bf-22d81513b3e8","resolution":{"observed_at":"2026-06-30T15:14:46.896400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.230068Z","title":"Advances in Neural Information Processing Systems, volume 34, 7193--7206","venue":null,"work_id":"7029c6bf-03ff-4c50-98ae-f5df8b2cf754","year":2021},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:80ff7e4801217b63f1153bce2778d212a9c8543088269c987d68aa9a2ec33f45","observation_id":"2b2ef86c-c21a-4cc1-8a1b-106b3ba4d0f9","resolution":{"observed_at":"2026-07-08T18:35:27.231366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.218440Z","title":"Mathematics of Operations Research 38(1):153--183","venue":null,"work_id":"ec3bcb9c-b700-4663-ba79-061465555cb7","year":2013},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:48e73680be66cf19bf2e89539f9b99b05b60b755e3cff3802e4ad94c9a4d21b2","observation_id":"3827dd32-194e-463f-8321-3b593b621327","resolution":{"observed_at":"2026-07-08T18:35:27.219737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.214386Z","title":"SIAM Journal on Optimization 28(2):1588--1612","venue":null,"work_id":"9bc5b7f0-a7d8-40bb-bd73-faa492cb75b5","year":2018},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:6a941575eb76e5743b22f6e3b988e81f678d77a7da1a0da60622c20e0cccbf90","observation_id":"9edd5da4-363d-4b0b-8da6-9db388c2b2d2","resolution":{"observed_at":"2026-07-08T18:35:27.215913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.196154Z","title":"Advances in Neural Information Processing Systems, volume 23","venue":null,"work_id":"688c206f-e023-40f9-a6a0-13a0ff4cc927","year":2010},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:5e5d46dcbb90b7745830be1f3fff383927e115ce7c9458f5f742147045875add","observation_id":"15cd185a-ffa1-4ea7-b4dd-80e8d0e5102a","resolution":{"observed_at":"2026-07-08T18:35:27.197905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.198650Z","title":"Reinforcement Learning Conference (RLC)","venue":null,"work_id":"08a703e4-7c35-46df-a74c-789131457488","year":2024},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:ea5c096d32b70d2417a744181c964124ab5adc50e941982bf1275a87ac0ddddf","observation_id":"257d9bae-8bf7-4348-a294-7b3bf0627b6a","resolution":{"observed_at":"2026-07-08T18:35:27.200168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18539","last_updated":"2024-03-30T10:07:21Z","snapshot_observed_at":"2026-08-16T14:05:54.495869Z","submitted_at":"2024-03-27T13:14:29Z","title":"Safe and Robust Reinforcement Learning: Principles and Practice","version":2},"cited_work":{"arxiv_id":"2403.18539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18539","snapshot_observed_at":"2026-06-30T15:14:46.900287Z","title":"ArXiv:2403.18539","venue":null,"work_id":"c118acda-5d10-4b60-b5c1-2f62d79a26fe","year":2024},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"cited_paper":"/paper/2403.18539","citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:770d225455dbe5e8f402b166f3ba8c976cb6d7db60040372b2a13b65dd60f47e","observation_id":"4c2a74bc-163c-49c2-9a55-a1d03bca2b20","resolution":{"observed_at":"2026-06-30T15:14:46.901529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.193785Z","title":"Proceedings of the 2015 Winter Simulation Conference, 3714--3724","venue":null,"work_id":"6df4b8df-d5d7-4c10-83fd-c6f832c64597","year":2015},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:8e844c7394bd654452066cedc8d6d0bec60c3035a3ed0cd15a3bb0fe4df7ef79","observation_id":"fdd82cc3-a609-477d-a34d-c9c3700968ae","resolution":{"observed_at":"2026-07-08T18:35:27.195449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.175781Z","title":"Proceedings of The 24th International Conference on Artificial Intelligence and Statistics, volume 130 of Proceedings of Machine Learning Research, 3331--3339","venue":null,"work_id":"9441485b-9349-4a59-b0f9-e1ed65840498","year":2021},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:76425c0f4fc7b3a3ab39cc987af801da0cc4b5f9386ffd0e8662777bdfb19457","observation_id":"90e36eac-1004-4c62-9637-94590eba0627","resolution":{"observed_at":"2026-07-08T18:35:27.177103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.201005Z","title":"\" * write output.state after.block = add.period write newline","venue":null,"work_id":"b3df4990-458c-4867-a630-470853cfc2c8","year":null},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:cf79029247e28b0f5bec432ba96c8b5eb758baccebbb20b23542e28483a63b54","observation_id":"1567941c-2554-45f2-89a1-8aac3a5ae272","resolution":{"observed_at":"2026-07-08T18:35:27.202322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:35:27.161883Z","title":"write newline","venue":null,"work_id":"4c6bd42f-ac1e-4083-baca-d4e60367d9f3","year":null},"citing_paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-30T15:10:49.492879Z"},"links":{"citing_paper":"/paper/2605.24345"},"observation_digest":"sha256:09d3348691a6cdc06ecedaddc4a877498d2c130f4557e2370b75054b4df8aeb1","observation_id":"43d3408c-a02f-4d20-9162-792547b2f015","resolution":{"observed_at":"2026-07-08T18:35:27.163823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24345","last_updated":"2026-05-23T02:12:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T19:57:59.989742Z","submitted_at":"2026-05-23T02:12:00Z","title":"Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":5,"verified_fuzzy":42},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2605.24345."}