{"as_of":"2026-08-16T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:339a36ba34059fb5b25682a3a33b2cc3914e1964b12204c8ae971eee32b506bb","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:39:15.637632Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06545/citation-record","integrity":"/paper/2608.06545/integrity","json":"/paper/2608.06545/citation-record.json","paper":"/paper/2608.06545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.203436Z","title":"Towards Tight Bounds on the Sample Complexity of Average-Reward","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.203436Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:1af044e760074e057f329488784560136beebdc23818456f275c1539332580d7","observation_id":"2ccdd33f-3f04-4beb-a6ae-793c30b353ad","resolution":{"observed_at":"2026-08-15T14:39:15.203436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.207525Z","title":"Foundations and Trends in Machine Learning , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.207525Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:68642f02cb5c48f7a3871d6f4fcceb241c7326a1c200dc5acd7e428b4a286fee","observation_id":"f2cc61b9-093d-4e5a-a0a2-8c15624c0184","resolution":{"observed_at":"2026-08-15T14:39:15.207525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.2240","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:17.212709Z","title":"Operations Research , year =","venue":null,"work_id":"7d3b975f-a454-4aa9-b045-191a8305f7f9","year":2025},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.211143Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:035f46a25256a0b4acd137f5b45539c1d08c6677d50db859fbb529830083384e","observation_id":"8ea6c8a4-068c-48d2-9b23-c30a2867e586","resolution":{"observed_at":"2026-08-15T14:39:17.218618Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.215035Z","title":"Near Sample-Optimal Reduction-Based Policy Learning for Average Reward","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.215035Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:3d19bee46eff96a087c094b66d1d3a3662d5be7c7559f272b9eccbdb2fb929ca","observation_id":"18cd24de-c12a-4c63-8b12-ff2875b2223e","resolution":{"observed_at":"2026-08-15T14:39:15.215035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.218684Z","title":"Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.218684Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:6d181cfed96bdf7ebfa74f6b12cbc565efa545de847b9c565bf9c6dfe3aae872","observation_id":"308a30ac-f493-43a3-bd7b-cc343280fed5","resolution":{"observed_at":"2026-08-15T14:39:15.218684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.222526Z","title":"and Tewari, Ambuj , booktitle =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.222526Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:24d5fb20d3108470ef2d5b38045a76654d3b37469772933f953ffac62cec8a42","observation_id":"07ceabbc-b080-41b6-adf4-74793e9a4c3b","resolution":{"observed_at":"2026-08-15T14:39:15.222526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.225630Z","title":"Proceedings of the 35th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.225630Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:4e7824a42f471ce4ef35d6b006350f2dd3bb7538ca2c4c870c8c1bb8236ad5bf","observation_id":"bf3c2cea-2013-4688-bb5a-c88449183c95","resolution":{"observed_at":"2026-08-15T14:39:15.225630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.229174Z","title":"Proceedings of the 42nd International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.229174Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d840ed8e9695794f41ed785aaf2a13c7cd87cbd323786f70748771a7091eef0e","observation_id":"a9581ca9-bca9-44e1-b18c-66313c1fc4a2","resolution":{"observed_at":"2026-08-15T14:39:15.229174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12462","last_updated":"2026-06-21T21:20:26Z","snapshot_observed_at":"2026-08-15T20:31:09.031623Z","submitted_at":"2025-05-18T15:34:45Z","title":"Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12462","snapshot_observed_at":"2026-08-15T14:39:15.232280Z","title":"arXiv preprint arXiv:2505.12462 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.232280Z"},"links":{"cited_paper":"/paper/2505.12462","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:6ac199183dcc80f9535a078f40ec5271931138b27c98ca79b921ec2cabf16a33","observation_id":"d541f5cd-ef54-46b1-8f06-ffb1343a118f","resolution":{"observed_at":"2026-08-15T14:39:15.232280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.235726Z","title":"High-Dimensional Statistics: A Non-Asymptotic Viewpoint , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.235726Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:0f895526156204fabab67b484059ce9c754477f2d0456fddd481510159e7cba3","observation_id":"e4a6617e-4655-40c1-86f7-3fdbac929a7e","resolution":{"observed_at":"2026-08-15T14:39:15.235726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.00945","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:17.138726Z","title":"arXiv preprint arXiv:2603.00945 , year =","venue":null,"work_id":"a8838d89-4657-492f-9363-e02eba8013c9","year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.238646Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:0bd562cc4866028adea05f53d8b959be5692e81f2fa75b7e5bd4eb43e086cb91","observation_id":"70139650-2f18-4ab0-b2de-5dfa75baba63","resolution":{"observed_at":"2026-08-15T14:39:17.144034Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.241863Z","title":"Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.241863Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:1f2eb470d1906b3234cd09e9ab6502d829a1f920b2958efa1e9e2e1038f53696","observation_id":"9f37f0ef-f166-4472-8cb7-778a0fd55dfe","resolution":{"observed_at":"2026-08-15T14:39:15.241863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.244721Z","title":"Efficiently Solving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.244721Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:5bb204d0e5d0bb39754bb3931469badd568e6f07a9d487170afe7d84882d9445","observation_id":"3e7d40ca-995e-44ca-9dc9-ed77e017b67b","resolution":{"observed_at":"2026-08-15T14:39:15.244721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.247625Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.247625Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:1b6d68621647cd44b06a0df9d0a8bc0de35f4c7efada053db419e4398cc37166","observation_id":"ae41af26-e4af-445c-aae9-695e441f1fc5","resolution":{"observed_at":"2026-08-15T14:39:15.247625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.250801Z","title":"The Plugin Approach for Average-Reward and Discounted","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.250801Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b7ef3780d7f6cae193423ac5ea999289db49c150d6fe62298ea2421a6a3305df","observation_id":"76f441f9-afbb-4805-87b0-bc8a917a1e15","resolution":{"observed_at":"2026-08-15T14:39:15.250801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.253403Z","title":"Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.253403Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:2df036d4e725521c498b763efcfc588ecb79797c8f171bdea2e8182239a5e0e1","observation_id":"88f0423b-98b0-4821-8345-22477419d669","resolution":{"observed_at":"2026-08-15T14:39:15.253403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.256314Z","title":"Sharper Model-Free Reinforcement Learning for Average-Reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.256314Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:adb09defc88eab8d22e3e69e9cf8fd79ed454f694e6c49a2af843daa39a6bfc1","observation_id":"effe7f4f-ba8d-490d-9f9b-38e263cabdf7","resolution":{"observed_at":"2026-08-15T14:39:15.256314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.259013Z","title":"Journal of Machine Learning Research , volume =","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.259013Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d64c098e642920a9326508cbd64135f6087538c28f9e3e71f0a6f97f356ad932","observation_id":"bc7cecdf-4059-422f-8f9e-50a6354b90d3","resolution":{"observed_at":"2026-08-15T14:39:15.259013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.261581Z","title":"Model-free Reinforcement Learning in Infinite-horizon Average-reward","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.261581Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:99c82708700d62e507846590e81bb059e76ebeb65f0a4bf61f925a46344fe317","observation_id":"5866a8ca-c052-40bf-bc7f-c07cdd22a80d","resolution":{"observed_at":"2026-08-15T14:39:15.261581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.264641Z","title":"Learning Infinite-horizon Average-reward","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.264641Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:9ff74507bbef6d81d3695fd82b8c46abda51048eaeb30123fa1b1b0e91309a0b","observation_id":"bda1fb27-dbc1-44e4-8275-9035f35c413e","resolution":{"observed_at":"2026-08-15T14:39:15.264641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.267560Z","title":"Efficient","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.267560Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:06dd8e1f2ee16402115d8df2710434a6680df3d5e0cd3c3a1920a10b4f10220a","observation_id":"52a1e67a-ab1f-4cdf-8bfd-44fdaeb2fcea","resolution":{"observed_at":"2026-08-15T14:39:15.267560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.270443Z","title":"Distributionally Robust","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.270443Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:dafb804db866c094578fecb348fc2ef2ea2af9e0196afaa4092f21349d61bf85","observation_id":"060f7f15-ac12-4f1e-a64a-c3b93494a9ab","resolution":{"observed_at":"2026-08-15T14:39:15.270443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.273226Z","title":"The International Journal of Robotics Research , volume =","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.273226Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:4221b978eb661c6421604be91d46570735bcb6df93203c91714a50bf1ce22afe","observation_id":"bb522753-d61b-4193-9151-66965ad1ffe4","resolution":{"observed_at":"2026-08-15T14:39:15.273226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.276155Z","title":"Nature , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.276155Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:4a995ac887de1c2c4f19b4a0aa4de6d9315a379341e8e4dcb2594871c02e0b6f","observation_id":"df27e9a6-4869-4efa-af6f-0ab6da554678","resolution":{"observed_at":"2026-08-15T14:39:15.276155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.279523Z","title":"Mastering the Game of","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.279523Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:05896d4b0df754b29c9eb2247f61b27bca739c30e91d061c290e5936ffe9b843","observation_id":"7f30be99-0561-4d7a-b0ef-3ab61d57ac2c","resolution":{"observed_at":"2026-08-15T14:39:15.279523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.282444Z","title":"International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.282444Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d912803ef875c7ba1d200c97c27242edfe9aa5572db0b5a3e75c6f5c6d6520f3","observation_id":"cdd71e41-3f14-437e-a229-b55c90a318e1","resolution":{"observed_at":"2026-08-15T14:39:15.282444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.285478Z","title":"2020 , organization =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.285478Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:ae02fb4d9881ccbe68c46ff0a1e616794b116d0a401dd084a5b00d9628f8d51f","observation_id":"2b7b49e0-2026-41da-9bd1-bff29f14ac5c","resolution":{"observed_at":"2026-08-15T14:39:15.285478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.288546Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.288546Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b045670850f342947528c537267249d151d1c26ccfed9555ffb1adc694cc535a","observation_id":"d48defea-6d63-4673-a321-6bd36d16a06d","resolution":{"observed_at":"2026-08-15T14:39:15.288546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.291628Z","title":"International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.291628Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:1851a3305724ab10b72119e2392b7a146725534ae3281e9cc41c281cc90d21b4","observation_id":"f24d8ef9-b189-4daa-b706-59e90a279f67","resolution":{"observed_at":"2026-08-15T14:39:15.291628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.294253Z","title":"COLT 2009 - The 22nd Conference on Learning Theory , year =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.294253Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d1e9bcdc2dfe2653850b3e158be9e8250bb4d3cb64be940bdeefaefe13b19fe1","observation_id":"ab448d6c-4b6e-4cca-84fc-118f4a32ca85","resolution":{"observed_at":"2026-08-15T14:39:15.294253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.297291Z","title":"Data-Driven Distributionally Robust Optimization Using the","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.297291Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:6e73a58a8a0616a187b7727034801340d033104d577f37fee61dd1377107215b","observation_id":"caf66f2d-f67c-4a94-88f2-c20bd87974ba","resolution":{"observed_at":"2026-08-15T14:39:15.297291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.300073Z","title":"Distributionally robust convex optimization , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.300073Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:cb6a52ec46bcd48243947e912590528a7f0a7b8983ed4b29f259bdc0ab410c46","observation_id":"dadd3c77-37ac-4010-a482-bbc94ff2f375","resolution":{"observed_at":"2026-08-15T14:39:15.300073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.303083Z","title":"Distributionally robust optimization and its tractable approximations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.303083Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b299f9e2def5c21b22d2b99a7fbf2d442cf94ef8a253ddcb5f85d12bee2cad11","observation_id":"8d85ffe9-de8a-4cd5-99c2-9f2c346e662b","resolution":{"observed_at":"2026-08-15T14:39:15.303083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.306435Z","title":"Learning models with uniform performance via distributionally robust optimization , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.306435Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:3c1030bd5b640dd018ec5e9d2e2790b206e5d6192c26f2349a26dda45b50e911","observation_id":"5066e41a-5384-44dc-aa61-aa46226213b7","resolution":{"observed_at":"2026-08-15T14:39:15.306435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.309479Z","title":"Robust Average-Reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.309479Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:7352211606ed0986e2beb4a0c59c2b25351db630fe5d7e81adb2634952fbae57","observation_id":"ef0a72be-43a9-46dd-b59e-e6da2f75aab8","resolution":{"observed_at":"2026-08-15T14:39:15.309479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.312817Z","title":"and Prater-Bennette, Ashley and Zou, Shaofeng , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.312817Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:1fdd73dda24abb3da49964ef9c11307294cf637f27867c4459674c3d37023f39","observation_id":"13d7ae5b-197e-4f50-99e9-e2f79fbf928d","resolution":{"observed_at":"2026-08-15T14:39:15.312817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.315761Z","title":"Toward Theoretical Understandings of Robust","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.315761Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:8faab6c603c3e1cc9b8440f21ddefc1eb14687be45a3a3f13068b35b3da262e4","observation_id":"c85eb2ac-fcb5-4b2a-969e-a4e561107ce5","resolution":{"observed_at":"2026-08-15T14:39:15.315761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.318707Z","title":"Sample Complexity of Variance-Reduced Distributionally Robust","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.318707Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:a44b5d1d9221dfdbd5cac11c51057c0d1b4ca29cdf39fa511243961944c313dd","observation_id":"c9a23339-85dc-413f-8167-7dc904fef751","resolution":{"observed_at":"2026-08-15T14:39:15.318707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.322481Z","title":"Near-Optimal Distributionally Robust Reinforcement Learning with General","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.322481Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:9cd59858e20f801232142a53ae74e8f4c04404248b2b871d48850cc7c6ce0d4c","observation_id":"5b71829d-561e-49c5-9191-50ddc86959cf","resolution":{"observed_at":"2026-08-15T14:39:15.322481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.325515Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.325515Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d125d80c8433efa4688d8551af898731ac3c155792509c59255903a843cb70e0","observation_id":"51e9ba48-0ed9-4ecc-8bc8-9d3e96119b5e","resolution":{"observed_at":"2026-08-15T14:39:15.325515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.328595Z","title":"Sample Complexity of Offline Distributionally Robust Linear","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.328595Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:f5d50d3800c3bf7b2b0be6d9ec15be6acfc0113ae1095b9540847235d334cd11","observation_id":"82caf014-8a07-4f00-a1b6-b4f5deb0e0e0","resolution":{"observed_at":"2026-08-15T14:39:15.328595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.331697Z","title":"1994 , publisher =","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.331697Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:ce1c70cdc90461dd82b9d50b4baa5ea4f0db3f498884d9b8be8707df1314f44a","observation_id":"0277484c-a2c1-4750-8320-96faf0343c2f","resolution":{"observed_at":"2026-08-15T14:39:15.331697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.334697Z","title":"Tsybakov , publisher =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.334697Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e49fe67a21012716df9b2e016fa1c8a6ebcb027cb02ba06a6f42bd32a8e45979","observation_id":"0acdd3e8-5b79-46af-849f-79700514230d","resolution":{"observed_at":"2026-08-15T14:39:15.334697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.338841Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.338841Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:591ddb42628037dc4e406e2fbc14c54dee698bb356907b626fb126d7c374c8d0","observation_id":"f9b615a3-36c1-47b2-a5fc-34953045dd77","resolution":{"observed_at":"2026-08-15T14:39:15.338841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.341917Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.341917Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:88db3afd1e99d5a335c575e9388473667d27ec0ba9efb22dda1acf1e43b4c850","observation_id":"d42131d3-33cc-4460-a376-4f7a909dfe1e","resolution":{"observed_at":"2026-08-15T14:39:15.341917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12202","last_updated":"2026-04-28T04:08:28Z","snapshot_observed_at":"2026-08-14T21:33:38.734719Z","submitted_at":"2025-05-18T02:35:39Z","title":"Near-Optimal Sample Complexities of Divergence-based S-rectangular Distributionally Robust Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12202","snapshot_observed_at":"2026-08-15T14:39:15.344469Z","title":"arXiv preprint arXiv:2505.12202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.344469Z"},"links":{"cited_paper":"/paper/2505.12202","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:84f88bddb9016b2bd40e37f9de6f8429d0b03a9a5e9e8292a97ddb9faa4e9c2c","observation_id":"219b76fe-3d4c-467a-afbe-9f27746d6e13","resolution":{"observed_at":"2026-08-15T14:39:15.344469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.347703Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.347703Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:aa18ddd3780f7f2f9e60228bcd0ea73f91a165e036af4d909715b37ed096f552","observation_id":"d613f426-39b7-478e-b447-630fadb22f2e","resolution":{"observed_at":"2026-08-15T14:39:15.347703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.350738Z","title":"The blessing of heterogeneity in federated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.350738Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:398cbf07f2a48ba5ec87b583d5a2d629b3b7793c15deeb220eac866afddde523","observation_id":"9babee25-36ec-45a5-8cd0-f2e18149d86e","resolution":{"observed_at":"2026-08-15T14:39:15.350738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.353842Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.353842Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:ffe77f89a4396f857d85a1f109abb94dd6f4b74ef5cba136b932488e266a8a3c","observation_id":"3d5003de-2530-4f7f-a5e2-59e8f1b38eed","resolution":{"observed_at":"2026-08-15T14:39:15.353842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.356422Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.356422Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:041fb0b614987f78ce58bf76163b5424f4391e8e06591f23f2bbb7acd6f4b80b","observation_id":"3b7dc32c-427a-4975-b155-89302f03eebd","resolution":{"observed_at":"2026-08-15T14:39:15.356422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.359852Z","title":"Operations research , volume=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.359852Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b53ff8ecc2f0299e797e463baa28ab08d1584e30144decf2655f63fa0e14d552","observation_id":"d03d0526-5a80-4b81-b762-847536a57436","resolution":{"observed_at":"2026-08-15T14:39:15.359852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.486678Z","title":"Robust control of","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.486678Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:2852eb564fe0ab5591e9463a1ad3ec67003dd50626f8f9f683b8881ac92d01dd","observation_id":"a3b7a8dd-08e4-44e2-9442-3a14b31ff866","resolution":{"observed_at":"2026-08-15T14:39:15.486678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09118","last_updated":"2021-02-23T11:44:44Z","snapshot_observed_at":"2026-08-15T19:05:30.054867Z","submitted_at":"2020-06-16T13:01:33Z","title":"$Q$-learning with Logarithmic Regret","version":2},"cited_work":{"arxiv_id":"2006.09118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09118","snapshot_observed_at":"2026-08-15T14:39:17.044043Z","title":"$Q$-learning with Logarithmic Regret","venue":"cs.LG","work_id":"34e72073-a1f7-43ee-bc6d-47fca2880b2a","year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.493614Z"},"links":{"cited_paper":"/paper/2006.09118","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:12b456a8bca1e3bd127b4d10bdc634f92a71541fae02833f5559e043892c0f3d","observation_id":"cdfc98d3-e4d7-4f31-bdef-0eeadf2f775e","resolution":{"observed_at":"2026-08-15T14:39:17.048249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03760","last_updated":"2020-12-01T09:14:25Z","snapshot_observed_at":"2026-08-15T19:07:03.530501Z","submitted_at":"2020-07-07T19:44:14Z","title":"Near-Optimal Provable Uniform Convergence in Offline Policy Evaluation for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.03760","snapshot_observed_at":"2026-08-15T14:39:15.496949Z","title":"arXiv preprint arXiv:2007.03760 , year=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.496949Z"},"links":{"cited_paper":"/paper/2007.03760","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:8ae81ee51868347fc32f15506c8df93f4a5024798f687d429f27009cb639a479","observation_id":"791b6d3f-07a0-4b23-b368-86e548e84c4f","resolution":{"observed_at":"2026-08-15T14:39:15.496949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.500102Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.500102Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:316665bdcc91f93923cac2b6a85d2c7a1d512c8dadc02589d0020e149deaf99d","observation_id":"78457264-6cba-4039-9fd9-2f848b71ca06","resolution":{"observed_at":"2026-08-15T14:39:15.500102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10043","last_updated":"2020-07-15T11:58:45Z","snapshot_observed_at":"2026-08-09T13:49:31.425757Z","submitted_at":"2020-02-24T02:33:01Z","title":"Complete Dictionary Learning via $\\ell_p$-norm Maximization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10043","snapshot_observed_at":"2026-08-15T14:39:15.503037Z","title":"arXiv preprint arXiv:2002.10043 , year=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.503037Z"},"links":{"cited_paper":"/paper/2002.10043","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:eb5b27136c46c6160bb45e00dce283b88ca74aad048b1ce972d7d4ed73d8b098","observation_id":"4d4d9a1c-2280-4df3-8905-23cfc31a8ac3","resolution":{"observed_at":"2026-08-15T14:39:15.503037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.506776Z","title":"Journal of Applied Probability , volume=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.506776Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:21cf78c018af48e90b45ec1deb238dfe27e5303adc95aa8a2ec9ef9724262e3b","observation_id":"4c2ba3de-423a-48a3-993f-8e7b0fc6da5f","resolution":{"observed_at":"2026-08-15T14:39:15.506776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-15T19:09:27.014059Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-15T14:39:15.509987Z","title":"arXiv preprint arXiv:2005.03557 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.509987Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:8685fd8c413f5f078f89aede400b3bf835e684982b934fea8d92235501206c12","observation_id":"d88536b2-f16f-4da6-955f-bbe6e9d0198e","resolution":{"observed_at":"2026-08-15T14:39:15.509987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.513098Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.513098Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e4858c7e89ec9209486f855c62b1678073e236c4e2cee5d6cae6876fdf294dcf","observation_id":"b285e844-8231-4ac4-b382-a11c23509a4c","resolution":{"observed_at":"2026-08-15T14:39:15.513098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06392","last_updated":"2022-06-02T06:16:17Z","snapshot_observed_at":"2026-08-15T19:04:43.031317Z","submitted_at":"2020-05-13T16:01:39Z","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.06392","snapshot_observed_at":"2026-08-15T14:39:15.516180Z","title":"arXiv preprint arXiv:2005.06392 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.516180Z"},"links":{"cited_paper":"/paper/2005.06392","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:d7d2a5a92827ef98f909e8c91fe4de2be5088f82a7a3360d89a4aa8bafceb140","observation_id":"a2746f34-f148-4e9d-b074-5d3f586fae8e","resolution":{"observed_at":"2026-08-15T14:39:15.516180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.519221Z","title":"ICML , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.519221Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:7a177ca98efc988f15f2047e6b9ec61758217902c93da4c8a4aba243bce3abca","observation_id":"9bfa37da-e391-4468-aad1-830e70ba60a6","resolution":{"observed_at":"2026-08-15T14:39:15.519221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.521951Z","title":"Optimality and approximation with policy gradient methods in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.521951Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:2f0a208e5ade97b8c27025e48ff8e481d39d08336e331e16a9f744685852fb48","observation_id":"24b203a2-f37d-4dad-9454-be3634036b70","resolution":{"observed_at":"2026-08-15T14:39:15.521951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.524694Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.524694Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e59743e06379cbc50b3ea7bc93663f22884e32eab057c6b42802343ec7ac8821","observation_id":"4619700e-2526-4d70-b16f-2937434744ee","resolution":{"observed_at":"2026-08-15T14:39:15.524694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.527449Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.527449Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b60cc09cee5359ac38d245faece8f716a0493b9a82462809a627104a53299bb9","observation_id":"6acaff08-1837-4d96-8ec8-579d4069fbd3","resolution":{"observed_at":"2026-08-15T14:39:15.527449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.530633Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.530633Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:b95a8ad9b4a2959c9a4fb41bf7462aefbd8390cde9ca63b573fcd8412d4ca26e","observation_id":"bf8226aa-05b0-4c66-bf10-6907e51e48cc","resolution":{"observed_at":"2026-08-15T14:39:15.530633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07301","last_updated":"2022-05-10T07:57:16Z","snapshot_observed_at":"2026-08-15T19:04:38.665880Z","submitted_at":"2021-02-15T02:08:39Z","title":"Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation","version":2},"cited_work":{"arxiv_id":"2102.07301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.07301","snapshot_observed_at":"2026-08-15T14:39:16.982183Z","title":"Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation","venue":"cs.LG","work_id":"744e057f-38ce-4a68-a2a5-2e2c4566268b","year":2021},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.533537Z"},"links":{"cited_paper":"/paper/2102.07301","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:0d1b30f553f2880c652242f05cdaf951ae812fe8ea12fe03b77fceca591cb3c9","observation_id":"bb02d565-1b38-4e88-ba39-9677c0ba4def","resolution":{"observed_at":"2026-08-15T14:39:16.986137Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.536769Z","title":"Probability Theory and Related Fields , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.536769Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:05adeb1e7a24ce8e7ddea279e24e5d9d2111abda26eeca77d92ce27527fa249b","observation_id":"41ab3e61-0120-460f-adce-2841f65c14c5","resolution":{"observed_at":"2026-08-15T14:39:15.536769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.540035Z","title":"Proceedings of the 27th international conference on international conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.540035Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:88b63b301bef8371113c55ff026cdd51bb8d09607377a49e950b3956b7d792eb","observation_id":"ad91d121-3c2d-4722-8a4f-b3625fa945fd","resolution":{"observed_at":"2026-08-15T14:39:15.540035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.543051Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.543051Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:ceeef21d3d9a226b675a97033848a18409fcb30c87e62103a20b22f08e777c38","observation_id":"61a978c1-dc40-42d6-8a93-e2f6ea1fb7fa","resolution":{"observed_at":"2026-08-15T14:39:15.543051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10038","last_updated":"2018-11-04T03:54:13Z","snapshot_observed_at":"2026-08-14T18:35:25.147407Z","submitted_at":"2018-08-29T20:45:54Z","title":"Theoretical Linear Convergence of Unfolded ISTA and its Practical Weights and Thresholds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10038","snapshot_observed_at":"2026-08-15T14:39:15.545887Z","title":"arXiv preprint arXiv:1808.10038 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.545887Z"},"links":{"cited_paper":"/paper/1808.10038","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:f6b69584b7ac56ed19dc5d5b53125db076b03470c0b9a303378dd57b1c2c8abb","observation_id":"5a63e9ef-e709-4519-a2f2-b938816c1d4e","resolution":{"observed_at":"2026-08-15T14:39:15.545887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08456","last_updated":"2020-02-19T14:28:35Z","snapshot_observed_at":"2026-08-15T19:07:00.125508Z","submitted_at":"2020-01-23T11:34:03Z","title":"Ada-LISTA: Learned Solvers Adaptive to Varying Models","version":2},"cited_work":{"arxiv_id":"2001.08456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.08456","snapshot_observed_at":"2026-08-15T14:39:16.954998Z","title":"Ada-LISTA: Learned Solvers Adaptive to Varying Models","venue":"cs.LG","work_id":"29a9ead9-7147-402b-adb4-045bb95f2240","year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.548922Z"},"links":{"cited_paper":"/paper/2001.08456","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:37675dd6a4edfb76d260b26c76811459a06276694213e4a5e585e8222382591d","observation_id":"835631c6-af5a-4d43-8270-834dab3ff1ba","resolution":{"observed_at":"2026-08-15T14:39:16.960039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.00285","last_updated":"2017-05-29T09:37:06Z","snapshot_observed_at":"2026-08-15T19:04:42.485282Z","submitted_at":"2016-09-01T15:46:07Z","title":"Understanding Trainable Sparse Coding via Matrix Factorization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.00285","snapshot_observed_at":"2026-08-15T14:39:15.552169Z","title":"arXiv preprint arXiv:1609.00285 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.552169Z"},"links":{"cited_paper":"/paper/1609.00285","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:5fc22c7f693b60f829d22ceade1353631e275859bb86c03d87d1a075f4ad5883","observation_id":"caac32fe-da59-4a36-a272-c0efd64b4a3c","resolution":{"observed_at":"2026-08-15T14:39:15.552169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.555278Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.555278Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e92eb34aed337aebf97fe9e3ebe301530056d9f7bfa718afcb09210b97d1c4bc","observation_id":"14528f54-1f2e-4b30-ab9b-7c9c74523b67","resolution":{"observed_at":"2026-08-15T14:39:15.555278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.558053Z","title":"Mathematics of Operations Research , volume=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.558053Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:c0d72aceadf4d12668d7e3245ef126e5bc5a7e31fd33a4676c192bc59c77068c","observation_id":"bc2f6af1-29a9-45fd-b665-3ca9bf0dc9fe","resolution":{"observed_at":"2026-08-15T14:39:15.558053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.560606Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.560606Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:3e7a22b1951bcccf5c7e51c036c46e421b02f8efe8b66e20daf797af798709f0","observation_id":"3dde4795-b613-4951-b572-7d0e891208ea","resolution":{"observed_at":"2026-08-15T14:39:15.560606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.563461Z","title":"Twice regularized","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.563461Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:0d36edd32c6634260f7367ab6db6137b23a12a2dce92650eb911cf79c4414355","observation_id":"0e6eac17-e3d8-47c5-96cb-ecc2c259c858","resolution":{"observed_at":"2026-08-15T14:39:15.563461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.566048Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.566048Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:75ae9b420fc1e00b66e09f613c65e8fccff354730ecf0bd8680cbcbdf70e4530","observation_id":"5e06f2a4-1d0e-41aa-b21b-c3ef8b779bcb","resolution":{"observed_at":"2026-08-15T14:39:15.566048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-13T13:23:03.818353Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-15T14:39:15.568605Z","title":"arXiv preprint arXiv:2212.06355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.568605Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:5a83d776a295eca2a4e4adb63cc196b41f2097c070d4fe78c0694bb76d875872","observation_id":"1ce8b195-a019-46e1-a093-05fdf0f79678","resolution":{"observed_at":"2026-08-15T14:39:15.568605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.571404Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.571404Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:995be162da75fb54abe70ad826439991844e7fdffcd4c6685d3e9f972dccae43","observation_id":"73c7a7ad-9d56-440f-a888-20da053818af","resolution":{"observed_at":"2026-08-15T14:39:15.571404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05659","last_updated":"2019-08-13T00:43:41Z","snapshot_observed_at":"2026-08-15T17:50:04.032669Z","submitted_at":"2019-08-13T00:43:41Z","title":"Distributionally Robust Optimization: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05659","snapshot_observed_at":"2026-08-15T14:39:15.574358Z","title":"arXiv preprint arXiv:1908.05659 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.574358Z"},"links":{"cited_paper":"/paper/1908.05659","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:60f4cd006301dd20b91dd343d53bb8a70edc6b2af4210b1af0e31768a7a0b6d5","observation_id":"1fd2fac0-ba16-429b-aad4-5d1ca99d20bc","resolution":{"observed_at":"2026-08-15T14:39:15.574358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.578729Z","title":"Finite-sample guarantees for","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.578729Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:aebe3228ce622648a1f384a6ef242b42eeb65687b9bfb42888927a01f914328c","observation_id":"95b26c2f-0f01-4095-a4a2-0ece99f3e556","resolution":{"observed_at":"2026-08-15T14:39:15.578729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12440","last_updated":"2023-07-16T23:13:12Z","snapshot_observed_at":"2026-08-15T19:07:37.444815Z","submitted_at":"2022-01-28T22:03:50Z","title":"Certifying Model Accuracy under Distribution Shifts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12440","snapshot_observed_at":"2026-08-15T14:39:15.581826Z","title":"arXiv preprint arXiv:2201.12440 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.581826Z"},"links":{"cited_paper":"/paper/2201.12440","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:955b628f8b34230d591d8c21bcd47bca96f344d544f51d7e29f1c74da978e0a3","observation_id":"11359dc3-2b4b-499a-9887-c87535093a98","resolution":{"observed_at":"2026-08-15T14:39:15.581826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.585147Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.585147Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:008abf33a5e446b0d8267b5bcb8d94e184cd2b20d67a9f61ceb01914a1c00f97","observation_id":"a76b1b01-4c57-423d-a0bf-bc2a6f1facfb","resolution":{"observed_at":"2026-08-15T14:39:15.585147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05275","last_updated":"2024-03-08T18:40:01Z","snapshot_observed_at":"2026-08-15T19:07:36.264065Z","submitted_at":"2022-04-11T17:26:19Z","title":"Settling the Sample Complexity of Model-Based Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2204.05275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.05275","snapshot_observed_at":"2026-08-15T14:39:16.888427Z","title":"Settling the Sample Complexity of Model-Based Offline Reinforcement Learning","venue":"stat.ML","work_id":"de1b7b4f-4fd5-4ac3-bb86-18ad14f7a04b","year":2022},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.588609Z"},"links":{"cited_paper":"/paper/2204.05275","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:01f6627226b80ca906eb8b496534624ff87d44e85eb8545c6d40e6452e2adf15","observation_id":"3fd88426-9fe4-4008-b4d0-9a108e0bdd80","resolution":{"observed_at":"2026-08-15T14:39:16.893053Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.591949Z","title":"Available at Optimization Online , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.591949Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:bb770f8c2e44864a65b840ccf065f8690a89cb4fc555b350cc9fef3503317cac","observation_id":"d72da13f-f3f1-4232-974a-19cff24db1e6","resolution":{"observed_at":"2026-08-15T14:39:15.591949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.594947Z","title":"Pessimistic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.594947Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:09f78c45904cd5a21ae073823208224df46f354672171f1299324b421e9f1c76","observation_id":"81a5dc8b-44de-43f4-97e9-b1e3e9a9078a","resolution":{"observed_at":"2026-08-15T14:39:15.594947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.597974Z","title":"The Bell system technical journal , volume=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.597974Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e5f74990e1ce59b1e32232e3fb8d7775865bfe9d71b6ea0c13b87be40d712af8","observation_id":"1ca62b82-0e54-4ad5-94c9-e6599cd5f221","resolution":{"observed_at":"2026-08-15T14:39:15.597974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.600564Z","title":"The mathematics of data , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.600564Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:4265a773e8d7efd03414f306ff9fdaa95b21cfc411aa2c0c7804bc358c6937f7","observation_id":"3bf77a69-8377-415e-9085-5610c6dd79f5","resolution":{"observed_at":"2026-08-15T14:39:15.600564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.603762Z","title":"The Journal of finance , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.603762Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:f9d65567364c79c73ce91d1678c810000bb94859f8037a34282fdbb3ba84d50f","observation_id":"0e2948c7-0976-4bd5-a85a-bce669fd91ee","resolution":{"observed_at":"2026-08-15T14:39:15.603762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.606758Z","title":", author=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.606758Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:6af65c95de13d2f7a06531cb61ceabe7b78d8dd2b20e20c14467f206ab40c6bd","observation_id":"a06183ee-4d5e-455b-a185-f794e2047b6b","resolution":{"observed_at":"2026-08-15T14:39:15.606758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.609707Z","title":"Mathematical Programming , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.609707Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:af93982631981873f5fd777eea9eedfa2f8fb1cbfddbb2a361d52a1b19c5b495","observation_id":"47828712-199e-4990-a716-666c81d0da09","resolution":{"observed_at":"2026-08-15T14:39:15.609707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.613255Z","title":"Mathematics of Operations Research , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.613255Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e08b993fc27b9ab73d599b4e29b9efcc69c9561210a70791037a2a7c6cb4fef6","observation_id":"df1e378e-fe72-4bd8-b904-22dd29d668a4","resolution":{"observed_at":"2026-08-15T14:39:15.613255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.616496Z","title":"Robust control of uncertain","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.616496Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:ec0a3adb43f487db406b8fe8cb42afcc8154b6b8f6df8aab1855fef4f83579e2","observation_id":"b86932a2-17df-4343-9aa1-13f973b37687","resolution":{"observed_at":"2026-08-15T14:39:15.616496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.619844Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.619844Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:84c9e86c1ebda4567ef6e71efbc51c96f0d97e969f046a36e14ce834ec280dea","observation_id":"a521443e-c233-48e4-876b-650f335feb2a","resolution":{"observed_at":"2026-08-15T14:39:15.619844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.622784Z","title":"INFORMS Journal on Computing , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.622784Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:3b842d9b2c227b17cb883486b89fd3f89aee978691900ad41caa51758751b0b2","observation_id":"d86bc39b-ddcb-44e3-8a07-023b3e422c4d","resolution":{"observed_at":"2026-08-15T14:39:15.622784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.625757Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.625757Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:e9f47e81e4bd7ebb412e98684d6a5b28368532109dd7d5ae9973bdbec8e5c6c1","observation_id":"c290e883-4b9c-42ec-b04f-c5ed1283589c","resolution":{"observed_at":"2026-08-15T14:39:15.625757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08708","last_updated":"2019-06-14T04:58:55Z","snapshot_observed_at":"2026-08-16T00:34:11.867856Z","submitted_at":"2019-02-23T00:13:42Z","title":"Distributionally Robust Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08708","snapshot_observed_at":"2026-08-15T14:39:15.628743Z","title":"arXiv preprint arXiv:1902.08708 , year=","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.628743Z"},"links":{"cited_paper":"/paper/1902.08708","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:040a366b062855bda73d724f9687c7dce5701fdd2b471db855dd7bf529e7a8e1","observation_id":"29f6aba9-0e16-4f56-af81-020f27f8653c","resolution":{"observed_at":"2026-08-15T14:39:15.628743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.631794Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.631794Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:862a3e672960803763fd62c25bbe3f07ee096e91fb45524b23064ec3a0f9ff83","observation_id":"e8b0c55a-7f0a-445a-a4ca-a48965dd18c3","resolution":{"observed_at":"2026-08-15T14:39:15.631794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:39:15.634562Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.634562Z"},"links":{"citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:10c5e4a55376f90a21f92a285d5ecc848ae6b14b76fc0cefd7e996bb552fe777","observation_id":"a6bed617-be62-448b-b66d-d30b9ee729a8","resolution":{"observed_at":"2026-08-15T14:39:15.634562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02894","last_updated":"2020-07-14T06:01:03Z","snapshot_observed_at":"2026-08-15T19:09:05.952832Z","submitted_at":"2020-03-05T19:56:23Z","title":"Distributional Robustness and Regularization in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02894","snapshot_observed_at":"2026-08-15T14:39:15.637632Z","title":"arXiv preprint arXiv:2003.02894 , year=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.637632Z"},"links":{"cited_paper":"/paper/2003.02894","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:cfa2982a8cdc19180d0044757f0ff5c314ff23c94672575b3bc582757e1d5751","observation_id":"88f1c433-0416-48a4-bdf1-f5f8f2a8cef7","resolution":{"observed_at":"2026-08-15T14:39:15.637632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T06:31:47.673457Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":94,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2608.06545."}