{"as_of":"2026-08-10T09:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0bbc3e4faf7eec1d01a8b31bd1107d20cb7cca621391aeda968d1001d719fc9","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:55:27.313461Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.31769/citation-record","integrity":"/paper/2606.31769/integrity","json":"/paper/2606.31769/citation-record.json","paper":"/paper/2606.31769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.238205Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"5e62a303-893e-4edf-950c-3a5893545525","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:aca2c6fd134760a5ffadac69ea9058ee0396c6e7a5cb606cc7fe1995bd3182bd","observation_id":"14d4c429-7d32-4c9f-8a3e-03f50fc6269c","resolution":{"observed_at":"2026-07-06T16:52:40.239431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.379326Z","title":"Conference on Learning Theory , pages=","venue":null,"work_id":"2023962b-8fb9-4396-bced-f785d072d8bb","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:cff2d5a871df8a63521047edef1d09ba9fe9c2e62fe8587e641431ded16df7ca","observation_id":"73453eab-37e1-4f8b-967b-65daaab3520b","resolution":{"observed_at":"2026-07-06T16:52:40.381207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.339722Z","title":"Near-optimal Regret Using Policy Optimization in Online","venue":null,"work_id":"63234612-f939-40ee-8097-8bde990238cd","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ec2a501f2515805f54498c9b1a82497339ee74028bfb7357dfbdf81597b3ba6e","observation_id":"5db8998b-34fe-4760-8bcb-c3c0c5d4d7c8","resolution":{"observed_at":"2026-07-06T16:52:40.341134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.344478Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":"8e8475bb-1e6f-48cf-b186-0debeb093c09","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:07288d342af3889f24419e853bc903deac01c077845d96e9cf5ada05ed5d1329","observation_id":"5c621f20-e926-409d-ac62-4cb6a505d1c8","resolution":{"observed_at":"2026-07-06T16:52:40.345951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.338029Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"c5c3c4cc-aa78-4bc9-995c-c5bf98f0135e","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e19a5655b4465414d2930a1f6bff976539c2f13c717322b47b321b0b12833a45","observation_id":"05a895cb-c2dc-4d63-b849-3a6d1a0eb3f3","resolution":{"observed_at":"2026-07-06T16:52:40.339102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.332887Z","title":"Proceedings of the 34th International Conference on Machine Learning , pages =","venue":null,"work_id":"7daebf19-3222-4b12-88d8-8dbac1af9c1b","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:850d76765b8859d5e5c1d4c3964da6fb076f0b4c20c4e7907331fb3346987965","observation_id":"20323228-acb9-4341-9b07-f2fe5683d9ed","resolution":{"observed_at":"2026-07-06T16:52:40.334006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.268283Z","title":"Proceedings of Thirty Fourth Conference on Learning Theory , pages =","venue":null,"work_id":"6e538f88-625a-4fa8-b2ab-c915251f9c97","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:9ac2c86b24bb498d7586c72037e52999720dd4b7fcc54f26a3655e90098b1b4c","observation_id":"b571c96a-376b-4eaf-bbdc-16a809693033","resolution":{"observed_at":"2026-07-06T16:52:40.269768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.325884Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"7d2358e3-e10b-4502-be79-6320e3284351","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:38c70e3d864b85934803ba42d26059b9d5cb92fb72b8fb4e77e0ffa0c426d626","observation_id":"85d2836e-8a92-4c80-b93e-fb39356e84a9","resolution":{"observed_at":"2026-07-06T16:52:40.326980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.395570Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular","venue":null,"work_id":"a8160bd8-d9d0-4b3d-adde-d96df708c5ba","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:91a67944b382e4975e929861d5a39eb07b5bbace938f3170edb41eaea49f0ee8","observation_id":"3225afe0-49ef-4e5b-8a53-0a08dec03ee8","resolution":{"observed_at":"2026-07-06T16:52:40.397181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.359476Z","title":"Non-Asymptotic Gap-Dependent Regret Bounds for Tabular","venue":null,"work_id":"71e37a3b-eabc-42e3-9451-113a6f16cc35","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:267382a1d7b01e17d63854fac73db573041dcbc1c12267152f41a32797863995","observation_id":"9ccd5974-909c-460a-b790-a20d1b0c7391","resolution":{"observed_at":"2026-07-06T16:52:40.361225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.356826Z","title":"Online learning in episodic","venue":null,"work_id":"ad19efc1-630b-4540-af70-5d274634470d","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:513db90aa4b3d6d91b957bdb76c08320400764d61c815d9cf90e32c1120ef518","observation_id":"b960668c-5eb9-44c5-b74c-b90e2bfd2736","resolution":{"observed_at":"2026-07-06T16:52:40.359031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.318668Z","title":null,"venue":null,"work_id":"a727cc46-e596-4476-a888-1e0eb1eabb56","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ed2a0fbe2fbdf1ce1913150f5101c983aa41b9ce7b739f7ab89b8ae7109514f1","observation_id":"5a1fb6b0-2645-4226-a0fc-8d077f6a329c","resolution":{"observed_at":"2026-07-06T16:52:40.319840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.267373Z","title":"Learning Adversarial","venue":null,"work_id":"35feefa4-4968-476b-a30b-021fee788762","year":2020},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:7cf280bb3890208608c44d69081990a75a9ab2e5e4554075e0aa9b1b06068c94","observation_id":"45594917-e06d-48fe-81ec-bc38916cfaed","resolution":{"observed_at":"2026-07-06T16:52:40.268635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.315259Z","title":"Policy Optimization in Adversarial","venue":null,"work_id":"baddd0a9-9c80-4310-ba4a-279ed8f83a61","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:018e84fa898da8f3ae1aaf1594695fc4ded892e3ffc3bbf536523351a28097d4","observation_id":"1757f675-696d-435d-adb6-25d277b97c66","resolution":{"observed_at":"2026-07-06T16:52:40.316384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.369426Z","title":null,"venue":null,"work_id":"c2b1285f-4d07-46dd-a32a-e0e392d6c73b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d864745b0ea8a2a7dd97a55fdf7e72dec01b832056a3831fe2ac8486cb319d9f","observation_id":"f194eb67-45c9-4105-b804-02d92d4f7fab","resolution":{"observed_at":"2026-07-06T16:52:40.370981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.311550Z","title":"Laurent and P","venue":null,"work_id":"b76d13f4-4b48-4c56-a0d3-67236340d409","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:26c4b5b15d710386d7e153d68bc3173768bc64404c556bee62ef93061dd9df1d","observation_id":"6eb8e578-5ca1-4ca1-948b-67c146c569f9","resolution":{"observed_at":"2026-07-06T16:52:40.312811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.258064Z","title":"Refined Lower Bounds for Adversarial Bandits , volume =","venue":null,"work_id":"3bed02cd-ca23-401c-943b-518a784bb1d6","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:7017ce5e9fb8583df377965c64ea61a8ac6f43671160edd23db21279a139abef","observation_id":"c0992d9e-a455-4916-839e-cfc95685db02","resolution":{"observed_at":"2026-07-06T16:52:40.259880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.320546Z","title":"Probability and Mathematical Statistics , volume=","venue":null,"work_id":"f03b93eb-46cc-4702-89f5-4458c1685c9d","year":2010},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:33be32cfa24c82a08358adcb8c28cf660fbfc36d258f4e76f70a3ec1e76be3b2","observation_id":"0bdcf0ce-552d-4d47-8257-9bae3ad77771","resolution":{"observed_at":"2026-07-06T16:52:40.321775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.324229Z","title":"2013 , month =","venue":null,"work_id":"c3264625-2da9-43d8-90fc-5ece8fda9f12","year":2013},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:619ed5e04e2929bf9443a9a115b3d3ca045aebaacf6baf376dd5763bcb09435a","observation_id":"33c6b8d8-f7ab-4633-9ba0-64cd2dbc7cd0","resolution":{"observed_at":"2026-07-06T16:52:40.325340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.331163Z","title":"Tuning Bandit Algorithms in Stochastic Environments","venue":null,"work_id":"2edf1261-5129-4723-a359-5b573433e5cb","year":2007},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:234d0db82f8e7184281cb91140d2b1abee4886d1ccb7f6790d5f9dfa8b3acb63","observation_id":"1fa971e0-eb76-43ac-98ed-64bf069def4f","resolution":{"observed_at":"2026-07-06T16:52:40.332323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.393212Z","title":"Online Convex Optimization in Adversarial","venue":null,"work_id":"ce45cfff-33f4-4ec2-b53f-557b1370c49b","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:a61451989b11fc920422fef3913a706ae314bf7e56194f0412b913e825da4e21","observation_id":"dad72bcb-cd68-4dcc-a782-f0aab952156a","resolution":{"observed_at":"2026-07-06T16:52:40.395018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.290734Z","title":"Proceedings of the 37th International Conference on Machine Learning , pages =","venue":null,"work_id":"388f0414-7572-4c07-9cac-424a8501c234","year":2020},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:4a4e0e78d1f9b51d35e55ee6d0221ce9a788033010375218ebea559adc3494cf","observation_id":"eec37106-7870-4a44-9e85-da8a6caff019","resolution":{"observed_at":"2026-07-06T16:52:40.292144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.221975Z","title":null,"venue":null,"work_id":"186de941-c614-4ac4-8387-28ab73b92841","year":2009},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:4bda6280e5bf478e4463d626ee8b0e5a9e9757fb9bc47f20e341b05e79e1533a","observation_id":"d7911cad-e059-45e1-a737-dd470191f0d3","resolution":{"observed_at":"2026-07-06T16:52:40.223530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.404503Z","title":"Online Markov Decision Processes under Bandit Feedback , volume =","venue":null,"work_id":"abf36cc1-cd01-4f18-b458-f33b57ad48c1","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1c093c4b42aedd05dbca1e9f341dbecec72dcfc4fb9b6c46b7611cb7567f2974","observation_id":"18fba09c-b30e-4ca9-9633-30eff050de10","resolution":{"observed_at":"2026-07-06T16:52:40.406021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.402447Z","title":"Learning adversarial","venue":null,"work_id":"0ca474a3-4d38-44ef-8238-874285518475","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:04477ec4a7423d0789869327a41cf4f78a1a481ee4e04479f61e39cfb0e20b59","observation_id":"3c4833ef-90c9-4662-99dc-7722f431363e","resolution":{"observed_at":"2026-07-06T16:52:40.403917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.296050Z","title":"Near-optimal regret for adversarial","venue":null,"work_id":"816d5519-6e4d-4110-919b-40d76482361e","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:af164f885980ab8efd020eec90479b8ac0a065cd38b2df98aad85e9f56d3e2db","observation_id":"8aeca06b-870a-4d02-9d44-e1de777d92ef","resolution":{"observed_at":"2026-07-06T16:52:40.297517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.273791Z","title":"Delay-Adapted Policy Optimization and Improved Regret for Adversarial","venue":null,"work_id":"d7d0c3f5-9553-499d-8a77-387323354ac2","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:740f38ad4ca1e0bd13a1e2886c5a6829ebcf5a1484a95dff0c5eaad2d2963d9f","observation_id":"ef4a2f62-5098-4b17-9e9a-c3301233296b","resolution":{"observed_at":"2026-07-06T16:52:40.275251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.406576Z","title":"Finite-Time Analysis of the Multiarmed Bandit Problem , year =","venue":null,"work_id":"2974fbc8-1d6b-42c1-b6f7-ca482805fd12","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:953d04d4fb9851a74a0e3bc220af060084c233c3554d158aeed8869148345d2a","observation_id":"0e56bc8f-e625-4ed1-88c8-0fa5f1e6c559","resolution":{"observed_at":"2026-07-06T16:52:40.407915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.400492Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"c76f25b8-ab27-4ffb-845b-fac4611bc0e4","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:c0c5a99745f7def7f90e394ba9a6442cde97a6fa2708a023cf9807a5124ebb55","observation_id":"55f4fc67-b198-4ae1-bcde-4649e38d84c1","resolution":{"observed_at":"2026-07-06T16:52:40.401904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.299982Z","title":"Proceedings of the 25th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"2583ffec-6be9-4712-bbba-c319bcded5c3","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:93642f0a181437fa1b8ad9dec9e0ff9c89c97e0c41b0bcdb3caed7506e1690b4","observation_id":"79b11b62-41de-4c04-958e-5faa2952870a","resolution":{"observed_at":"2026-07-06T16:52:40.301336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.313328Z","title":"Simultaneously Learning Stochastic and Adversarial Episodic","venue":null,"work_id":"fed571e8-d36d-4717-b062-ff45c0ee5aef","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:5708804650903b53fca41680948dc10fdce931ca558e7509abdd35b2f4d5b5fd","observation_id":"61c2ad1d-8f56-4911-8464-6682442becd8","resolution":{"observed_at":"2026-07-06T16:52:40.314549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.367034Z","title":"The best of both worlds: stochastic and adversarial episodic","venue":null,"work_id":"e3a4bac9-2139-4153-b2a4-baf1c8d3f4d3","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:cecb0d4116882c7dcdb58a4e4237eddbd8934da5a22f714b98698e1f88bfcd85","observation_id":"ead8046c-1c24-467a-bf8d-e9d780a30add","resolution":{"observed_at":"2026-07-06T16:52:40.368711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.271891Z","title":"Proceedings of the 31st Conference On Learning Theory , pages =","venue":null,"work_id":"8324ead2-15ad-4452-b33d-d50b6239d1eb","year":2018},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0c30478c199b39ad54a5d1db89bc5641b4be5954123ca825364a50285ef6559d","observation_id":"b7a99ceb-326d-47e8-8956-00025523569a","resolution":{"observed_at":"2026-07-06T16:52:40.273202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.393419Z","title":"Tsallis-","venue":null,"work_id":"f8184647-7130-4b44-8033-5a5efcad668b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:1c145147e67001de4f66e3b59295a45d1b31c7a7af0a04566167ba1b7c9ed04b","observation_id":"7b6acfcb-4b3a-458a-82c3-a25c9792852a","resolution":{"observed_at":"2026-07-06T16:52:40.395203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.376994Z","title":"Improved Analysis of the","venue":null,"work_id":"85850cea-6c6d-424e-853d-4ed02cbdcd4a","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:68aebef60cd05f4bd96c7c5dd52416457a3aa536dba868d6f973720e5e397e53","observation_id":"283ef0d8-b7d3-4af1-88de-a7227d4cc57e","resolution":{"observed_at":"2026-07-06T16:52:40.378556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.334548Z","title":"Proceedings of the 36th International Conference on Machine Learning , pages =","venue":null,"work_id":"e4631c78-0229-4abb-ad87-a11b1f2c9944","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:89c65e429d7eb6179f04a0a33908a6eb62921f9c79ccbb5fb696e23736e41a31","observation_id":"1ad86420-6132-4b63-bdcf-211a82a68f68","resolution":{"observed_at":"2026-07-06T16:52:40.335767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.383633Z","title":"Proceedings of Thirty Fourth Conference on Learning Theory , pages =","venue":null,"work_id":"18242906-ef63-4397-82ce-a4c0e877b814","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:cb794cfed3f654b3a30bbf7feca9e5ef0bb325e607a6b6b5ed29162c97fd5df4","observation_id":"069f8c57-4db0-4a62-9e12-88cdce021f82","resolution":{"observed_at":"2026-07-06T16:52:40.385429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.307861Z","title":"Towards Best-of-All-Worlds Online Learning with Feedback Graphs , volume =","venue":null,"work_id":"be42ead4-e483-42d0-94ad-723dbef685ad","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:890eb271f2e6f4cbf3a2cf1d753162ef71d61dfb68d6b1f97fe2ea5ec93a2a6d","observation_id":"f3a43589-aff7-4c0a-9851-de826d671e9d","resolution":{"observed_at":"2026-07-06T16:52:40.309320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.288007Z","title":"Proceedings of The 27th Conference on Learning Theory , pages =","venue":null,"work_id":"fef0a689-1ccf-4a72-b6c9-6f16f4a50680","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d76d83727a95b6269eec95eb89b1e7a8c0223320ac05610504b792c112eaf39a","observation_id":"65157022-e1de-4bf0-9fcc-b32a67f06990","resolution":{"observed_at":"2026-07-06T16:52:40.289311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.228984Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages =","venue":null,"work_id":"ca3e9682-9723-4775-acbc-dbd66765349f","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:3595abd658451e7716163a9367a59576fdd549a66aa06f0fa581dc4821dd10f1","observation_id":"d29675b0-ca26-420e-8511-4cd3846ba2eb","resolution":{"observed_at":"2026-07-06T16:52:40.230166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.294082Z","title":"29th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"0191e8d8-6027-482c-8c18-ff155cc38e9f","year":2016},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:4122f497a90663ab0f68793d604ffd134e4cdf49c249c5a4161edc59b1af2b48","observation_id":"b80e341a-a2d8-42a5-9890-bf1c7145cf5b","resolution":{"observed_at":"2026-07-06T16:52:40.295280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.235642Z","title":"An Improved Parametrization and Analysis of the","venue":null,"work_id":"e5c1efa8-a74d-4f53-a5d4-97513e0570c4","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:6df90677665bc2cf6bb2d4067fed1ee6c3c9324f8ed823ed0aeee76b4cd3080a","observation_id":"88bc35d7-fde4-467b-aa22-8d35e6dd8b77","resolution":{"observed_at":"2026-07-06T16:52:40.237992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.264921Z","title":"Adapting to Stochastic and Adversarial Losses in Episodic","venue":null,"work_id":"03325894-2e43-41b3-86e8-a57a07087456","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:17e21842e481bcc566e2e46ce6d0ae9c5bcf495197f27d3df8751dd98cc6bc6e","observation_id":"1fc76744-10bb-4bad-9298-0f5893c21a12","resolution":{"observed_at":"2026-07-06T16:52:40.266508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.372064Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"f29a8efb-be92-4166-a3aa-af32e5c6d359","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e95f6429b5d34c822d822cf3638127a07f4a2df3ca71f55f4681e2ca5c706214","observation_id":"30f6b5b5-eda3-4ef6-a4b1-46800372c064","resolution":{"observed_at":"2026-07-06T16:52:40.373563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.336282Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"311f4ece-bb4b-42b1-8f8a-180bd07a6e0a","year":2024},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:03d036b02e3a871d1ae1dc80d219f320481db98ebac87f09512e58fe445f0d7c","observation_id":"ce6b0064-2ed7-49a0-b78b-04f67489f4c6","resolution":{"observed_at":"2026-07-06T16:52:40.337481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.400355Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"1f0eec96-6c97-4b24-b2a0-a92612bb0cf1","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:06426e19153ebc458f4c03421b3bddf533c8e4a223efda8e7778205d211d54a3","observation_id":"ef46ec24-05b7-4742-ba9a-e616892f0806","resolution":{"observed_at":"2026-07-06T16:52:40.402086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.346766Z","title":"Proceedings of The 26th International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"acf9d84c-efbd-41f7-89f7-344a32f3e923","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:128f65e3f8ebc038885e5700bad1b90073e153d26f41c76584e18c1e69676b7c","observation_id":"c8b63570-73c8-4d00-9521-052f06db5f20","resolution":{"observed_at":"2026-07-06T16:52:40.348423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07307","last_updated":"2025-07-07T14:25:36Z","snapshot_observed_at":"2026-08-07T16:07:02.808962Z","submitted_at":"2025-04-09T22:07:01Z","title":"Follow-the-Perturbed-Leader Approaches Best-of-Both-Worlds for the m-Set Semi-Bandit Problems","version":4},"cited_work":{"arxiv_id":"2504.07307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07307","snapshot_observed_at":"2026-07-01T08:55:35.890881Z","title":"arXiv preprint arXiv:2504.07307 , year=","venue":null,"work_id":"ffc099b0-5c98-45a8-8706-5ffcc3e47fcd","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"cited_paper":"/paper/2504.07307","citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:361f216770695ec425e864c9f74bcff6c852907076233570c46bae2223db7489","observation_id":"f761abec-1550-4e4b-8410-5c0bfe4d2265","resolution":{"observed_at":"2026-07-01T08:55:35.892402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.227104Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":"7f268866-b5f8-4e1a-a121-577127258d7c","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:07b084d9fa6004e4146d414e38a50857c27bdfa2a24225f61e960b4c6cb2ab09","observation_id":"b079470e-a09c-47a0-bd46-652dc5cec595","resolution":{"observed_at":"2026-07-06T16:52:40.228386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.405006Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":"a67bc76a-355f-4cc0-ba0d-63f1da171766","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:df2c0aaeee189b892fb68aa553c5bf2b9c1a297fbf1fe4d82769ce63dfaf97bf","observation_id":"7351568b-25a9-4068-b13f-e3efda3a9fad","resolution":{"observed_at":"2026-07-06T16:52:40.406228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.351661Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"f1dd4b12-77a1-4bf2-90a8-21db1a8a5dda","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0fce61b318f7774570084e71a1eedaa96c162cb60d0ca20285eb233c6b7be137","observation_id":"975437ad-7c4b-4ea9-8ca0-5cc0b847ecbb","resolution":{"observed_at":"2026-07-06T16:52:40.352860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.322325Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"49511c2f-35d4-4b95-b94f-6c549e8dbc1f","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2e6ca0f75007d00508d013361f592f224319c74c05c7c24bb8cb0390ce07c472","observation_id":"ebe4fd21-114e-47a6-9268-908d3f87c90c","resolution":{"observed_at":"2026-07-06T16:52:40.323736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.374438Z","title":"International Conference on Algorithmic Learning Theory , pages=","venue":null,"work_id":"81405768-9e79-472e-9662-2eecfb70f8f7","year":2006},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f1686ee12032cc630a9c15bf2282fa0625f2eb27c9e36a6503c7f55d57a789b4","observation_id":"18ef48be-ef84-4f11-ac6e-5a0301de82d1","resolution":{"observed_at":"2026-07-06T16:52:40.376249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.269397Z","title":"Bias no more: high-probability data-dependent regret bounds for adversarial bandits and MDPs , volume =","venue":null,"work_id":"e45f361a-cafa-4814-9fe1-b179f704489b","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f222e4241a3972bedd54baf1a24164d56902086053b1783c8223533d963b7a19","observation_id":"f5336e48-97d2-452f-b844-47925bb868f2","resolution":{"observed_at":"2026-07-06T16:52:40.271271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.246738Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"85e1e6a6-f78d-47ea-a804-7146920b54db","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:6db1256be3f679054e9fcbf748fca1594a989663f258592c3abc0b9439cba386","observation_id":"49eaa7ff-e90a-4c68-8843-76c717c97ab1","resolution":{"observed_at":"2026-07-06T16:52:40.248384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.298171Z","title":"Proceedings of Algorithmic Learning Theory , pages =","venue":null,"work_id":"2b82dc3e-27e0-429d-82f0-62bd5e3d3aeb","year":2018},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f442a2a0d7ab4e09815780387e8651e8d73ce4520fcc4407a0480903c9f78e8e","observation_id":"08eb070e-a267-4f22-a582-9e9212c0c8cb","resolution":{"observed_at":"2026-07-06T16:52:40.299423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.387292Z","title":"Proceedings of the Thirty-Second Conference on Learning Theory , pages =","venue":null,"work_id":"c5f1ea92-2e36-4104-82e1-ef7d50fa5a28","year":2019},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ceb1c20524ab16e93456e2dbe29c4b28b0fcb69f98084b3777be2ff22a8b5532","observation_id":"0b9b304d-242e-44b7-9f9e-5a9ae06d0959","resolution":{"observed_at":"2026-07-06T16:52:40.388785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.389387Z","title":"Proceedings of the 28th Conference on Learning Theory , pages =","venue":null,"work_id":"47103aaf-3b8a-455a-b212-d31a5bf07d00","year":2015},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2d00c2483f772c131c599935970656f290be46168f7cd360a8d7d5f5e6de8ecc","observation_id":"b2b371ee-f2dc-41f4-a3ae-5e9bcb46a8b2","resolution":{"observed_at":"2026-07-06T16:52:40.390680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.275897Z","title":"Improved Best-of-Both-Worlds Guarantees for Multi-Armed Bandits:","venue":null,"work_id":"ef16ed57-4b43-4e36-997a-6fe1cd36eddb","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e06d47c98a0a4b0df6ecff3aeb6562f43f1e73e45ed6775ff2de50753bec628c","observation_id":"2719bc76-2c44-4fdf-8959-5355e859fa57","resolution":{"observed_at":"2026-07-06T16:52:40.277184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.329303Z","title":"Gap-Dependent Bounds for","venue":null,"work_id":"6d69f0a5-b911-4823-8085-26e76da3d439","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f508a86f79754b245f9ee6dd3efb89c3d19cb254cf9f94b27a91319747132557","observation_id":"ad6ab9f6-3957-433f-bbf8-240cbc4db948","resolution":{"observed_at":"2026-07-06T16:52:40.330346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.257578Z","title":"Proceedings of the 26th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"151b60ef-4c59-4974-be91-baf2b4a4b129","year":2013},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:5673c75303a25f491a9ce5dffb25e5326bcdcb58ea259ed3e3b2b6b9c64cf199","observation_id":"734b30cd-ee00-4ded-b903-214fa1599dbd","resolution":{"observed_at":"2026-07-06T16:52:40.258818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.390945Z","title":"Proceedings of the 31st International Conference on Machine Learning , pages =","venue":null,"work_id":"4b94424e-9074-4b63-a852-85951813b8c8","year":2014},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:43b2efed79318408f589af76c436dedef37f29a064505037c213945be60b60dc","observation_id":"7a008eb7-8a0f-433c-aab6-24c3fe8865e9","resolution":{"observed_at":"2026-07-06T16:52:40.392809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.262648Z","title":"SIAM Journal on Computing , year =","venue":null,"work_id":"312c9d8a-a3c5-4971-add9-bf2fc4333131","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e812710abaf0ca8e624ef114a84e5c4dba110574a7009d7dd8015601b19655ac","observation_id":"05a66b6a-d885-4d27-bf79-232c002494e2","resolution":{"observed_at":"2026-07-06T16:52:40.264201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.398290Z","title":"Proceedings of Thirty Eighth Conference on Learning Theory , pages =","venue":null,"work_id":"3a25e8b3-878a-43a5-8371-7d2c69386611","year":2025},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0aef0b6cc3fb506623ee5c14cfd4b6ea6e528c70b736887f502c699507df8a2e","observation_id":"16a038d2-a79f-469d-afdb-a9a93c832959","resolution":{"observed_at":"2026-07-06T16:52:40.399941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.289878Z","title":"Proceedings of the Nineteenth International Conference on Machine Learning , pages=","venue":null,"work_id":"08c6ab0c-7644-40c5-a900-32c3f55266ad","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:59c31995bcd7dc1bf66af5439434e5082551990fb88b4ed4a56dc43e9026c7dd","observation_id":"1f334187-8f02-4e90-b1f0-4194950b9dd9","resolution":{"observed_at":"2026-07-06T16:52:40.291102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.384425Z","title":"Proceedings of the Fifteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"8e625d61-205b-4f0d-b08d-d49acddc2cae","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:dc259bc5e60c86f4f39d6ca11bf3835eef0296b091d1c4f694eeb2d4c582fbbb","observation_id":"d1c1ef9b-7c8e-4ab8-87f0-75b1bede660e","resolution":{"observed_at":"2026-07-06T16:52:40.386464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.376471Z","title":", author=","venue":null,"work_id":"2e4d6f67-bc12-41af-9cee-68bc5d3ed397","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:78410c3022292e26312b23bfecadb42a2128bea76b76f6f983c824a28c0a5b5c","observation_id":"46308e1a-e16c-4827-8310-11d5b19ee355","resolution":{"observed_at":"2026-07-06T16:52:40.378348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:32:42.819018Z","title":"IEEE Transactions on Neural Networks , volume=","venue":null,"work_id":"eec91aba-0fe6-49d1-9ce3-9b364aca43b3","year":1996},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:93a33efb12791fe953690980838a87c5c92a755d085bb3f6a276c8a78c781e6e","observation_id":"b9eb6bdc-d7d5-4fa2-9b68-cd3649abfeab","resolution":{"observed_at":"2026-07-06T16:52:40.325515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.402722Z","title":"2003 , booktitle =","venue":null,"work_id":"f05aba92-a65c-4762-9d14-8b06d3dd13ac","year":2003},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ba56adb186cadbb057ae96a08c97abc0d4747a56d29cd76fb9cbf4f8af317fc6","observation_id":"56f0e67a-ed8d-45aa-aa73-4392dea58ee7","resolution":{"observed_at":"2026-07-06T16:52:40.404206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.350784Z","title":"Information and Computation , volume=","venue":null,"work_id":"b286b2be-aeae-465e-a29e-a3c3d5fd63a6","year":1994},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:7a138dfc11d69eab476f59ec51dd81cc17558ba3ac3bbde9ebfa2cc27889eaa1","observation_id":"c2186f21-3fad-4ae9-a1c9-031e754cf68f","resolution":{"observed_at":"2026-07-06T16:52:40.352052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8019594b08bc95ff720283dfdb25bb2e73aa7903b6675d7e61b027610dc84864","observation_id":"d0a6b86b-a741-4147-bdca-1198d3ff7a38","resolution":{"observed_at":"2026-07-01T08:55:35.889593Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.255261Z","title":"and Veness, Joel and Bellemare, Marc G","venue":null,"work_id":"01fba85c-d0ff-4a68-b89b-c07b6621a271","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:938986bba05c4d51b666e592a3db3cc5f207316d222d18dbdc0f3857b55eb093","observation_id":"5dac5bd2-ce00-4818-83e5-6edfbfc22023","resolution":{"observed_at":"2026-07-06T16:52:40.256923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.371251Z","title":"Nature Medicine , volume=","venue":null,"work_id":"1b2466f9-bf42-44d2-a4f2-70309f7fdebc","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8cdae61724dc514d48284550f42f43e7733a2af045680dc0e2efb643dc06b39f","observation_id":"64ef28e4-d109-4630-8e76-61f152b6f25f","resolution":{"observed_at":"2026-07-06T16:52:40.372950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.327494Z","title":"Empirical","venue":null,"work_id":"5cd7e9ef-cbf5-48e6-89e9-710f2e343d07","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:e1b0c6d0e2a113f90ac2f1ae3856c83a01ad4446d21bad6bc8d9b9e77ed5b124","observation_id":"6b2b7331-052d-422e-913b-d221591b1cf7","resolution":{"observed_at":"2026-07-06T16:52:40.328708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.381419Z","title":"Proceedings of the 25th Annual Conference on Learning Theory , pages =","venue":null,"work_id":"435def41-7c2a-4cdc-89ba-b9d300ce54c1","year":2012},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:87bad39964eec4062a622530802862bdffddbde77339929f3f900cb60476bc57","observation_id":"02221255-3002-405d-9dea-7106dafe63e7","resolution":{"observed_at":"2026-07-06T16:52:40.383001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.277827Z","title":"Reinforcement Learning from Adversarial Preferences in Tabular","venue":null,"work_id":"e55e7734-64f8-400a-9c9a-e2ee69e8deba","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:2563c45f11b1953dee8c6b4b43b58fe3deecacb4e6098447b6e94e77e863214b","observation_id":"0e3c5536-7364-4b30-bac2-00b4f2c0ab60","resolution":{"observed_at":"2026-07-06T16:52:40.279149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.285972Z","title":"Proceedings of Thirty Seventh Conference on Learning Theory , pages =","venue":null,"work_id":"6bf7bb9c-c5e2-45fa-bfa1-92bbaa01c3a8","year":2024},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:0654bbcfc316322db4c933b2f3c28ade554de9bf390a14ef4e08d284a1a33d2d","observation_id":"048475ad-6b6f-4e6d-82b6-f8446350cf73","resolution":{"observed_at":"2026-07-06T16:52:40.288156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.306117Z","title":"M arkov Decision Processes with Arbitrary Reward Processes","venue":null,"work_id":"8e2bf0cb-4308-4e64-a8f2-6181aee9914f","year":2008},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:b4e28031e0ca62aca86d4f04f50c0444676bb10f98e9e926187a5a41399b2ea0","observation_id":"328d5ee9-e3a3-488f-a8d2-9aea70f402ed","resolution":{"observed_at":"2026-07-06T16:52:40.307301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.309856Z","title":"Proceedings of Thirty Sixth Conference on Learning Theory , pages =","venue":null,"work_id":"5f5806e8-8967-4315-b700-e74d7eeb1908","year":2023},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:58a252813238a0b18036577f3be6f638826c76ab146dffa21762b45ae6b25b37","observation_id":"07fd084d-5d60-4008-855a-81960e3a7ce2","resolution":{"observed_at":"2026-07-06T16:52:40.311024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.233233Z","title":"Proceedings of the 39th International Conference on Machine Learning , pages =","venue":null,"work_id":"451e69eb-a94a-41b7-bbdf-0e0e2a45aa45","year":2022},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:09502b477e58714953ed9174122ca010209f4f8bfe88b1906211989b7a976ffe","observation_id":"a85d3468-c1fd-4e7b-b48d-8c1283dbe9b1","resolution":{"observed_at":"2026-07-06T16:52:40.234774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.304169Z","title":"2009 , author =","venue":null,"work_id":"8414a5b9-b52d-4dd8-a338-91c46644bf7a","year":2009},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:b64bcf39afd7d54a7b21206b229c5a5f6fffbcb40ffe21f15d17a9d2ad49b89d","observation_id":"e9096485-519a-4d85-8e7e-de228c345a8e","resolution":{"observed_at":"2026-07-06T16:52:40.305606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.361887Z","title":"Stability-penalty-adaptive follow-the-regularized-leader: Sparsity, game-dependency, and best-of-both-worlds , volume =","venue":null,"work_id":"cd3f24cc-e86e-4e8c-9315-1c5cb5c280e8","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:f3aed0ffe1e5b88c92b9538e963a6385d618365007c198766dc680e344d18ce5","observation_id":"b800689a-e08e-43bc-b1d7-7f7352943bba","resolution":{"observed_at":"2026-07-06T16:52:40.363486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.354481Z","title":"Episodic Reinforcement Learning in Finite","venue":null,"work_id":"0e1e919c-7dbd-4c59-8fc9-d722d0ce5ecd","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:3d4a407da47c7b7d097cc5cb53cb090e3c950cb4232820e170df9fe9dd237621","observation_id":"abb9c9b2-1291-4586-9c3f-a45891fbcc19","resolution":{"observed_at":"2026-07-06T16:52:40.355915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.397931Z","title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"cd912487-65a6-4371-a100-281f7c03883a","year":2011},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:d4f05d911b258a61505d6ad7dd98cf6aa58a442c3779bfadca10fba5544a4ded","observation_id":"2604cc15-1e64-45f0-b27d-a2c119553618","resolution":{"observed_at":"2026-07-06T16:52:40.399771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.353430Z","title":"International Conference on Machine Learning , year =","venue":null,"work_id":"44961756-415e-4e87-a054-04da1ff7e36f","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:41005842c0f4ccc7f6a056d246640e1761ed1648a29cd6c1f160bd9d24ad90e3","observation_id":"6865871f-6166-4178-ad00-ffc61fb2db14","resolution":{"observed_at":"2026-07-06T16:52:40.354755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.367198Z","title":"Narrowing the Gap between Adversarial and Stochastic","venue":null,"work_id":"a8b624f4-b25a-41ff-bc5f-38e027204bb8","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:ae4eb32585f1bf4a05451e5173fb196ec0559a56deb771bcbe9efe53e1992219","observation_id":"5d6dfc3b-f803-42a3-a658-c37bc2f2bb6f","resolution":{"observed_at":"2026-07-06T16:52:40.368877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.316941Z","title":"Proceedings of the 32nd International Conference on Machine Learning , pages =","venue":null,"work_id":"c54039ce-f3bc-4873-bddf-fbd2bc62c4a2","year":2015},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:8f52ba00a38979f62997a03614d5c0cc1a53e6aa7ebfa298410743a68c2e2ff3","observation_id":"40ba6c59-3631-4677-ba57-2d8ab9a7cc61","resolution":{"observed_at":"2026-07-06T16:52:40.318135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.341913Z","title":"Advances in Neural Information Processing Systems , publisher =","venue":null,"work_id":"4b2a5076-c9ba-476f-9781-a48b881f8e16","year":null},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:fb2fab4c2dea5260113993e580fdc3dcb5f98b86895086377bd708d3d11cdbcf","observation_id":"1283848a-a0b0-449f-91e3-da4a95ad938c","resolution":{"observed_at":"2026-07-06T16:52:40.343968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.381826Z","title":"Fine-Grained Gap-Dependent Bounds for Tabular","venue":null,"work_id":"941b4eac-1be6-42b8-b016-e4fe2ab1e7d2","year":2021},"citing_paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-01T06:55:27.313461Z"},"links":{"citing_paper":"/paper/2606.31769"},"observation_digest":"sha256:38805493daa914d00c58095d82be56e32a455753d32f28c5bb9866f9c8bbb3fa","observation_id":"65a0f318-5b1e-4248-81bb-e8d6426791b9","resolution":{"observed_at":"2026-07-06T16:52:40.383860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31769","last_updated":"2026-06-30T14:54:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:41:29.600583Z","submitted_at":"2026-06-30T14:54:34Z","title":"Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":84},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2606.31769."}