{"as_of":"2026-08-09T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26ce167ff8e3bd89a3bfeb4a72d6e9e8d9d83d2c33b4c0dca01ed23d47200fda","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:48:33.114297Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:51:04.076537Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04477","snapshot_observed_at":"2026-08-03T18:18:58.439629Z","title":"Near-optimal sample complexity for MDPs via anchoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-07-31T22:43:03Z","snapshot_observed_at":"2026-08-09T03:45:26.166178Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:18:58.439629Z"},"links":{"cited_paper":"/paper/2502.04477","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:345875cb1a3c66f73a42e3df3172220c3d72f7bdfcd2036117348b88bbb89844","observation_id":"57ea9f20-2673-44da-aa4a-4938303e4ca3","resolution":{"observed_at":"2026-08-03T18:18:58.439629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04477","snapshot_observed_at":"2026-08-04T06:51:04.076537Z","title":"Near-optimal sample complexity for MDPs via anchoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06244","last_updated":"2026-07-31T22:43:03Z","snapshot_observed_at":"2026-08-09T03:45:26.166178Z","submitted_at":"2025-12-06T02:04:50Z","title":"Auto-exploration for online reinforcement learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:51:04.076537Z"},"links":{"cited_paper":"/paper/2502.04477","citing_paper":"/paper/2512.06244"},"observation_digest":"sha256:431daf6bdf9de5da4b0af3e7ca8b529b1b81d71fcdb9f8e20335361584091186","observation_id":"fd92dba0-5cbd-4100-8480-4818740c509a","resolution":{"observed_at":"2026-08-04T06:51:04.076537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04477/citation-record","integrity":"/paper/2502.04477/integrity","json":"/paper/2502.04477/citation-record.json","paper":"/paper/2502.04477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.376433Z","title":null,"venue":null,"work_id":"6a1a025a-224d-4e0a-99d4-aeb166646ca5","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.777072Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:225afd7d9ab75b566893d74757f5f00882a14a3974022e5471d99055570357aa","observation_id":"a6c0d75f-e4d1-4cff-afac-9ec6db3d2ee0","resolution":{"observed_at":"2026-08-08T22:48:35.381305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.361643Z","title":null,"venue":null,"work_id":"011f7bbb-f0d9-4db7-8af5-d8cde407da4e","year":1995},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.801994Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:2231d2461aec844ee127df58530370cf03bae16828b6358348e4c5c14fc9fe9b","observation_id":"f580cb8d-3ce7-47d6-8e4d-82c1326750de","resolution":{"observed_at":"2026-08-08T22:48:35.366170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.347071Z","title":"G., Munos, R., and Kappen, H","venue":null,"work_id":"d1de315d-043e-4077-9983-c293f4c8bd80","year":2013},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.825800Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:91aabb4f0b06a5a1776e394122b1b6909a8ceabc6b214b053a70174ee631864e","observation_id":"34ab2e25-ed2b-4733-b1cd-dac981e81cda","resolution":{"observed_at":"2026-08-08T22:48:35.351423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.333136Z","title":"Weighted sums of certain dependent random variables","venue":null,"work_id":"a4ffde9c-30e2-45be-8591-4c1a9b51feae","year":1967},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.844624Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:df21302c6eb77f9a4f0b60b36793bae7add28d534d4b1038974658d148000536","observation_id":"8132e9a9-7de1-479e-b587-902eb5ede860","resolution":{"observed_at":"2026-08-08T22:48:35.337490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.318434Z","title":"U., and Aggarwal, V","venue":null,"work_id":"7d871637-33e2-4b88-8f46-f19a0e98dbdd","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.851877Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:15a11776013d30bb904ed5b2594ebee4651ee4bb089a112486dd76f2ce2dff9c","observation_id":"f4227128-9771-420b-a431-f092f2d1e7b8","resolution":{"observed_at":"2026-08-08T22:48:35.322700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.304130Z","title":"A M arkovian decision process","venue":null,"work_id":"8df926e2-94ed-4636-8152-74fa19f35da8","year":1957},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.856167Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9563a1a82bf928f73e10986b5cebd8fb93b6438bab96e903e6c5aa3dad5deb96","observation_id":"5471941a-dabe-4723-9730-56588789be6e","resolution":{"observed_at":"2026-08-08T22:48:35.308459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.290058Z","title":null,"venue":null,"work_id":"ace52c0a-b94d-48e1-a850-518f46d59f3e","year":2012},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.861333Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:f8599f67655f275da7e1b764900b9f97aa7f6993350bf28f6003fb5b7ba31ab9","observation_id":"8d9953e6-9138-49bf-bd63-e02467ea3586","resolution":{"observed_at":"2026-08-08T22:48:35.294417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.276719Z","title":null,"venue":null,"work_id":"5acb2de7-0215-4ac0-9cfe-579eccc5b85d","year":1996},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.866004Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:004edc634c104539aaaaeb4bfcc30dc43302862fdc7b801f117f9f533c3af104","observation_id":"b1c8853a-bd7e-45d4-8c21-f349c5a20cf7","resolution":{"observed_at":"2026-08-08T22:48:35.281233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.06971","last_updated":"2018-03-19T15:02:15Z","snapshot_observed_at":"2026-07-06T06:29:04.031745Z","submitted_at":"2018-03-19T15:02:15Z","title":"What Doubling Tricks Can and Can't Do for Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.06971","snapshot_observed_at":"2026-08-08T22:48:31.870679Z","title":"and Kaufmann, E","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.870679Z"},"links":{"cited_paper":"/paper/1803.06971","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:7d512b347b9f1e99aaa6fa5b298797372cc83abebd6b11f8d35d179271c264b0","observation_id":"079d0649-fff0-47fb-924c-91ab2a79dfa8","resolution":{"observed_at":"2026-08-08T22:48:31.870679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.257304Z","title":"Discrete dynamic programming","venue":null,"work_id":"9ba30e1a-d4e8-46d4-9af9-a5e724f459a7","year":1962},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.875465Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:aa6c5f009c9d56963b9dffd35e394b36cdf97ab251822189477b8907b1eed976","observation_id":"ab8a314a-4571-4704-ad5e-8472e4c42875","resolution":{"observed_at":"2026-08-08T22:48:35.265306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.081186Z","title":null,"venue":null,"work_id":"5599ba0e-422e-489c-b3ca-9007155fc7aa","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.879796Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:a0b74dd23e38a9da11daed9249c81ec909b3e66e656580775696de333a8116b4","observation_id":"bc3369f8-5ca6-47e8-8396-7388b88bff3f","resolution":{"observed_at":"2026-08-08T22:48:35.141069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12338","last_updated":"2025-05-09T21:02:52Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-19T01:07:35Z","title":"Stochastic Halpern iteration in normed spaces and applications to reinforcement learning","version":4},"cited_work":{"arxiv_id":"2403.12338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12338","snapshot_observed_at":"2026-08-08T22:48:33.213725Z","title":"Stochastic Halpern iteration in normed spaces and applications to reinforcement learning","venue":"math.OC","work_id":"b1bbfde5-1bef-4975-b54d-fc9503639887","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.884881Z"},"links":{"cited_paper":"/paper/2403.12338","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:35dc8ab0bc7906ddba9f859f7cdc29478a768819f471deabc289c14ba12d4997","observation_id":"4e1ec5f7-cd78-4153-b063-010211071eb6","resolution":{"observed_at":"2026-08-08T22:48:33.221284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.038715Z","title":"Stochastic H alpern iteration with variance reduction for stochastic monotone inclusions","venue":null,"work_id":"b54506d6-3d03-4e89-ae54-e6c4fa14dab2","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.888965Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:3e1a8ed0fedfe2ba578f5d021b32d9769ebeba3e7089d4a3bc23ff28564c0776","observation_id":"7d84cbcd-7415-4512-af74-d13c7776f005","resolution":{"observed_at":"2026-08-08T22:48:35.043555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.024978Z","title":null,"venue":null,"work_id":"a237ab91-6b74-4261-a387-d69dceb33868","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.893704Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:8ba685db848f9ef3170c812355ab848d74fa4fa56d27772a988e2572eb181174","observation_id":"994e4a04-f101-452c-bcb0-7d0cc07c9f33","resolution":{"observed_at":"2026-08-08T22:48:35.028925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08920","last_updated":"2021-08-03T11:20:08Z","snapshot_observed_at":"2026-08-05T08:32:54.513722Z","submitted_at":"2020-10-18T05:06:01Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08920","snapshot_observed_at":"2026-08-08T22:48:31.897502Z","title":"Average-reward model-free reinforcement learning: a systematic review and literature mapping","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.897502Z"},"links":{"cited_paper":"/paper/2010.08920","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:11eaead7f95b9ab2c05477c3dcc5c537bc92df9bc3240077e3a161774e859d5e","observation_id":"1a5c1a4f-ee6b-4a6c-b13e-786381d12c5d","resolution":{"observed_at":"2026-08-08T22:48:31.897502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:35.010047Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":"b0a7a76a-09f6-4932-8c88-54acedc0d629","year":2005},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.902132Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:085037110610aa9e00b2f6cde4a951752476a52e3554e8607ae0250ca4559d27","observation_id":"8a31b2dc-d673-4cbe-b1fb-54666603e240","resolution":{"observed_at":"2026-08-08T22:48:35.015122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.994961Z","title":"Regret minimization in MDP s with options without prior knowledge","venue":null,"work_id":"90bc6577-ba9d-4f34-8b1a-325cd13e040f","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.906920Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9794e7eb886f30e1c989bd76ad5ba7a9b2fa400293278389699c1f63e2d6a92e","observation_id":"3bc3b9aa-0e27-406f-b71c-8920beb186ff","resolution":{"observed_at":"2026-08-08T22:48:35.000334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.981334Z","title":"Fixed points of nonexpanding maps","venue":null,"work_id":"f2e7368d-6eba-4953-ad41-d31fa1d035e5","year":1967},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.910727Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:0b77e61f90e9d92f6648a37142e1503d89c47bbf22861c38c1229a78660a9cab","observation_id":"43b847e9-ef88-4276-9a79-78a4d5848601","resolution":{"observed_at":"2026-08-08T22:48:34.985584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.967337Z","title":null,"venue":null,"work_id":"38c90982-1b2a-4ca4-90f2-135b2df07fad","year":1960},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.915182Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:f1c912260f4106a073dbd83575dc6721698a83a90d32db60e89ce2337ecf3dac","observation_id":"8660ebd0-bde8-4f66-8347-a587bb714912","resolution":{"observed_at":"2026-08-08T22:48:34.972046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.953994Z","title":"and Sidford, A","venue":null,"work_id":"55cfb2f0-868b-4364-bd12-08589845ef29","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.920096Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:657968dc09f7708509f0cd4469b3c6fc958e051a07a10154044c202d1f1d7527","observation_id":"c15d6450-9dd2-4201-99a7-09a588487e6c","resolution":{"observed_at":"2026-08-08T22:48:34.958140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.940662Z","title":"and Sidford, A","venue":null,"work_id":"2bb79dd5-73d4-4887-a260-3313f48b74d3","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.924979Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:fa6035e39da5a34eb5421079926d98d7645e8d3fadf1f90a0878c6ee1784234c","observation_id":"4ee15322-a920-4172-97af-f85c87a51f22","resolution":{"observed_at":"2026-08-08T22:48:34.944742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.926416Z","title":"Feasible Q -learning for average reward reinforcement learning","venue":null,"work_id":"4fcba0c6-ec8e-4de6-9d8e-43332b9b1112","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:31.963818Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:42b0ad0335805a0052d618c181e2c0e29b7c83d7c5cdeae054d0e2d31a137be0","observation_id":"81b6d8ee-d219-4423-9eba-73ba8387d9bc","resolution":{"observed_at":"2026-08-08T22:48:34.931061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.888780Z","title":"Truncated variance reduced value iteration","venue":null,"work_id":"e402cc44-b93f-4ce7-8f76-c9f0b7db4654","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.065918Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:e34c506825697528261d3f00a50cdbc479c2d6e4a4faa4ee8a3827038f2a85e7","observation_id":"0a4f39db-4299-4eea-b331-fb249c65830a","resolution":{"observed_at":"2026-08-08T22:48:34.917313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.745627Z","title":"and Zhang, T","venue":null,"work_id":"f47380a4-d78f-404e-ba41-c27db225e8b5","year":2013},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.177036Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:13af0a2031daa564751f22d6c2458292ab68643ebf19f0d682367c81a0dc677d","observation_id":"7e47a3ba-f557-421c-acfe-ccc5761b3685","resolution":{"observed_at":"2026-08-08T22:48:34.798170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.642565Z","title":"An -best-arm identification algorithm for fixed-confidence and beyond","venue":null,"work_id":"82e2b1c5-b973-4113-9739-8a02126e3cb7","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.270625Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:d00d5aed4f84a386047639e6371b7a57bbf4d3fb5d5131b13dae9c6105a21059","observation_id":"aefbacb3-3aee-4b3b-a896-8069f2aa383a","resolution":{"observed_at":"2026-08-08T22:48:34.653622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.628694Z","title":"and Jamieson, K","venue":null,"work_id":"41f9e484-9c37-4f2a-8dc6-1f91a751af63","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.309190Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:70882a91191a0936cbaa27483ac44a8a37177e008362cfcefa9023487c980ea9","observation_id":"97798eca-1f4e-44f7-938f-a5c9d30cf669","resolution":{"observed_at":"2026-08-08T22:48:34.632874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.614529Z","title":"and Singh, S","venue":null,"work_id":"7898b46c-edd7-444f-b205-53486aa4eeeb","year":1998},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.356479Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:bb4f2bab2961294c91583dd3667fe01e97a7c649b296cd0ae176c3ee81e87125","observation_id":"9c44ef31-2546-4bb7-9763-ba3ad9274521","resolution":{"observed_at":"2026-08-08T22:48:34.619684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.600318Z","title":"Accelerated proximal point method for maximally monotone operators","venue":null,"work_id":"23697a58-21f4-4442-bbca-ac59e5057efe","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.392996Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:8da6da315b66d9457e732cefe502b5bff7177244e9190aa29232934423f0d206","observation_id":"5966d6d3-b39a-47f9-84a2-7b36710a261d","resolution":{"observed_at":"2026-08-08T22:48:34.604718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.585578Z","title":"Y., and Mannor, S","venue":null,"work_id":"1afa80c0-1fbe-4036-863e-335180be1f57","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.415711Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:e5d1db92ad04b1c2f7e3a72ae633c78ceb789ec600245b0679c58391f6672162","observation_id":"8e19db17-a48f-4f7d-8968-1d960b533fb2","resolution":{"observed_at":"2026-08-08T22:48:34.590069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.572208Z","title":"Y., Srikant, R., and Mannor, S","venue":null,"work_id":"894c116d-b6e7-499e-9ccc-100f21d8cabd","year":2025},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.427252Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:f4db56a68a6cf34a11ffb5225377a4ea0b3fe305fc6b05217b2dc5f65b36675e","observation_id":"ae9d1a2d-246b-4274-83e5-dce8ac801723","resolution":{"observed_at":"2026-08-08T22:48:34.576590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.557958Z","title":"and Ryu, E","venue":null,"work_id":"7482a663-a229-4104-987f-d135d53d8db5","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.431951Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:cdd7f2127899b5ddb5703b07a3761b0b54b3ddfb62f747b999279e2f50ce6152","observation_id":"a5f05752-a821-416e-a600-24d01b6ff205","resolution":{"observed_at":"2026-08-08T22:48:34.562153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.542954Z","title":"and Ryu, E","venue":null,"work_id":"acefb483-84b5-4906-84c3-99bcd1301c17","year":2025},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.437826Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:d797500bad55db990d547b5de49fd09117cf9d939da397ba41b5db365aefc7b1","observation_id":"68678cd1-5010-4abf-9825-204bdcf66f00","resolution":{"observed_at":"2026-08-08T22:48:34.547674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.459711Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"51226a67-45c9-4ecd-9672-c952d7ebb9b8","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.442294Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:58cde32ea18a26c50bafcd1db70261c7c0805febad3aed50ca5b9b94204c0c64","observation_id":"5ea594d2-ff32-4602-b069-f2c62a3b3ad2","resolution":{"observed_at":"2026-08-08T22:48:34.506560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.348899Z","title":"Stochastic first-order methods for average-reward M arkov decision processes","venue":null,"work_id":"a502d3fd-2cbd-4ecd-95ca-7461b7d2171d","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.446716Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:e5e3f38ae5f2ba24908d17a7950b638a8f23e0c98901cfb02fe9bd6ec10cd023","observation_id":"246097ab-b289-4951-86d7-c878ef346b83","resolution":{"observed_at":"2026-08-08T22:48:34.384186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.334911Z","title":"On the convergence rate of the H alpern-iteration","venue":null,"work_id":"3b76c004-77b2-4a5b-9d33-eaaa7ce854e4","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.451136Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:c45ce211550f97b0035f64c334d892d0c90f0f614fe9fcc8a700bfc46104b8a4","observation_id":"67877b08-3ef0-4f46-a86b-7cf26beb410a","resolution":{"observed_at":"2026-08-08T22:48:34.339419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.320549Z","title":"Average reward reinforcement learning: Foundations, algorithms, and empirical results","venue":null,"work_id":"35f91b57-8b6e-4a51-8bd6-d79aad5b1b09","year":1996},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.455356Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:7e4ce19226fc01392a187ca3797509b777b5e664fb7d192a5c0d85f8ea90bdef","observation_id":"9ee31ff6-ffcf-4c41-999b-b86b80114a7c","resolution":{"observed_at":"2026-08-08T22:48:34.325611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.306434Z","title":"Finding all -good arms in stochastic bandits","venue":null,"work_id":"4b930ea6-55ef-4f6f-8395-e091820c3078","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.459849Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b0b9ec6cb8f48e67fd8cc24ff5fc59b6bf1c1ad0c2815834072432f9d767ef18","observation_id":"7d047367-15e1-4d05-a53d-154aaae69599","resolution":{"observed_at":"2026-08-08T22:48:34.311312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.292658Z","title":"A., and et al","venue":null,"work_id":"73c07927-1633-4eea-a863-b36ecf109721","year":2015},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.463764Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:942a43a7d9ddfc70dea1058628d98d3edb020c9b73b036625c53aadeeb8c9895","observation_id":"b1a61167-9a7b-47a2-811a-24713a39dd31","resolution":{"observed_at":"2026-08-08T22:48:34.296661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.279845Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":"677cda40-0469-4d7a-89af-27c3807728bf","year":2008},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.468453Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:daf1afbb223a719d690aa7852472b4b0539603606ae1dcc8f3b167747960f81e","observation_id":"3ced112a-25b0-4238-967a-97e59a574c06","resolution":{"observed_at":"2026-08-08T22:48:34.284077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.266544Z","title":"and Srikant, R","venue":null,"work_id":"c06e2894-3090-4bae-8425-3b27e99d4eca","year":1979},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.472967Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:58dc527008308e56fb0309118da10ac73acdd020968050364f92d345bbebaaca","observation_id":"ee982dfd-3408-430c-b656-ae1a0c6d73a5","resolution":{"observed_at":"2026-08-08T22:48:34.270618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.246508Z","title":"and Okolo, N","venue":null,"work_id":"627b51ae-169a-48c5-b4c7-c5b113ed7142","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.477471Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:3078a98a88c72cda7f1f031224c283c58e2022d9ddefdcc2e4451ba8aaba262e","observation_id":"f30b2363-3cca-4118-8b1e-2d82de96dd01","resolution":{"observed_at":"2026-08-08T22:48:34.251721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.232469Z","title":"M., Liu, J., Scheinberg, K., and Tak \\'a c , M","venue":null,"work_id":"88f6f21d-331c-41fd-b0bc-c90969b04bd4","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.494634Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b4a8cb9dfa2fa5d6a8d8c9658b5f0c9c7687376295c25cea50bf61f210536194","observation_id":"c79f08b4-a558-4c76-ab8f-b6a0451e358b","resolution":{"observed_at":"2026-08-08T22:48:34.236817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.163803Z","title":"and Ryu, E","venue":null,"work_id":"9c106579-7162-4ab8-8bbd-c02ad1ac0f4e","year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.588998Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:f0a12e0bc1a669a8a858425dab6c08e011f5747fc9f44eeef6ccac1cfaeeab3c","observation_id":"7f37755b-22d8-443e-9284-ade197858d02","resolution":{"observed_at":"2026-08-08T22:48:34.208132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:34.062640Z","title":null,"venue":null,"work_id":"b567def9-c3eb-46e1-991c-f320bab7a3b2","year":2014},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.734829Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:dbebdb77c2c9b205913720607752f5e34f9a564e4ac25928ff243c50f71078bc","observation_id":"df731c54-283e-4cb8-a503-e51459b80af9","resolution":{"observed_at":"2026-08-08T22:48:34.108545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.943648Z","title":"Strong convergence theorems for resolvents of accretive operators in B anach spaces","venue":null,"work_id":"29374f36-86d7-428c-acd2-7d5780121935","year":1980},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.748479Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:d8dd1317f6170bd18b5fa0fac392b58898ee5f1cdbf7f192d3b8987874799ba3","observation_id":"6c8ed0f4-ec9e-40c0-a5b5-40130bdec4b8","resolution":{"observed_at":"2026-08-08T22:48:33.999717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.930050Z","title":"and Mansour, Y","venue":null,"work_id":"545ccbd2-3360-479c-a683-6041ed0a9356","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.768186Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9f5289d2c850acff883a6a662eedf6b1582add059bd28df4cc66dd4b9bcb0c7f","observation_id":"7fab3d07-0926-4b1f-8507-88f7db287c0f","resolution":{"observed_at":"2026-08-08T22:48:33.934187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.916289Z","title":"and Shtern, S","venue":null,"work_id":"38fbeff2-7315-4944-9c9c-d4096f3ce02b","year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.780734Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:69d2181291824098244caa88e3792634ecdc3b8efc866e6304b5ae87fbfb9101","observation_id":"312fa99d-b052-4dd4-a9ad-f6e3ac60ac59","resolution":{"observed_at":"2026-08-08T22:48:33.920700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.901692Z","title":"Near-optimal time and sample complexities for solving M arkov decision processes with a generative model","venue":null,"work_id":"01f9574f-8556-45c5-aae6-331b52c09947","year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.788355Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:c011c341ee3a7c99d2772875c4a1c4ba274d966328bb95616677625b0c1e32d1","observation_id":"1c0aeceb-2f32-4a56-8a46-c5f6ab9b45b8","resolution":{"observed_at":"2026-08-08T22:48:33.906432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.887145Z","title":"Variance reduced value iteration and faster algorithms for solving M arkov decision processes","venue":null,"work_id":"7414e899-23d6-42c5-a65b-0240aaf86ef0","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.793396Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:c99bee510fa9abac303a3291e2b4d9d76c4984fe3e01c00d1dd9518cb14d54e7","observation_id":"c4dbc32f-8889-4c84-b184-281d760b7b39","resolution":{"observed_at":"2026-08-08T22:48:33.891913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.862361Z","title":null,"venue":null,"work_id":"10f3f39c-1cb1-484e-9ced-f3e21ed03188","year":1988},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.797742Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:e1cc517569c3d97c9e884be81ac81787772e93f56317e4a5d7534117df0e336b","observation_id":"1148d948-2309-453f-a4fd-c04a3f99b1d1","resolution":{"observed_at":"2026-08-08T22:48:33.877940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.819677Z","title":null,"venue":null,"work_id":"e224e35c-e53f-4803-b830-011404d0bb3f","year":2018},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.801806Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:0e3d04b5ea6377c0f997e51d078de3a187af321269a1ee561e540531a701df95","observation_id":"bf4e78f9-d24d-4f6a-a270-022d544ba479","resolution":{"observed_at":"2026-08-08T22:48:33.839562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.601277Z","title":"Algorithms for Reinforcement Learning","venue":null,"work_id":"c85f6260-c9bf-481a-9461-acb5b8887c0a","year":2010},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.806678Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:cf10b18ed5c108c998c56242851aaa5ce53ec33e42151fc6215caf2b8c0845fe","observation_id":"9cf865e6-99bd-4526-8fb5-490dc7fcc371","resolution":{"observed_at":"2026-08-08T22:48:33.701272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.586868Z","title":"Finding good policies in average-reward M arkov decision processes without prior knowledge","venue":null,"work_id":"5aaaf9eb-4d80-43ea-9e6a-7ddbae495359","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.810601Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:08a7b4c7459aca7334c34cbc7e8a5c8bfb7d727511491305bf47c2fde3437edd","observation_id":"c79fe039-f5f9-4024-8dc4-f355a07aea7b","resolution":{"observed_at":"2026-08-08T22:48:33.591673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04697","last_updated":"2019-08-08T17:33:58Z","snapshot_observed_at":"2026-08-08T04:58:01.906827Z","submitted_at":"2019-06-11T16:58:54Z","title":"Variance-reduced $Q$-learning is minimax optimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04697","snapshot_observed_at":"2026-08-08T22:48:32.814848Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.814848Z"},"links":{"cited_paper":"/paper/1906.04697","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:c318ef2eb6cfb2bdebc5757d6e13668d39eb45f5a89c3b6f84367bf8aef0529c","observation_id":"a7e16fd6-1b54-4c91-a3da-ba2c5e5aec17","resolution":{"observed_at":"2026-08-08T22:48:32.814848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.572527Z","title":null,"venue":null,"work_id":"88ab287a-cb6d-441b-b8c5-411d655c850a","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.819248Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:28ac3686a2be273a5ea316885bacd75a681aae7c04c76f63cc087f25bdb3d3d2","observation_id":"807d7a90-8441-4ab6-af08-1f3a2e150258","resolution":{"observed_at":"2026-08-08T22:48:33.576996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-07-06T14:25:40.781383Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-08T22:48:32.824182Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.824182Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:a6ac67cff8e8e908c98b0c6ee89a681002913b8f65d4367abe4ffcc53c60dfb0","observation_id":"32ab1a26-20b5-443f-9542-807e6181f9e3","resolution":{"observed_at":"2026-08-08T22:48:32.824182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06100","last_updated":"2017-10-17T05:03:19Z","snapshot_observed_at":"2026-08-07T11:28:35.203683Z","submitted_at":"2017-10-17T05:03:19Z","title":"Primal-Dual $\\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06100","snapshot_observed_at":"2026-08-08T22:48:32.829460Z","title":"Primal-dual learning: Sample complexity and sublinear run time for ergodic M arkov decision problems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.829460Z"},"links":{"cited_paper":"/paper/1710.06100","citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:a048d834046a9a3144b59e10df018fcee3a2650b80115288cd049fcb59c4b0f1","observation_id":"c5337e60-d0f6-445d-9e53-ee7c5761380f","resolution":{"observed_at":"2026-08-08T22:48:32.829460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.558032Z","title":"Optimal sample complexity for average reward M arkov decision processes","venue":null,"work_id":"5f4ffa83-44e6-400c-b574-b7413644784f","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.834124Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:84de516f63b52b044fb439b0f62398feb203da4b0676cbe0027a9161b22d75e2","observation_id":"086120f1-6b5a-43c6-8f19-87d59acf8650","resolution":{"observed_at":"2026-08-08T22:48:33.562637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.541907Z","title":"J., Luo, H., Sharma, H., and Jain, R","venue":null,"work_id":"b9fc2eb5-561d-44fb-8ba4-61719f35087d","year":2020},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.838129Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:99dc58443a1a9f7fc9b0e0ce318c7dc35ae85558a752990d46f699eecdfaeea1","observation_id":"c3b98127-31c4-4daf-a83b-0494e20a430b","resolution":{"observed_at":"2026-08-08T22:48:33.547358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.440594Z","title":"Approximation of fixed points of nonexpansive mappings","venue":null,"work_id":"1eef42c8-3ca8-4072-a95c-848b35e820bd","year":1992},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.842808Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:9b86c6d4c9aa56ec8a30ff4b05a4c2b5e0b409875935d3ef1e55e5bb5a4a8a08","observation_id":"3f56888e-d312-472d-b92b-47e14efd51e5","resolution":{"observed_at":"2026-08-08T22:48:33.519795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.306081Z","title":"Iterative algorithms for nonlinear operators","venue":null,"work_id":"fbc06a80-100b-4c56-8963-12964150bfb8","year":2002},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.847597Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:fc94f281c6c9e7a33b0a857eff21546fd015d930c6ae5404c1bff371dce0aaea","observation_id":"f13a70e5-2694-4ef6-a9cd-5043d6e698a2","resolution":{"observed_at":"2026-08-08T22:48:33.353677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.289485Z","title":"and Ryu, E","venue":null,"work_id":"3acae3b6-e18b-4945-80ca-643e5abe1f11","year":2021},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:32.884091Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:b14308c1efeb1ffa0d89019e8d7134af5ab46a83d5bed70734ff90e3501930fc","observation_id":"0f84857f-5ec0-46da-ab79-1cd7eb8ea5a7","resolution":{"observed_at":"2026-08-08T22:48:33.294665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.274157Z","title":"and Xie, Q","venue":null,"work_id":"a6b3e315-8b25-4107-8a5f-8cef3a843bf6","year":2023},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.022441Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:460607bf101dd509c7c52b1c497c0f61493fc64812bf8d4c2d958750e214c0e9","observation_id":"0a693ff1-51e2-4bad-a79c-5b7160dde0a8","resolution":{"observed_at":"2026-08-08T22:48:33.279188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.258929Z","title":"and Chen, Y","venue":null,"work_id":"31f720b5-e6a8-478d-9e4c-7c6e938d52b2","year":2024},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.109820Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:8238d2afd49bc8d51b63d6e07d3d17eb97dc4f815b445d540be7fc53b5856161","observation_id":"75878761-0f78-4812-83da-89c6fd3bee47","resolution":{"observed_at":"2026-08-08T22:48:33.263816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:48:33.114297Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:48:33.114297Z"},"links":{"citing_paper":"/paper/2502.04477"},"observation_digest":"sha256:416c19c2b1978c6bd40e41c6416b8e2b120fae89defb3fe591fdab35deedb969","observation_id":"0fe317f3-ab06-4ec0-9f6a-226958058625","resolution":{"observed_at":"2026-08-08T22:48:33.114297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04477","last_updated":"2025-06-13T13:25:59Z","latest_version":2,"primary_category":"math.OC","snapshot_observed_at":"2026-08-09T02:39:25.758694Z","submitted_at":"2025-02-06T20:01:59Z","title":"Near-Optimal Sample Complexity for MDPs via Anchoring"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 2 inbound Pith citation observations for arXiv:2502.04477."}