{"as_of":"2026-08-08T20:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:843745f7229a97ec7a4a72f5737c1382c01eb31ad1a9b794d6099122c6a8d274","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:41:53.055380Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18064/citation-record","integrity":"/paper/2505.18064/integrity","json":"/paper/2505.18064/citation-record.json","paper":"/paper/2505.18064"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13013","last_updated":"2025-01-22T16:56:42Z","snapshot_observed_at":"2026-08-06T04:47:40.931727Z","submitted_at":"2025-01-22T16:56:42Z","title":"The regret lower bound for communicating Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13013","snapshot_observed_at":"2026-08-07T14:41:52.317140Z","title":"_eprint: 2501.13013","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.317140Z"},"links":{"cited_paper":"/paper/2501.13013","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:fddfa8dc1b9e12072550107e1ae61b4eef7e52336781cc1ff6f9da7d8162f05f","observation_id":"b97480b8-281b-492d-a57e-531ff7779aa3","resolution":{"observed_at":"2026-08-07T14:41:52.317140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4217","last_updated":"2012-07-19T13:59:13Z","snapshot_observed_at":"2026-07-06T02:48:21.680156Z","submitted_at":"2012-05-18T19:00:51Z","title":"Thompson Sampling: An Asymptotically Optimal Finite Time Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4217","snapshot_observed_at":"2026-08-07T14:41:52.699755Z","title":"arXiv: 1205.4217","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.699755Z"},"links":{"cited_paper":"/paper/1205.4217","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:4245f03ce01e11683b23233c8435cda86c8b70438e66faa99338eb25ec134464","observation_id":"c1177cdb-2798-4a64-9447-616a5d833687","resolution":{"observed_at":"2026-08-07T14:41:52.699755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12425","last_updated":"2019-12-11T18:01:23Z","snapshot_observed_at":"2026-07-06T07:56:25.136988Z","submitted_at":"2019-05-27T20:15:54Z","title":"Near-optimal Optimistic Reinforcement Learning using Empirical Bernstein Inequalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12425","snapshot_observed_at":"2026-08-07T14:41:52.867553Z","title":"Damianos Tranos and Alexandre Proutiere","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.867553Z"},"links":{"cited_paper":"/paper/1905.12425","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:47952b55cc6ffb9cce4fda7e904b087f99d1f12d5cb389b8fda5fd5b17b138d3","observation_id":"59780be3-1494-4337-9bc4-08bd81a43143","resolution":{"observed_at":"2026-08-07T14:41:52.867553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:54.162726Z","title":"2 2.1.1 Randomized policies, their gain, bias & gap functions","venue":null,"work_id":"56fd613c-d3af-4419-8d96-edacf9989b7c","year":2025},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:53.055380Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:c553596eb3cb615359f8e5fa4585cc783650e083f1e8db517a95afa5a1d393d1","observation_id":"c8f64276-0b8f-4855-882f-859cd0eab264","resolution":{"observed_at":"2026-08-07T14:41:54.230041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1988.19451","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:53.982846Z","title":"Shipra Agrawal and Navin Goyal","venue":null,"work_id":"3f7dc2c5-a2f2-4a07-bdb9-336fb7e66a27","year":1988},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.015182Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:e8e5e402a4458c8a16d7ffdb4c025baeef6c3490961c4a8d5535db6c243545c7","observation_id":"4f545917-448a-4995-90a0-eae6717909f2","resolution":{"observed_at":"2026-08-07T14:41:54.076804Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:54.343108Z","title":"OptimisminReinforcementLearningand Kullback-Leibler Divergence.2010 48th Annual Allerton Conference on Communication, Control, and Computing (Allerton), pages 115–122, September","venue":null,"work_id":"2f2a087c-d171-43ab-b012-88725563665d","year":2010},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.388109Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:d84fdcd60050812bbf637001017eebbdf42e0531881c2da97352e43472a56954","observation_id":"e787acf3-7951-4e31-b64d-2be6d3e1ae14","resolution":{"observed_at":"2026-08-07T14:41:54.432856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1004.5229","last_updated":"2010-10-13T10:11:39Z","snapshot_observed_at":"2026-07-06T02:09:47.909287Z","submitted_at":"2010-04-29T09:31:55Z","title":"Optimism in Reinforcement Learning and Kullback-Leibler Divergence","version":3},"cited_work":{"arxiv_id":"1004.5229","doi":null,"metadata_source":"pith","pith_arxiv_id":"1004.5229","snapshot_observed_at":"2026-08-07T14:41:53.401042Z","title":"Optimism in Reinforcement Learning and Kullback-Leibler Divergence","venue":"cs.LG","work_id":"2a682b3c-01e1-4c3f-927f-d027601d1725","year":2010},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.449262Z"},"links":{"cited_paper":"/paper/1004.5229","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:e24e394e5f3598c2b8da2087ae5de45ae53f458e955be7d1ccba2a7c9eac1231","observation_id":"aa5e2e6b-1d62-480e-ada3-dfe14b0cbdb4","resolution":{"observed_at":"2026-08-07T14:41:53.465716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1111.1797","last_updated":"2012-04-09T10:43:05Z","snapshot_observed_at":"2026-07-06T02:37:10.370619Z","submitted_at":"2011-11-08T04:27:01Z","title":"Analysis of Thompson Sampling for the multi-armed bandit problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1111.1797","snapshot_observed_at":"2026-08-07T14:41:52.078339Z","title":"arXiv:1111.1797 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.078339Z"},"links":{"cited_paper":"/paper/1111.1797","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:cbd159d2d657902712d3b3f5d82ddc67a660464ae2e55bde0f891d6824db79f1","observation_id":"4dcb854f-c078-4950-baf7-133786970846","resolution":{"observed_at":"2026-08-07T14:41:52.078339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05456","last_updated":"2020-07-10T15:52:21Z","snapshot_observed_at":"2026-08-07T18:46:44.111792Z","submitted_at":"2020-07-10T15:52:21Z","title":"Improved Analysis of UCRL2 with Empirical Bernstein Inequality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05456","snapshot_observed_at":"2026-08-07T14:41:52.529881Z","title":"Improved Analysis of UCRL2 with Empirical Bernstein Inequality.ArXiv, abs/2007.05456,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.529881Z"},"links":{"cited_paper":"/paper/2007.05456","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:06c3e93f0553ae11deb42ae61d45d00d1ea6d39732e4df5fe276c2aa6c99807e","observation_id":"f77ad02a-93d7-4232-9cd3-b69d95b5a342","resolution":{"observed_at":"2026-08-07T14:41:52.529881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14338","last_updated":"2021-06-27T23:41:57Z","snapshot_observed_at":"2026-07-06T11:23:33.794895Z","submitted_at":"2021-06-27T23:41:57Z","title":"Regret Analysis in Deterministic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2106.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.14338","snapshot_observed_at":"2026-08-07T14:41:53.192836Z","title":"Regret Analysis in Deterministic Reinforcement Learning","venue":"cs.LG","work_id":"7867aa27-1fea-4fc6-93b8-92372ab9f1bd","year":2021},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.936313Z"},"links":{"cited_paper":"/paper/2106.14338","citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:935546dcc2b7b48f0d8704e3c6b770388f05bbd1ee7b84cb19246879f59d0837","observation_id":"25ad5aad-bcea-4ec1-a0a9-b4747667d607","resolution":{"observed_at":"2026-08-07T14:41:53.279499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.06480","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:53.747595Z","title":"_eprint: 2502.06480","venue":null,"work_id":"87976a89-f360-4d08-8951-462a41d7cb8f","year":null},"citing_paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:41:52.215124Z"},"links":{"citing_paper":"/paper/2505.18064"},"observation_digest":"sha256:4bd1a38166f0d09bf64f84e4dc2fe10fb3fcfd6330d73481e50975fe9e7edbbe","observation_id":"7f096932-4b03-4d01-afc6-f1398f33e713","resolution":{"observed_at":"2026-08-07T14:41:53.838157Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18064","last_updated":"2025-05-23T16:11:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:33:59.436108Z","submitted_at":"2025-05-23T16:11:39Z","title":"Asymptotically optimal regret in communicating Markov decision processes"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2505.18064."}