{"as_of":"2026-08-09T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:988ef8a7e13f376be61d45ddfdc0ad1ebd2640bc8db5a86790eb10f159862d37","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:01:40.909364Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.09474/citation-record","integrity":"/paper/2602.09474/integrity","json":"/paper/2602.09474/citation-record.json","paper":"/paper/2602.09474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.287853Z","title":"We’ll now proveG 4 is true w.p at least 1−δ","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.287853Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:d7379f266e2a5a13a5d0320a88372493fce0b85484601857254ab7f20eb36858","observation_id":"dade1b98-4bbb-42b9-9df5-5655a500dcce","resolution":{"observed_at":"2026-08-03T03:01:40.287853Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.064946Z","title":"Online learning in episodic markovian decision processes by relative entropy policy search","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.064946Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:085880a6a8e744ba32cd364a2c8251b5993919c4edae0f0b46a100cbe901a9d4","observation_id":"0ba61a41-0bc5-4473-9d3d-5e6c635a333a","resolution":{"observed_at":"2026-08-03T03:01:40.064946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.368373Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.368373Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:0fd9016968f4926fdf6d7602957e7b687b7abde5971c7c2f3c1b1149c471543a","observation_id":"1eabc990-6bea-46e8-9fcd-411e857fe43b","resolution":{"observed_at":"2026-08-03T03:01:40.368373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.556561Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.556561Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:8a8110afe81d55c1bd2422ec45d6c971f6f90473e89ab3f23e2ba52e74431c36","observation_id":"694328ff-cfee-4c8e-96fd-774cc1636c45","resolution":{"observed_at":"2026-08-03T03:01:40.556561Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.751409Z","title":"qpk,πk h (s, a)− X c∈Ch ˆµk h(s, a, c)ϱk(c) ! ¯ℓk h(s, a) # (tower rule) = X k,h,s,a Ek","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.751409Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:6efc5da04bbcd6effe3fd96103c0504123d3176c5e869d0f83d4c95c8bf339dd","observation_id":"2d3009bd-3173-443b-945c-3b7115547b65","resolution":{"observed_at":"2026-08-03T03:01:40.751409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.909364Z","title":"bandit decision step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.909364Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:67ec144454595f584ed0d2878a7e511e8c590ac7de8369b2c5257c1ed2a25c9a","observation_id":"b1243624-b570-4126-86c0-c88a71ccca3d","resolution":{"observed_at":"2026-08-03T03:01:40.909364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:40.202680Z","title":"That is, a tuple (s, a, s′) for each step inΛ h","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:40.202680Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:74d5578cf6b5e578386e784c3f7f7b2cb6b52134605535abd441fd03d65ca0d8","observation_id":"92a4e4db-fb0b-483f-8397-5d901eba3fcc","resolution":{"observed_at":"2026-08-03T03:01:40.202680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08689","last_updated":"2023-11-01T03:08:01Z","snapshot_observed_at":"2026-07-06T08:38:22.401222Z","submitted_at":"2019-11-20T03:49:13Z","title":"Corruption-robust exploration in episodic reinforcement learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08689","snapshot_observed_at":"2026-08-03T03:01:39.214140Z","title":"Corruption robust exploration in episodic reinforcement learning.arXiv preprint arXiv:1911.08689,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:39.214140Z"},"links":{"cited_paper":"/paper/1911.08689","citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:4d494c57e075efdc8c81f0f2ad5f3c7fb5151afa242a769857c317892538b88a","observation_id":"29c0e365-0bf4-4273-9e28-0bcf44422b12","resolution":{"observed_at":"2026-08-03T03:01:39.214140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:01:39.734586Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:39.734586Z"},"links":{"citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:f1b801ce9a83b1e6dfcd2edab5a15f4f200375cb798439a1e41148d198027c16","observation_id":"316ee0d0-ef26-477e-a2f0-174e4c21f9b2","resolution":{"observed_at":"2026-08-03T03:01:39.734586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03161","last_updated":"2022-08-20T02:54:31Z","snapshot_observed_at":"2026-08-06T14:17:36.708621Z","submitted_at":"2020-10-07T04:55:56Z","title":"Model-Free Non-Stationary RL: Near-Optimal Regret and Applications in Multi-Agent RL and Inventory Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03161","snapshot_observed_at":"2026-08-03T03:01:39.324907Z","title":"(To appear.)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T03:01:39.324907Z"},"links":{"cited_paper":"/paper/2010.03161","citing_paper":"/paper/2602.09474"},"observation_digest":"sha256:4abe8557723cfa13a095310fd72bdcf3bc1e10581f6b333b7fe31705f98ff8b8","observation_id":"0fe8e462-4df1-4cd4-be59-fd0cd6758d7a","resolution":{"observed_at":"2026-08-03T03:01:39.324907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.09474","last_updated":"2026-06-01T09:59:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:03:34.773738Z","submitted_at":"2026-02-10T07:13:11Z","title":"Online Learning in MDPs with Partially Adversarial Transitions and Losses"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2602.09474."}