{"as_of":"2026-08-08T16:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:883e2015b64cf3daa67f482c9ad9b6e8d2f24f28f42505dafe9e627f952c1c50","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:37:42.367138Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11066","snapshot_observed_at":"2026-08-05T12:37:42.367138Z","title":"Junyu Zhang, Alec Koppel, Amrit Singh Bedi, Csaba Szepesvari, and Mengdi Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:42.367138Z"},"links":{"cited_paper":"/paper/2105.11066","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:581d48b097f1db785e2043b9d5ae5d4565aea07c55c8753a1f25b20e3b84f1ad","observation_id":"0b3b05ba-0956-46ea-af58-317195781842","resolution":{"observed_at":"2026-08-05T12:37:42.367138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","version":4},"cited_work":{"arxiv_id":"2105.11066","doi":"10.48550/arxiv.2105.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2105.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lee, and Yuejie Chi","venue":"arXiv (Cornell University)","work_id":"74c99bd2-4ab2-47aa-85b9-c7cee7874f0a","year":2007},"citing_paper":{"arxiv_id":"2605.02469","last_updated":"2026-05-04T11:10:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:10:32Z","title":"Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:22.546508Z"},"links":{"cited_paper":"/paper/2105.11066","citing_paper":"/paper/2605.02469"},"observation_digest":"sha256:8231547b5d9a95aff9fb5744aacc6b8119fd2024357f1bf2153ea995dcbb226e","observation_id":"8dce0f95-36d7-4dc9-82ef-34e0cdb87a4c","resolution":{"observed_at":"2026-05-09T05:45:23.160241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence","version":4},"cited_work":{"arxiv_id":"2105.11066","doi":"10.48550/arxiv.2105.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2105.11066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lee, and Yuejie Chi","venue":"arXiv (Cornell University)","work_id":"74c99bd2-4ab2-47aa-85b9-c7cee7874f0a","year":2007},"citing_paper":{"arxiv_id":"2606.29092","last_updated":"2026-06-27T21:20:26Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T21:20:26Z","title":"Priced Motion Through Optimal Faces: A Normal-Fan Geometry for Non-Stationary Adversarial MDPs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:21.047027Z"},"links":{"cited_paper":"/paper/2105.11066","citing_paper":"/paper/2606.29092"},"observation_digest":"sha256:955aa25e9ca47ffb25a989cad98c98448a823070915ffaaebfbf091b43a415fc","observation_id":"199e1e8e-768d-454b-85c3-f9478d3a9671","resolution":{"observed_at":"2026-06-30T09:24:31.621153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2105.11066/citation-record","integrity":"/paper/2105.11066/integrity","json":"/paper/2105.11066/citation-record.json","paper":"/paper/2105.11066"},"outbound":[],"paper":{"arxiv_id":"2105.11066","last_updated":"2023-01-10T19:21:06Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T02:21:34Z","title":"Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2105.11066."}