{"as_of":"2026-08-20T08:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e962d9d1a2bbf34238cfc217d6598a831165c7a2d764fb7d2661095369417c7b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:27:42.130654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T02:29:25.160173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-08-14T10:27:42.130654Z","title":", Cai, Q","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-15T10:56:00.207708Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T10:27:42.130654Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/1909.01150"},"observation_digest":"sha256:e93b246b81a070731364e2e70ac7e7623804a60d86a0349ef965f5abdb95808f","observation_id":"5305a79e-1dd9-4bdd-a258-3c531cf10641","resolution":{"observed_at":"2026-08-14T10:27:42.130654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-08-14T04:47:08.728735Z","title":"In ICML, volume 2, 267–274","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.728735Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:e4346811499ce37f2ec77f8e8d0f21697c5cf1ef3dac883da220ab164aac7a77","observation_id":"ece489f0-733e-4085-8d4b-11e9f78920b1","resolution":{"observed_at":"2026-08-14T04:47:08.728735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-08-12T18:14:33.898341Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.12042","last_updated":"2025-05-30T01:46:35Z","snapshot_observed_at":"2026-08-19T17:48:04.568289Z","submitted_at":"2024-11-18T20:27:13Z","title":"Fast Convergence of Softmax Policy Mirror Ascent","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:14:33.898341Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/2411.12042"},"observation_digest":"sha256:e234ce93a211e267000e5367b0efaaabe5e1129852c77b10a226ca5347edd374","observation_id":"64d04a35-fb84-4010-b8a6-5d133077290e","resolution":{"observed_at":"2026-08-12T18:14:33.898341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":"1906.10306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preprint arXiv:1906.10306 , year=","venue":null,"work_id":"23153d18-741a-4618-8e89-9889bc8f4a61","year":1906},"citing_paper":{"arxiv_id":"2510.21060","last_updated":"2026-05-13T01:55:58Z","snapshot_observed_at":"2026-08-12T13:48:50.450427Z","submitted_at":"2025-10-24T00:21:38Z","title":"On the Sample Complexity of Differentially Private Policy Optimization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T04:43:58.646419Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/2510.21060"},"observation_digest":"sha256:9d7ed33a096bed72cc0cbabee5082bddd115eb9d6153979600d9fce8bc6fd3fb","observation_id":"d1cc9075-7b04-4ef7-8916-3276575b5799","resolution":{"observed_at":"2026-05-18T04:45:54.823214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":"1906.10306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preprint arXiv:1906.10306 , year=","venue":null,"work_id":"23153d18-741a-4618-8e89-9889bc8f4a61","year":1906},"citing_paper":{"arxiv_id":"2605.20999","last_updated":"2026-05-20T10:38:08Z","snapshot_observed_at":"2026-08-14T13:37:46.693147Z","submitted_at":"2026-05-20T10:38:08Z","title":"Concentration of General Stochastic Approximation Under Heavy-Tailed Markovian Noise","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-05-21T02:27:24.989781Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/2605.20999"},"observation_digest":"sha256:e405227d08d721cecc677e2fc57125261597ca0775cfd0b9fa9427784ca9dccf","observation_id":"1e26dc60-2e16-4f69-bc8e-957516cb4382","resolution":{"observed_at":"2026-05-21T02:29:25.164072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1906.10306/citation-record","integrity":"/paper/1906.10306/integrity","json":"/paper/1906.10306/citation-record.json","paper":"/paper/1906.10306"},"outbound":[],"paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:1906.10306."}