{"as_of":"2026-08-16T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:629cff6b046d4cff9e98024ac20f155cf8f9229e0949f12e2ffcf352fe111031","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:39:04.083982Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:42.782845Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":"2005.03557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-04T08:49:42.782845Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms.arXiv preprint arXiv:2005.03557","venue":null,"work_id":"2c60f9d0-d1f6-473a-b772-fe7e83b36be1","year":2005},"citing_paper":{"arxiv_id":"2401.03893","last_updated":"2026-04-12T15:32:16Z","snapshot_observed_at":"2026-08-16T15:51:38.372672Z","submitted_at":"2024-01-08T13:44:35Z","title":"Finite-Time Decoupled Convergence in Nonlinear Two-Time-Scale Stochastic Approximation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T04:14:37.504082Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2401.03893"},"observation_digest":"sha256:469711741204ea770f32a71e333aab0aea117a5f34db8905e3fb045a5e925e6a","observation_id":"c7fc9279-0d8b-412d-b67e-512d9eeca24c","resolution":{"observed_at":"2026-05-24T04:15:59.905499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-11T05:56:52.756445Z","title":"Non-asymptotic convergence analysis of two time- scale (natural) actor-critic algorithms","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.17070","last_updated":"2026-06-29T06:38:58Z","snapshot_observed_at":"2026-08-15T11:33:26.886069Z","submitted_at":"2024-12-22T15:43:01Z","title":"Decoupled Functional Central Limit Theorems for Two-Time-Scale Stochastic Approximation","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T05:56:52.756445Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2412.17070"},"observation_digest":"sha256:df4c66f16be367be4d3dbe2a8e814f31b3d8ae1caa0b75870ad350b30a8af3a0","observation_id":"21ef55fd-364f-4bea-8ba7-d04d2b8f7bea","resolution":{"observed_at":"2026-08-11T05:56:52.756445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-16T04:39:04.083982Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.01041","last_updated":"2025-05-02T06:30:52Z","snapshot_observed_at":"2026-08-16T04:25:58.142812Z","submitted_at":"2025-05-02T06:30:52Z","title":"Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:39:04.083982Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2505.01041"},"observation_digest":"sha256:ceece817fa40a72847b0cd77e4cbfec1475f339de3d9126537038eced4ba08bb","observation_id":"a3378bad-de8b-4c30-b78e-c7e048cbb534","resolution":{"observed_at":"2026-08-16T04:39:04.083982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-07T14:37:50.547041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18433","last_updated":"2025-08-13T01:12:42Z","snapshot_observed_at":"2026-08-12T07:21:24.668320Z","submitted_at":"2025-05-24T00:00:43Z","title":"Finite-Time Global Optimality Convergence in Deep Neural Actor-Critic Methods for Decentralized Multi-Agent Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:50.547041Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2505.18433"},"observation_digest":"sha256:ee33277f3385a02d76cd44f41ddec93cc33c5f00794d5abe80c5db82ffbce797","observation_id":"35f8e9cf-80a4-4bcb-9073-2f4fe6170e35","resolution":{"observed_at":"2026-08-07T14:37:50.547041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-03T18:33:31.358619Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.05291","last_updated":"2026-06-05T06:54:58Z","snapshot_observed_at":"2026-08-16T19:09:50.807524Z","submitted_at":"2025-12-04T22:28:43Z","title":"SHAP-Guided Kernel Actor-Critic for Explainable Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:33:31.358619Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2512.05291"},"observation_digest":"sha256:7486cca75581395a70bd665d57090ef3688758b9e77ccb4b931720347ed10742","observation_id":"21564185-c876-47dc-8331-4d0d8d2f8743","resolution":{"observed_at":"2026-08-03T18:33:31.358619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":"2005.03557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-04T08:49:42.782845Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms.arXiv preprint arXiv:2005.03557","venue":null,"work_id":"2c60f9d0-d1f6-473a-b772-fe7e83b36be1","year":2005},"citing_paper":{"arxiv_id":"2602.01505","last_updated":"2026-05-06T16:04:38Z","snapshot_observed_at":"2026-08-11T14:55:55.889399Z","submitted_at":"2026-02-02T00:35:42Z","title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:57.430291Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2602.01505"},"observation_digest":"sha256:f16796cc6bc1208a45d254b457cce526d9691c7360da3b40a5e5704f8c2d2ffc","observation_id":"2b993073-af06-439f-9818-87207d0e82cb","resolution":{"observed_at":"2026-05-16T08:17:36.548323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":"2005.03557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-04T08:49:42.782845Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms.arXiv preprint arXiv:2005.03557","venue":null,"work_id":"2c60f9d0-d1f6-473a-b772-fe7e83b36be1","year":2005},"citing_paper":{"arxiv_id":"2605.13639","last_updated":"2026-05-13T15:04:59Z","snapshot_observed_at":"2026-08-02T11:45:59.910042Z","submitted_at":"2026-05-13T15:04:59Z","title":"Achieving $\\epsilon^{-2}$ Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T19:28:32.795407Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2605.13639"},"observation_digest":"sha256:ea71836ae6b1b993aa5828c9a67c6b7c4d7bc23d6ca0ec04339ee10d35cda270","observation_id":"1008e2cc-2969-42a8-8d1e-1400f0862806","resolution":{"observed_at":"2026-05-14T19:29:23.729747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":"2005.03557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-04T08:49:42.782845Z","title":"Non-asymptotic convergence analysis of two time-scale (natural) actor-critic algorithms.arXiv preprint arXiv:2005.03557","venue":null,"work_id":"2c60f9d0-d1f6-473a-b772-fe7e83b36be1","year":2005},"citing_paper":{"arxiv_id":"2606.22579","last_updated":"2026-06-21T16:29:25Z","snapshot_observed_at":"2026-08-02T07:11:59.062207Z","submitted_at":"2026-06-21T16:29:25Z","title":"Stationary Robust Mean-Field Games under Model Mismatches","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T10:50:40.841967Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2606.22579"},"observation_digest":"sha256:45633a9f092a854051941e8284b9eee743d514e6022d6fa2c9ec077ca08951d8","observation_id":"ff79197d-a05b-4276-b55e-211b91379f23","resolution":{"observed_at":"2026-07-04T08:49:42.784176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2005.03557 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:64af2cd2b9d732d95f891b3f9a74d942dfd87c8fb17d13a4c32c22ded68096dc","observation_id":"f95e448a-d11d-43dd-852d-e375044c556e","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-08-15T14:39:15.509987Z","title":"arXiv preprint arXiv:2005.03557 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.06545","last_updated":"2026-08-06T19:49:48Z","snapshot_observed_at":"2026-08-16T19:41:39.037201Z","submitted_at":"2026-08-06T19:49:48Z","title":"Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:39:15.509987Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2608.06545"},"observation_digest":"sha256:45261288e8d46d4ac30c0a3d41dac1bd806aafe9264c40def7e42b475592b0c0","observation_id":"d88536b2-f16f-4da6-955f-bbe6e9d0198e","resolution":{"observed_at":"2026-08-15T14:39:15.509987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2005.03557/citation-record","integrity":"/paper/2005.03557/integrity","json":"/paper/2005.03557/citation-record.json","paper":"/paper/2005.03557"},"outbound":[],"paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2005.03557."}