{"as_of":"2026-08-08T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71a15668776757376e97a50ff6f2d5adc2408e0cae8896a95b5ef84add0b5936","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:16.554175Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24113/citation-record","integrity":"/paper/2505.24113/integrity","json":"/paper/2505.24113/citation-record.json","paper":"/paper/2505.24113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.436196Z","title":null,"venue":null,"work_id":"90dc54d3-2ca9-4905-ac7e-d0098a22ce9e","year":1998},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.295416Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:7be211a529f885680f9a14220110913270b5c627f2c39b8c9296db765a39ff27","observation_id":"f776eeba-bc9d-4697-8e94-9e8b33660b12","resolution":{"observed_at":"2026-08-07T12:44:20.493208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.277508Z","title":"Distributed reinforcement learning algorithm for dynamic economic dispatch with unknown generation cost functions,","venue":null,"work_id":"122bdd04-ce25-4be9-a9bb-3ebee0f9e281","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.400784Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:1a39f05359fc72b204ffd327e7ff3f2b6566b8e1122d853c30ceecc5591b2913","observation_id":"177ae6f0-28fd-4767-81c8-c2de3da67f73","resolution":{"observed_at":"2026-08-07T12:44:20.378440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.178841Z","title":"Distributed Q-learning algorithm for dynamic resource allocation with unknown objective functions and ap- plication to microgrid,","venue":null,"work_id":"0a138d8e-7ccc-4e47-8735-933a7a28015f","year":2022},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.539961Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:a505e578f20bd6b217051f2324e0da22d5c48dbb08d11078cadd607aee4c20c1","observation_id":"9c79187e-5f15-46d6-ae2b-f0c572a8aa00","resolution":{"observed_at":"2026-08-07T12:44:20.211528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:20.066445Z","title":"Multi-agent deep reinforcement learning for large-scale traffic signal control,","venue":null,"work_id":"6206f04d-159a-40cc-8547-b3577393239e","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.667732Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:53185bc4ec706abc35d261c6c3e90d4733a0020792133ee7de56ab7a76f4eb28","observation_id":"124b19d0-8fb3-461e-a3c6-092c2fe33ac4","resolution":{"observed_at":"2026-08-07T12:44:20.130854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.993534Z","title":"Large-Scale traffic signal control using a novel multiagent reinforcement learning,","venue":null,"work_id":"814ba3a7-80e1-4c3e-8c42-17103f6b214e","year":2021},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.770045Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:565367722c219e1bfa7556cac0a5fd34af01a5b5c81db8420a07f49d843cfebe","observation_id":"2e346283-6c11-47df-84f6-9088b10b160a","resolution":{"observed_at":"2026-08-07T12:44:20.011168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.894272Z","title":"A multi-channel transmission schedule for remote state estimation under DoS attacks,","venue":null,"work_id":"abe899e0-2407-40d1-bd65-b9c641d2fcab","year":2017},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.848820Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:e2ff723f3c17c8d62c4d400605d574f21f93470e83e625f96dc68f6f2451ec2f","observation_id":"81656743-995e-421b-9623-141de60b2656","resolution":{"observed_at":"2026-08-07T12:44:19.929701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.817157Z","title":"Distributed reinforcement learning for cyber-physical system with multiple remote state estimation under DoS attacker,","venue":null,"work_id":"5c4e43ca-232a-48a2-9527-fc13cbcee3a8","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.929414Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:13799fa75c1fb6b8ea037d8941e650b35d8ec601b78a018ecc556510c1aba15c","observation_id":"fb7678ca-e2ce-4a61-b5fa-3fa4f5aec444","resolution":{"observed_at":"2026-08-07T12:44:19.847843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.719944Z","title":"Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,","venue":null,"work_id":"294fbe25-d84d-4096-9c4e-339b9f692e54","year":2019},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:14.991076Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:81df801b18b168991f98a08440675a003a3cbfb0d055843bb513618f7c2ac16c","observation_id":"acece6bf-4ca5-4592-ab63-789a746ad2c0","resolution":{"observed_at":"2026-08-07T12:44:19.775900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.605409Z","title":"Deep reinforcement learning for user association and resource allocation in heterogeneous cellular networks,","venue":null,"work_id":"4abe8829-a543-4cab-9650-35502d86d771","year":2019},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.059313Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:6c1216b321a89c5228e163e211532f22116feaf559aa13cfaef53060033240b8","observation_id":"4b150f2d-2476-40ad-9c27-d60063479963","resolution":{"observed_at":"2026-08-07T12:44:19.669977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.523662Z","title":"Intellilight: A reinforcement learning approach for intelligent traffic light control,","venue":null,"work_id":"94d3bca7-ebc1-437b-a4b5-cc95775d26c9","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.128409Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:0788798f6ef5f01162f259238fa36ce17eb98bf2e44672dc0a1c868197aacbc3","observation_id":"63c2aa6c-a616-4b83-8a28-24d140a4c9b4","resolution":{"observed_at":"2026-08-07T12:44:19.568891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.360976Z","title":"Multi-agent reinforcement learning: Independent vs. coopera- tive agents,","venue":null,"work_id":"3f270a80-c091-4e3f-a7d9-919ab9bf0d46","year":1993},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.159627Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:6f959cd432eebbee072dc2cf5c6ded8d030116db07b425ead5fb93a75f7516d4","observation_id":"40a04de8-ddbb-4eda-84ac-7ad3fc482955","resolution":{"observed_at":"2026-08-07T12:44:19.453484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.260165Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning,","venue":null,"work_id":"926562e7-6206-48ee-a81b-8049c44848a3","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.188945Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:aa4639fbfe646af5eaad777ab4e88ad95c8cfe6efff5d090d84cb668a36649ab","observation_id":"4b7b1cbf-c919-4ebe-b79d-1eb9ec6c88c9","resolution":{"observed_at":"2026-08-07T12:44:19.313930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.176606Z","title":"QPLEX: Duplex dueling multi-agent Q-Learning,","venue":null,"work_id":"f4e12cbe-5dc8-4c5b-98ad-2731c4412331","year":2021},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.221175Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:d70f4e07e13c150b7691e04ac20be97b5b2809bed3ed88a3a558eacb7c515754","observation_id":"3a4adffe-50e4-426c-bca7-870c67feafc7","resolution":{"observed_at":"2026-08-07T12:44:19.226642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:19.062424Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":"3be29dd4-1f72-46ce-9405-592892e4b126","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.251295Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:c2d0c656aa15f6c23a079c057fe6b0e8c99ba9b47755f25921a38cf1b82e4964","observation_id":"49141aae-5ed1-4523-ace7-eccadf984a04","resolution":{"observed_at":"2026-08-07T12:44:19.129646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.12322","last_updated":"2020-10-04T08:07:44Z","snapshot_observed_at":"2026-07-06T09:41:25.799628Z","submitted_at":"2020-07-24T02:21:55Z","title":"Off-Policy Multi-Agent Decomposed Policy Gradients","version":2},"cited_work":{"arxiv_id":"2007.12322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.12322","snapshot_observed_at":"2026-08-07T12:44:16.673627Z","title":"Off-Policy Multi-Agent Decomposed Policy Gradients","venue":"cs.LG","work_id":"76cbcd8e-c5e9-42d5-bf48-29c3e4b2ae18","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.327949Z"},"links":{"cited_paper":"/paper/2007.12322","citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:680c67d4b8861f834592fe9f3702cad3c8a9b75961820d7bd2d220e0e25302e8","observation_id":"18c2cc5b-0075-45e4-9a09-ef2c9bdcf37f","resolution":{"observed_at":"2026-08-07T12:44:16.742474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.958436Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents,","venue":null,"work_id":"792ebde6-fc3f-4037-902b-75554e4df5ce","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.405961Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:864ca2259c9389c35b288dca8a0dc4448c9275b7315688412198a06170c2f63c","observation_id":"dbe82342-d029-4363-9ff8-28d99790f797","resolution":{"observed_at":"2026-08-07T12:44:18.987896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.833559Z","title":"Distributed actor-critic algorithms for multiagent reinforcement learning over directed graphs,","venue":null,"work_id":"7866cda3-9a7a-48c0-aa41-3785f0214476","year":2023},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.479865Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:f3997a93042978bf0e594b6bc173b0014225762858e93a07766149815c92aba3","observation_id":"a51f0f31-88cd-4519-a326-0f3338064334","resolution":{"observed_at":"2026-08-07T12:44:18.891237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.677476Z","title":"Neural policy gradient methods: Global optimality and rates of convergence,","venue":null,"work_id":"df785706-c5d5-4259-b50d-4f4713a6f761","year":2021},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.556760Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:0c04990509bd1a88570ec6180f013c02c2acf678342ff4cfe9b1ae76a2bed41c","observation_id":"2b2ccda6-253a-484b-9872-73a39ac75c81","resolution":{"observed_at":"2026-08-07T12:44:18.741499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.544822Z","title":"Finite-time analysis of dis- tributed TD(0) with linear function approximation on multi-agent rein- forcement learning,","venue":null,"work_id":"bdcf7cfd-43dc-4691-9f91-2ba65e096e49","year":2019},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.610511Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:098af8ca0e653825bf27487585c0642594b227c4d32913fd8b28187bc71cfc6b","observation_id":"14762a8d-a7ae-406e-aa1c-8f7276f78ecb","resolution":{"observed_at":"2026-08-07T12:44:18.588242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.429952Z","title":"A communication-efficient multi-agent actor-critic algorithm for distributed reinforcement learning,","venue":null,"work_id":"9ed627b0-1687-481d-8e52-ad550ac2c603","year":2019},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.655979Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:bff963b6031b10c0251cd433301dede083d400cc4284db3781ed94a4373aba0b","observation_id":"f8e6f3e1-7422-4203-a594-0b1abf1f6707","resolution":{"observed_at":"2026-08-07T12:44:18.463063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.263932Z","title":"A multiagent off-policy actor-critic algorithm for distributed reinforcement learning,","venue":null,"work_id":"60c3048f-b337-4b36-a01a-0b9211e74479","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.707828Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:851a54d98475e3d37662b4327b09fbd68a7fde18d65ad70ef7b4b6a08cc989cd","observation_id":"5f077a0c-e574-4603-a906-f1c42d31a642","resolution":{"observed_at":"2026-08-07T12:44:18.322608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:18.102844Z","title":"Policy gra- dient methods for reinforcement learning with function approximation,","venue":null,"work_id":"d54f9be0-fd8f-4218-8e7a-29dda71f1eaa","year":2000},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.736459Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:02b1346e65e62ec3a6ddd1128e5b3abdc7b652a4e8a2ac1e06e06a3b12583560","observation_id":"80511adf-5798-4cfd-8e50-0e2403b88c5e","resolution":{"observed_at":"2026-08-07T12:44:18.165247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.922234Z","title":"Neural temporal-difference learning converges to global optima,","venue":null,"work_id":"ea48f10e-daa5-4133-b0f6-9c48dfb69f18","year":2019},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.789945Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:3cb0c78886866fa8d66b349a7505fbbaf1198536000ebd411186e9329489b567","observation_id":"eff02bf0-e670-4cf1-ae71-ba760acbbc3b","resolution":{"observed_at":"2026-08-07T12:44:17.994767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.765638Z","title":"Natural actor-critic,","venue":null,"work_id":"072399d5-2a39-4747-8cb4-810da58acc6b","year":2008},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.883306Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:6f1cbc42cbf74b065cfe535c55a71f022e8563e13344c476d13752788f4d0e5d","observation_id":"b2f0bb85-2e08-4b71-89de-54d91f7940a2","resolution":{"observed_at":"2026-08-07T12:44:17.821569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.632201Z","title":"Optimistic policy iteration and natural actor-critic: A unify- ing view and a non-optimality result,","venue":null,"work_id":"d94a2d8e-8c45-4e57-9734-6931769911ea","year":2013},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:15.936459Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:23e628731f30f60ee7c3bdf63f0052a1d1e0f8e2db9f94545c5f5ca6bb9408cc","observation_id":"ec6a4d39-bfd7-4793-bcd6-f1b2351f9fd3","resolution":{"observed_at":"2026-08-07T12:44:17.681836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.510083Z","title":"Improving sample complexity bounds for (natural) actor-critic algorithms,","venue":null,"work_id":"51eec882-fb96-4feb-a6fa-9d1d1521f5f1","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.030472Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:8553f14e0315c98e6b4576b5acdfb803c412fa45a00d9b60ed9acf4ce799957c","observation_id":"467a7164-fef9-4ed9-874a-e1682bbbfa63","resolution":{"observed_at":"2026-08-07T12:44:17.561850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.387472Z","title":"Constrained consensus and optimization in multi-agent networks,","venue":null,"work_id":"8e4e9707-9f82-4c9a-96fa-e88050120c56","year":2010},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.102296Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:b1485b4ad32e5775f9b40a913da78c57d7c047456b7841fdfef36ddf2a44ed9c","observation_id":"db101711-24e5-44fb-8a98-339b9e8d1085","resolution":{"observed_at":"2026-08-07T12:44:17.427028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.259365Z","title":"Nesterov,Introductory Lectures on Convex Optimization, Berlin, Germany: Springer, 2018","venue":null,"work_id":"05fd82b9-485e-4949-980e-a1b0ae74993d","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.278228Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:4d00aaf366a03ecca5ce099195188eea667e121939b035810915845cc93f60ca","observation_id":"24c32f37-cd00-40fc-8a47-2b49654536d6","resolution":{"observed_at":"2026-08-07T12:44:17.313555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.123378Z","title":"Convergence rates for localized actor-critic in networked markov potential games,","venue":null,"work_id":"fd0ac9f8-eb23-4a76-908e-d6395af53c72","year":2023},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.359953Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:dbae5eb7e925d36572f85635de8390f2b25534a2afbcf01c843dba9551abe25e","observation_id":"5a74724f-e082-4d5f-99b7-ff7ba56f5a29","resolution":{"observed_at":"2026-08-07T12:44:17.152379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:17.007404Z","title":"On the global convergence rates of softmax policy gradient methods,","venue":null,"work_id":"71652e4b-6ec9-43fa-b7b4-339e6b6d4a1e","year":2020},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.437411Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:60ab13a948539e0e8b8a58e629876b0aa5b4dc0cf84b7e001f9465446cffe1b9","observation_id":"f465733a-fdb1-400c-89b7-bcc2b5e76e93","resolution":{"observed_at":"2026-08-07T12:44:17.051872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:16.828823Z","title":"Network topology and communication-computation tradeoffs in decentralized optimization,","venue":null,"work_id":"365d4975-101f-4f3d-9a16-379d87eade98","year":2018},"citing_paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.554175Z"},"links":{"citing_paper":"/paper/2505.24113"},"observation_digest":"sha256:8f313313f7a0fd5f4902f6ffe8063492f107afde845d4fca5fb1d07389a18e2e","observation_id":"d00548e1-bb19-448e-9d0a-4fe31563daf8","resolution":{"observed_at":"2026-08-07T12:44:16.904570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24113","last_updated":"2025-05-30T01:23:14Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-07T12:32:28.251875Z","submitted_at":"2025-05-30T01:23:14Z","title":"Distributed Neural Policy Gradient Algorithm for Global Convergence of Networked Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24113."}