{"as_of":"2026-08-09T07:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cba267700ee7340d5c64e18e1faee899d1d455e6db6c50c0f2b16c1172fc464","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:07:45.671697Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18554/citation-record","integrity":"/paper/2607.18554/integrity","json":"/paper/2607.18554/citation-record.json","paper":"/paper/2607.18554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.131604Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.131604Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:cd13b62942c84a1ea0d82e6fe8cd487bf900ab49c8b3c7831101b43173b9c5e0","observation_id":"db074900-9149-4f9e-9ff3-efba1aaf7f94","resolution":{"observed_at":"2026-08-01T15:07:44.131604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.242509Z","title":"Stability constrained reinforcement learning for decentralized real-time voltage control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.242509Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:0426032f9538cf5a0d9e46104bf55e60934b4a1cee1bc8c7dbeb3749af511b95","observation_id":"4d0640fd-9165-401e-a914-f4e93c376b17","resolution":{"observed_at":"2026-08-01T15:07:44.242509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.336581Z","title":"Scalable reinforcement learning of localized policies for multi-agent networked systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.336581Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:2a49a08eeecae5bb8039bdea539dd700b2ad068d0fb6bfb5bc966f9aba6aebf7","observation_id":"98d8d835-e27f-40d5-9f1e-f373ce4ec53b","resolution":{"observed_at":"2026-08-01T15:07:44.336581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.428470Z","title":"Scalable reinforcement learning for multiagent networked sys- tems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.428470Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:5ddc3d7b906573b35b2ae86592753d05f2f6191c183f3052fd076d83e6823090","observation_id":"39abe093-75f4-43d7-bcd1-2ed504277f55","resolution":{"observed_at":"2026-08-01T15:07:44.428470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.504402Z","title":"Multi-agent reinforcement learning in stochastic networked systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.504402Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:22be2dec0c077a7db7c13327be5cfe6c79ffe7a49e20affb2bb47f212ae40633","observation_id":"9b0bebf4-cc51-4cac-8dcc-91045062ae00","resolution":{"observed_at":"2026-08-01T15:07:44.504402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.587308Z","title":"Global convergence of localized policy iteration in networked multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.587308Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:116bf54c09032ef9eaa131de356b3d4e2fc33d40d647d16c6205a5489d4db411","observation_id":"26d11f3e-74f4-45f7-b721-4fbdb9af915f","resolution":{"observed_at":"2026-08-01T15:07:44.587308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.672839Z","title":"Fully decentralized multi-agent reinforcement learning with networked agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.672839Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:300acbbe2589475a55a05c67918785a8c8947aeb4e4307077765baf41c2b0965","observation_id":"a5fd7b01-b3ea-470a-983e-9fb19504aaac","resolution":{"observed_at":"2026-08-01T15:07:44.672839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.749424Z","title":"Finite-time analysis of dis- tributed td (0) with linear function approximation on multi-agent rein- forcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.749424Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:080ca66d1aa8540089ec4f9212da0169140440ed22a61643468f8dada4dbe082","observation_id":"380f43a1-8d15-4e7e-a29a-f779e003e649","resolution":{"observed_at":"2026-08-01T15:07:44.749424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.816692Z","title":"Decentralized online convex optimization in networked systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.816692Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b87b99494218449f6c0484956a3063a39172dcaf48241a549dc4435f4d3217e3","observation_id":"80fce664-357f-49ca-ac5e-0e9859a7e637","resolution":{"observed_at":"2026-08-01T15:07:44.816692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01339","last_updated":"2020-04-24T01:54:46Z","snapshot_observed_at":"2026-07-06T09:09:35.655226Z","submitted_at":"2020-04-03T02:21:07Z","title":"Multi-agent Reinforcement Learning for Networked System Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01339","snapshot_observed_at":"2026-08-01T15:07:44.900715Z","title":"Multi-agent reinforcement learning for networked system control,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.900715Z"},"links":{"cited_paper":"/paper/2004.01339","citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:19876aded5199165cf8970b82e336618fa9ca37d21157e35532795fdce7f1499","observation_id":"ff360be4-3fe0-43b1-a6e6-7082e426bde6","resolution":{"observed_at":"2026-08-01T15:07:44.900715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:44.968846Z","title":"Random features for large-scale kernel machines,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:44.968846Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:9d2c8743ab75df91a00fe5942ff0f83c621347034a463b1d41a5ba9ba54dd51d","observation_id":"ff10ef29-0db5-445e-b3dd-d0e651b15034","resolution":{"observed_at":"2026-08-01T15:07:44.968846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.043151Z","title":"Random features for ker- nel approximation: A survey on algorithms, theory, and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.043151Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:060ec5d384b1ad076c385bd057f6fdf73315e8ad26cc7dd5d6d68445c78e24bd","observation_id":"45b6321f-8983-43f4-8e68-0aa60bec6e0b","resolution":{"observed_at":"2026-08-01T15:07:45.043151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17221","last_updated":"2024-11-18T15:21:40Z","snapshot_observed_at":"2026-07-06T19:38:00.663759Z","submitted_at":"2024-10-22T17:45:45Z","title":"Scalable spectral representations for multi-agent reinforcement learning in network MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17221","snapshot_observed_at":"2026-08-01T15:07:45.122994Z","title":"Scalable spectral representations for multi-agent reinforcement learning in network mdps,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.122994Z"},"links":{"cited_paper":"/paper/2410.17221","citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:882b31e2a289b71c5cd1f3cfac38b3b9e6c7309cc439a73b4103723cdb28be60","observation_id":"0758319c-58e1-4bb2-ae17-8568332d969e","resolution":{"observed_at":"2026-08-01T15:07:45.122994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.209477Z","title":"Linear least-squares algorithms for temporal difference learning,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.209477Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b80e073ed4aeabe43d150672e2e3e11642b77f43aca751b4c0f183350c77cfa1","observation_id":"af3c1833-2880-4063-92fd-cfa01126defc","resolution":{"observed_at":"2026-08-01T15:07:45.209477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.298257Z","title":"Technical update: Least-squares temporal difference learning,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.298257Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:8a55da6c81abb0c927142b43b7d15b02ddce240cf16208caf1bfd10f6764691d","observation_id":"820e9772-ffdf-4788-abfe-c477b2a7d58c","resolution":{"observed_at":"2026-08-01T15:07:45.298257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.391730Z","title":"Finite-sample analysis of least-squares policy iteration,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.391730Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:7acfbda634a6ac168b12f4a15a2a1d63c390cd128c6b282cd8998fe15c57827a","observation_id":"9c84af58-9a4d-4e35-8308-b8ae758afa4d","resolution":{"observed_at":"2026-08-01T15:07:45.391730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.455637Z","title":"A finite time analysis of temporal difference learning with linear function approximation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.455637Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:96a4847e9e8d92a0bd77897ffb798372a8913c523bf53c1bf6fab176e2d74cc6","observation_id":"bf0b56bf-d20b-4ebe-8711-5e4887d30db3","resolution":{"observed_at":"2026-08-01T15:07:45.455637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.493186Z","title":"An introduction to matrix concentration inequalities,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.493186Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:50127ad3f3cabed4033ba1f34c4907bde1391417c5566753f75c3005e95f68a5","observation_id":"fc623c16-c7c9-42c7-b88d-12c72fc7b6bf","resolution":{"observed_at":"2026-08-01T15:07:45.493186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.534618Z","title":"Vershynin,High-dimensional probability: An introduction with ap- plications in data science","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.534618Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:6115b481b0a8be30b6048103ec8f497d202c99cd2a7d933a58a618b140ba7154","observation_id":"8a738021-d68d-4b74-aa2f-2c70b18a138e","resolution":{"observed_at":"2026-08-01T15:07:45.534618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.609186Z","title":"Optimum bounds for the distributions of martingales in banach spaces,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.609186Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:2ee65b9037dc19ca8c8295cbd0d6b4ab925ba82d77c3dc8b6f504bb872f41ff4","observation_id":"9912ec25-11ff-43f0-b13c-6c977f9c24e1","resolution":{"observed_at":"2026-08-01T15:07:45.609186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.625579Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.625579Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:4dbd63ae46d64cf33c374b7ff76865004d968b32f283be9e568dc7e91c4ee1ac","observation_id":"02ba7837-d616-490e-971e-35b18668207b","resolution":{"observed_at":"2026-08-01T15:07:45.625579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.629412Z","title":"Policy gradi- ent methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.629412Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:14f6aba4633aef21156414ade71e034038807f720ff125964c626f5419e22605","observation_id":"7dd116c8-5efc-4694-ad44-d110294d6535","resolution":{"observed_at":"2026-08-01T15:07:45.629412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.633092Z","title":"Lower bounds for non-convex stochastic optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.633092Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:00a404f5b8a0b1e5695d2b37acdb5b0e79c38af2ab1dd4d79c96f630d1269f6c","observation_id":"f6d9d64c-2c40-4010-a9b0-ec8248b72543","resolution":{"observed_at":"2026-08-01T15:07:45.633092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.636986Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.636986Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:676a81fec2fd8b1f2a64f5595293fdfb5b420e2ce0b4b9bc40407c6146302211","observation_id":"fdf0f9db-840d-4561-9b15-0bcb01c2a9bd","resolution":{"observed_at":"2026-08-01T15:07:45.636986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.640729Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environ- ments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.640729Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:13143cc9dc74ae608331a4b7ca20ba19c5775d5716ccf510d6286ad9744c5174","observation_id":"17da105f-f405-4446-bce6-e922b25e8719","resolution":{"observed_at":"2026-08-01T15:07:45.640729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.644189Z","title":"Counterfactual multi-agent policy gradients,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.644189Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:df12649e431b9f980dbb92006a2e97249b5f06b6e0548e41d0645f9e6aea3b9b","observation_id":"1ac1c5a9-6649-41a3-8111-6a498f25c506","resolution":{"observed_at":"2026-08-01T15:07:45.644189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.647674Z","title":"Actor-attention-critic for multi-agent reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.647674Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:a1d72b05b4c8646d49ed7e6c13897f3e2964c35d06387c431dac09b38320a03a","observation_id":"473a9151-3d76-4f46-a4b3-2dbc7785c245","resolution":{"observed_at":"2026-08-01T15:07:45.647674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.651434Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.651434Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:12be7bb1dafb4e0c5516ca86f346b1f599f2075381a0014bcfaea6065b65efeb","observation_id":"b786be04-134f-4043-9584-1e38448ba09a","resolution":{"observed_at":"2026-08-01T15:07:45.651434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.654811Z","title":"Near-optimal distributed linear-quadratic regulator for networked systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.654811Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:9938ccfe8f4995db84200f80402cb7829e93866db8b130065a9d7986942a81d8","observation_id":"a368e43b-aa00-4bd3-bb82-6b0019cdf913","resolution":{"observed_at":"2026-08-01T15:07:45.654811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.658193Z","title":"Network reconfiguration in distribution systems for loss reduction and load balancing,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.658193Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:e59d0ecb306c50a1e42d9f46e929600d3eb60700b96d96aed9c882e3e279526f","observation_id":"11be9423-6ad9-4224-baf8-250cb9548d5b","resolution":{"observed_at":"2026-08-01T15:07:45.658193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.661726Z","title":"The description of a random field by means of conditional probabilities and conditions of its regularity,","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.661726Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:33928db5262dded96595fdb3aa520ffbe84a149fbccf559784c021b20f8f1211","observation_id":"67f10cbf-2aa6-477b-9827-8c23e0c86bdc","resolution":{"observed_at":"2026-08-01T15:07:45.661726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.665084Z","title":"Can local particle filters beat the curse of dimensionality?","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.665084Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:5aaa0d9f005c4eee2144ce5d13b675bad84befa1a83bfda07e615e8a41de9253","observation_id":"cb46e0a5-6875-44b3-ba4b-4267b90c209c","resolution":{"observed_at":"2026-08-01T15:07:45.665084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.668392Z","title":"Mini-batch stochastic approx- imation methods for nonconvex stochastic composite optimization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.668392Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:b95b5382836e5107cd51407154d30ce39f186e56bfccc7d8a35509bf8f35cd68","observation_id":"dde6708c-d21c-42d2-afc5-192f05407b19","resolution":{"observed_at":"2026-08-01T15:07:45.668392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:07:45.671697Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T15:07:45.671697Z"},"links":{"citing_paper":"/paper/2607.18554"},"observation_digest":"sha256:ca4bd8e247d30e1b8554c218d95aa998cc0e4becff88d51eb84ff5792e3dfbcd","observation_id":"e0bcf005-760d-4027-9f54-2ae8649d016b","resolution":{"observed_at":"2026-08-01T15:07:45.671697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18554","last_updated":"2026-07-20T22:41:43Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-06T15:08:39.275876Z","submitted_at":"2026-07-20T22:41:43Z","title":"Scalable Policy Optimization for Networked Multi-Agent Reinforcement Learning with Continuous State-Action Spaces"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.18554."}