{"as_of":"2026-08-10T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f864a81fd3b6bd5f5ea51634940acd6985bb1221f50b478c11e70405ad3eb21","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:26.316448Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:44:53.211503Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:36:25.635046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.01261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01261","snapshot_observed_at":"2026-07-02T01:36:25.635046Z","title":"Xie and S","venue":null,"work_id":"c1f924e3-6530-4ee1-8a49-abe540fb26b7","year":2025},"citing_paper":{"arxiv_id":"2605.14423","last_updated":"2026-05-14T06:10:31Z","snapshot_observed_at":"2026-08-08T12:13:09.667976Z","submitted_at":"2026-05-14T06:10:31Z","title":"Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T02:07:23.862809Z"},"links":{"cited_paper":"/paper/2506.01261","citing_paper":"/paper/2605.14423"},"observation_digest":"sha256:afa8b593db2c99651e48614f81cc7360af6a490cfa190e520ed6d052c6848e77","observation_id":"b32d63e9-5e95-4638-a392-534a5ecc3069","resolution":{"observed_at":"2026-05-15T02:08:29.340835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.01261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01261","snapshot_observed_at":"2026-07-02T01:36:25.635046Z","title":"Xie and S","venue":null,"work_id":"c1f924e3-6530-4ee1-8a49-abe540fb26b7","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2506.01261","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:78d6f949f2543568ae35c1e3b9a5ef9aed8d537d542b00d7025b57ab3e77f6ae","observation_id":"1377c879-6903-497f-b020-dba0efa9ead2","resolution":{"observed_at":"2026-07-02T01:36:25.637603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01261/citation-record","integrity":"/paper/2506.01261/integrity","json":"/paper/2506.01261/citation-record.json","paper":"/paper/2506.01261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.988023Z","title":"Fitted q-iteration in continuous action-space mdps","venue":null,"work_id":"6d282922-655d-4a98-9fb7-0a67cb153705","year":2007},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.122203Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e53777b00ad2dd85a9278be36d78507d32947b449e2e1715868b144a57ab3c91","observation_id":"f866580d-3a6a-4ac7-b845-022d9dddbfc3","resolution":{"observed_at":"2026-08-07T11:54:32.085703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:23.284017Z","title":"S., and Guin, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.284017Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:034c51779dd8c1ad2f241407de622497059b092eb8789726ee551ce0175160a7","observation_id":"7ad5d9ca-845d-4ea8-8c06-04e49da4417b","resolution":{"observed_at":"2026-08-07T11:54:23.284017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T11:54:23.368455Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.368455Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:557674752524375e79e99a1760bbb40cfdba451de3a87af8e1b07b7704c3169d","observation_id":"c672ef05-d8e8-4300-b67b-2cfaae3b0fc8","resolution":{"observed_at":"2026-08-07T11:54:23.368455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.798000Z","title":"D., and Wang, Z","venue":null,"work_id":"c8299a18-4b03-4f80-af96-7c2e554e6c0f","year":2019},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.514345Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:8f87b4d7fa2a82bdc34559f9f49e94d91f6bb088504c254bec4e3f9689f70246","observation_id":"c7cacfe5-bcd0-4e18-b0f7-f160f1699d2f","resolution":{"observed_at":"2026-08-07T11:54:31.888111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.528949Z","title":"W., Hilton, J., Klimov, O., and Schulman, J","venue":null,"work_id":"7d1cb47b-b9ba-4992-8c21-dfa033ca0717","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.606041Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:0ee0e6bacb658cd18e7cf1443cfde9c0feead5703a769b10e0c1af5ae0af4427","observation_id":"c8deb5e1-1c7a-4d43-b690-9ae93ad6d974","resolution":{"observed_at":"2026-08-07T11:54:31.641212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.358189Z","title":"Linear off-policy actor-critic","venue":null,"work_id":"fe8d169b-d094-4f40-afa7-e68ace18364c","year":2012},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.695877Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:2b4c035d3e27654c192c8b011a1cf839189ff803b82e2a601a502c991360131b","observation_id":"300c19b8-a938-4320-b4dd-c41e32cb8cff","resolution":{"observed_at":"2026-08-07T11:54:31.431771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.142074Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":"3e4e6c35-0eff-49a5-aa7d-dc10556a3073","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.790666Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:c5dedc416b859a0c849b08250079f12311294c629fa2d770df0d6a898e9f05f8","observation_id":"c0ff3ad0-e46a-4700-a7cc-47aed292b5ad","resolution":{"observed_at":"2026-08-07T11:54:31.246319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.926063Z","title":null,"venue":null,"work_id":"f8047f96-846b-4de5-a299-90cd599f0e46","year":2021},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.873294Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:cd347717302abf832be858b64653d351edaed381cba6137c0428e64d12cdf292","observation_id":"3a257f89-2ad1-41ae-9a14-5468bd6c9ba5","resolution":{"observed_at":"2026-08-07T11:54:31.047177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.787355Z","title":"Error propagation for approximate policy and value iteration","venue":null,"work_id":"5daae06a-e29a-4904-a612-f316798f70a4","year":2010},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.956416Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:29b5776b33d796dbaf6733126ae0223467bb7d45ec5479aa7070aef0bf57fa0a","observation_id":"2e2979de-4976-4bf6-87ac-ef722abf575a","resolution":{"observed_at":"2026-08-07T11:54:30.864069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.588820Z","title":"Reinforcement learning with deep energy- based policies","venue":null,"work_id":"21ca7958-9778-4426-a0c2-0501f59db4c2","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.009912Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:8deab9560202e2c3ec3ce92571237c49431cda84d743b89c309b1c2c5d9f0579","observation_id":"8dbfb1cd-09cf-482d-acd3-d80dfdbb919e","resolution":{"observed_at":"2026-08-07T11:54:30.668546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.350006Z","title":"Federated reinforcement learning with environment heterogeneity","venue":null,"work_id":"2a53391e-0be0-4a89-9abe-1a4d66025c09","year":2022},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.059749Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:51b2a91d9ac4e1c2cf5c2f0d1fc664a6de73bb7a9f161272649d674e2e9e8444","observation_id":"358e5bf4-13f5-43e1-9ef0-c75e466949be","resolution":{"observed_at":"2026-08-07T11:54:30.469003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.137312Z","title":"P., Kale, S., Mohri, M., Reddi, S., Stich, S., and Suresh, A","venue":null,"work_id":"01882cf8-6ceb-4487-83c5-6a6cb4ee1c17","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.138911Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:11f4f708d278d03855240b9a84bc92ac00f26d8760822ac5385331f406861fe5","observation_id":"12327596-a491-4a38-8cb4-3196ee54b005","resolution":{"observed_at":"2026-08-07T11:54:30.225430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.904731Z","title":"and Tsitsiklis, J","venue":null,"work_id":"c92d52d0-9600-43bf-9e1e-7e584e6511a3","year":1999},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.191908Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:cf45df55460e2242a34d2d2cafefef555ca2072311e33d80fb41fda3e79f6b03","observation_id":"66c651a9-28fd-4962-84c3-d6b1b7bb6311","resolution":{"observed_at":"2026-08-07T11:54:30.016740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.700222Z","title":"K., Zaheer, M., Sanjabi, M., Talwalkar, A., and Smith, V","venue":null,"work_id":"bcccc78d-c9c6-41b2-ad52-d8de68e5b54f","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.283564Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:f0d69e8f092c1ecfcda3f8196d1dbba8af39c3ca8f6057cefd29d03ee0a42251","observation_id":"ba962be4-b9d1-4ccc-86b7-75adc426ddac","resolution":{"observed_at":"2026-08-07T11:54:29.781855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.455161Z","title":"On the convergence of fedavg on non-iid data","venue":null,"work_id":"2412574e-c49e-4014-9739-0737c26de80b","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.398859Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:01ec7f5f8185bc36307b5f048bb8bf719f6ed291e3b5d24783bdcd0d07021245","observation_id":"a6420aa0-3851-418a-b662-b8c9ab552015","resolution":{"observed_at":"2026-08-07T11:54:29.555582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.263622Z","title":"Neural trust region/proximal policy optimization attains globally optimal policy","venue":null,"work_id":"d0c3680f-b364-4e87-a31f-7bc353ce0c00","year":2019},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.532711Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:9f025efddaddb5472a195bf2ca3e8b22552a304b770e2ccbb43169f537c564a5","observation_id":"34a3dda1-b350-45d5-bab2-6d89dd56ba48","resolution":{"observed_at":"2026-08-07T11:54:29.346041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.069468Z","title":null,"venue":null,"work_id":"62df2139-9821-4a69-96cf-1b3d7e3cbdd1","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.593013Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:4ed93922a1318d21fc2e81c71145299093b204e5a7f6263f682efb67522a7494","observation_id":"65f24c31-4e0e-473a-ab9e-ebeb3b62479b","resolution":{"observed_at":"2026-08-07T11:54:29.152442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.868544Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"7d7e6474-671d-40e4-968f-2bc3ad01babb","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.703231Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:84dbc59f4f958bcdbdc9ba56cbdea06a256acd95b784389a2b9275e837badf5e","observation_id":"709cd9a4-1602-451f-85c3-1e542b3155fc","resolution":{"observed_at":"2026-08-07T11:54:28.968600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.683114Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"e17a8c62-4780-426b-a950-a225f628311e","year":2015},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.807776Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:937d94feadceb549d84309384ae5d98d9c36112c8716d65994275f814be20462","observation_id":"b5d387ed-4cd7-43e2-8d98-86763ca50cc6","resolution":{"observed_at":"2026-08-07T11:54:28.764589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.510626Z","title":"and Szepesvári, C","venue":null,"work_id":"2df6d313-87e2-4501-b40e-cf25709c761e","year":2008},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.918651Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e07f88e89a65bdd719e70daa44ac344fc87f7c2f9d4a6dad1a6a9e7c860396a6","observation_id":"29a9c553-d78e-438d-bf62-611abe8ae074","resolution":{"observed_at":"2026-08-07T11:54:28.584788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.306825Z","title":"Planet dump retrieved from https://planet.osm.org","venue":null,"work_id":"df5c1e14-5346-4d25-a656-3b220c03b6b6","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.028428Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:8db0f4370337faa6a03cae910e735bc935fd9871ed1feb3d027642405fc86c05","observation_id":"9718f0b3-1123-4839-9bce-329c0def2396","resolution":{"observed_at":"2026-08-07T11:54:28.421351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T11:54:25.098661Z","title":"I., and Abbeel, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.098661Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:89eb492b5ecd22fc787cf9dd65f7eccc596c8a3ee2e4143abe2a0064cfe37713","observation_id":"12f480a1-5c6c-4313-b891-fa47167bf3b7","resolution":{"observed_at":"2026-08-07T11:54:25.098661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:54:25.165690Z","title":"Proximal policy optimiza- tion algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.165690Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:b0ccdaddf5d045349839677049bb6b9707c166e737a3feb5812f2ca76b5e0a2c","observation_id":"9292f581-f4b7-4a79-858f-3cf4e5080240","resolution":{"observed_at":"2026-08-07T11:54:25.165690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.098582Z","title":null,"venue":null,"work_id":"0823f82a-a138-41ba-9afc-81069569de5b","year":1988},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.271960Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:4756b6da3f1a1261c8f2bf063af729ac95813d51082fee7e1c5ef606c4477738","observation_id":"12536ad8-a079-4510-876b-58edb0fc1fb0","resolution":{"observed_at":"2026-08-07T11:54:28.208016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.893541Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"9c7a3e5b-3ca4-4ef2-af43-595858041190","year":2000},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.369311Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:117ee0c5f055aebe6351c8cfd965eb7d1cf1b285aa04f88792d64f1b04bf6195","observation_id":"54b8813e-da05-4c67-8138-8a79fcc5c049","resolution":{"observed_at":"2026-08-07T11:54:27.978909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.697497Z","title":"Boosted fitted q-iteration","venue":null,"work_id":"e94f7587-cf76-42fb-bf58-9a49cf0991d0","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.449432Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:c99291e3e1c0eab94a9141ab0c7f40fd4250289d44b7e30a1d266a06e25cbe54","observation_id":"fd1f72d0-98e4-4f32-9d04-6696078872f9","resolution":{"observed_at":"2026-08-07T11:54:27.778136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:25.514852Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.514852Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:fc4208bc096119fcd30471f0602e84c6cdd35cc4b6e686405f7cf778ff401f7b","observation_id":"5eb2fc9f-e882-4ecd-927b-9ba6abec0656","resolution":{"observed_at":"2026-08-07T11:54:25.514852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.29941","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:26.900813Z","title":"E., Srivastava, S., Tuia, D., and Falcão, A","venue":null,"work_id":"ecfd7eb0-15fb-4d35-9106-a0bbcbee50c2","year":2021},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.614183Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:41c9e4e1133a431bb53cb6421f3e8eef564fae48bb0a736d1573499f79d57fd1","observation_id":"014e2b7f-8963-441d-95b9-07541ce6162d","resolution":{"observed_at":"2026-08-07T11:54:26.944638Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.501269Z","title":"L., Kheterpal, N., Jang, K., Wu, C., Wu, F., Liaw, R., Liang, E., and Bayen, A","venue":null,"work_id":"02c93652-ee7b-4ea7-a4e0-e7ca7f6bfe31","year":2018},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.722659Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:5a80483986abd7edb945d87ba3282d9d0ae4da3c244f3528a8b989a56c58d250","observation_id":"27b574ad-db67-4b56-b86b-4083bd2da289","resolution":{"observed_at":"2026-08-07T11:54:27.583825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-04T13:08:13.681112Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-07T11:54:25.833975Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.833975Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e564f588e761d90aa13a29d95bbd680df972da0527578a9a16d0e77294264f5d","observation_id":"935a9aa8-71f1-4b99-8138-d8b4689fdcc5","resolution":{"observed_at":"2026-08-07T11:54:25.833975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.299297Z","title":"P., and Kakade, S","venue":null,"work_id":"eec04142-1d1f-4910-93c6-7ceb74a7122a","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.909375Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e90e10271fcd75fe3f0be8dcf9841ffa56ee576d6fc20fc4d407e21d1d4935a4","observation_id":"98bad912-d5dd-449b-b01d-99871ff1812b","resolution":{"observed_at":"2026-08-07T11:54:27.391913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32427","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:26.590322Z","title":"and Song, S","venue":null,"work_id":"7be50169-5ca4-4902-8b34-7a74e2fd2f90","year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.039203Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:0d17588d220e9c44f2f5a1519973ae9f21c6f401675dd1a1d0e9ebb86ae0b8f9","observation_id":"39660861-fed3-4826-b7ea-26838d4e7be3","resolution":{"observed_at":"2026-08-07T11:54:26.697142Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06210","last_updated":"2019-03-04T18:32:17Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-15T00:32:09Z","title":"A General Approach to Adding Differential Privacy to Iterative Training Procedures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06210","snapshot_observed_at":"2026-08-07T11:54:26.115849Z","title":"and Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.115849Z"},"links":{"cited_paper":"/paper/1812.06210","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:2efc77093180c6ab2b1feebb0a0c31c6fa976d19cf5c7bb6018c7f9489b88e95","observation_id":"8b3badc4-4a1d-4f43-83be-6a93508fab2d","resolution":{"observed_at":"2026-08-07T11:54:26.115849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.115384Z","title":"Federated natural policy gradient and actor critic methods for multi-task reinforcement learning","venue":null,"work_id":"76962b10-778b-411d-8ca3-67470028e41c","year":2024},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.220188Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:ebcbd9beb4b71a3963cd5acfa8d7b90643d8b91d18f2669fc1116e29e6b359b1","observation_id":"852b693b-da84-4ba9-8f6e-ee8146aed99f","resolution":{"observed_at":"2026-08-07T11:54:27.168863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00582","last_updated":"2022-07-21T12:33:15Z","snapshot_observed_at":"2026-07-06T06:42:35.645776Z","submitted_at":"2018-06-02T04:45:58Z","title":"Federated Learning with Non-IID Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00582","snapshot_observed_at":"2026-08-07T11:54:26.316448Z","title":"Qwt i (s, a) − ρπ∗,i(s) Zπ∗ (s) Qπθt i (s, a) 2# . By the fact that (a + b)2 ≤ 2a2 + 2b2 and ab − cd = a(b − d) + d(a − c), we have Es∼ρπθt ,n,a∼πθt","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.316448Z"},"links":{"cited_paper":"/paper/1806.00582","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:f5e8b79c190d1d2be23b4030ba471dfc14e4c997c5aec2b749df6f141c07f4b7","observation_id":"722dd00c-e413-424a-b058-98232ef9a157","resolution":{"observed_at":"2026-08-07T11:54:26.316448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T07:10:03.281432Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2506.01261."}