{"as_of":"2026-08-05T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:828fd42186d0e1c29e63e779cecf8adbda4abc9e7208a2891635f9c979a50179","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:44:53.211503Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03094/citation-record","integrity":"/paper/2606.03094/integrity","json":"/paper/2606.03094/citation-record.json","paper":"/paper/2606.03094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:b4bf5ea82eaf09ae72c7ccf9f947fdee997a90ed5f427f1eb46828b4484bf0c7","observation_id":"0fc8a006-bb48-4b0d-b3ea-f57ac166742d","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:7341651058019c640163e56402d8ca07285b49c25c857b8c461738f29d62aa79","observation_id":"e89c9149-0451-4116-980e-a3433ca75164","resolution":{"observed_at":"2026-07-02T01:36:25.604790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:3ac3a3a2a695aeec89cbe946ac02d588b7db4e43af97298e17f1b54921098ed6","observation_id":"a779786c-2f63-4f26-b1d5-a989133ebe6f","resolution":{"observed_at":"2026-07-02T01:36:25.601956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"R1-V: Reinforcing Super Gen- eralization Ability in Vision-Language Models with Less Than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:d08e7bed82cec759becd369f396e7bd51dee28edee9b84c226762271122ac595","observation_id":"a0d50fa7-dac5-4f28-a173-baba1f3522f8","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-07-31T14:59:07.628754Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:0818ead7430634d4d9d4001f58358ec4cf82a3a54eba25405715025e3c9e2d44","observation_id":"7416aa03-8007-4fb4-a17f-6c2dc8e53bbf","resolution":{"observed_at":"2026-07-02T01:36:25.608391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Open-R1-Multimodal: A Fork to Add Multimodal Model Training to Open-R1.https://github.com/EvolvingLMMs-Lab/open-r1-multimodal, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:23b03a771aa606c41f44adaf7b1178171a54586cfaedbff2d1f20aecf9ddf985","observation_id":"0d726caa-0f21-4f58-8b51-9130d531a41e","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:b42507a91534c6e6edbc8ba0c405619fa29decda563fbc227bdeae0735d7ebbd","observation_id":"5974101c-81ec-45ae-a144-ed5b981e3d63","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"FedRLHF: A Convergence-Guaranteed Federated Framework for Privacy-Preserving and Per- sonalized RLHF","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:b749de4380038d774da0cff28a41225b1430b79dcc908323c3e896525d811eeb","observation_id":"b3b2f1de-f8c2-46c7-b9fa-75e52e5f87f9","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Provably Robust Federated Rein- forcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:011307775dfaa03e18df7737a503b6588efd0674679986a00edfaf675e1bbb57","observation_id":"ee0e91a9-93e9-4529-b3ff-e6513d3cf512","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:679afbb4776809bb0310bd3b9a53c920a39d5b96038f80ca5da33d169c4bf2ab","observation_id":"1b05db06-156e-437d-aa56-7bbeee9a4236","resolution":{"observed_at":"2026-07-02T01:36:25.644592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"DeepSeek-R1 Incentivizes Reasoning in LLMs through Reinforcement Learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:b96df53453e8e50c72893c9b93ba1ab3fd4db9a8992a0c6b9b60b82141b12ec0","observation_id":"de057067-a543-4ac3-8bdd-c36a497989a6","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:dc86824230424e7c3d77022efc7531ebb4525ed05db856ccfbbf58d1d824ed76","observation_id":"cdca963c-f562-4e70-993e-4c9dbe1bb52d","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:d9135302bafdcb58e7a5ec1721a74922c5cb93a52e964e2901824e6918d2e32f","observation_id":"613ce512-b219-45a1-998f-5b473b38679a","resolution":{"observed_at":"2026-07-02T01:36:25.630277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"FedHPD: Heterogeneous Federated Reinforcement Learning via Policy Distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:52dd27ca6818f45c96ddb4ed03b669f80ceba55f70964ff08508db0d5ec52740","observation_id":"0402d5f8-b096-492c-8b93-57f19fff116a","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Reinforcement Learning with Environment Heterogeneity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:4da1ea362dd602f3d12ae6226747db5ce9323024c58f416a171fba519646b0f5","observation_id":"ca2cf0b4-ad49-4277-bbdb-dd7015fb87f5","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Decentralized Federated Policy Gradient with Byzantine Fault-Tolerance and Provably Fast Convergence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:f908a551c2d158ca49a5e0da225b331aa7c274223a6223c67c6813b0e4d56a43","observation_id":"401a60ea-5ab6-49c7-af02-d62849219d02","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Reddi, Sebastian U","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:9d3611360e31e628a7fb6b2ae1b35645945a61b3e6264a078eeb85d3885cd370","observation_id":"c316229a-e24f-42fd-afed-482d1d08da9a","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Reinforce- ment Learning: Linear Speedup Under Markovian Sampling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:b0b105c63530a80a11ba4f7a62dc8504c02f5dc7e0650a6955ae18c50b8f7843","observation_id":"44ca493a-0f6f-429d-af78-420305798e2c","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Konda and John N","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:cdc961838337b247e18c6f133bb2a0f6a1e5f3d747fa436913cfc3c3564cea84","observation_id":"82bf0832-ef63-443e-8c11-01985362c274","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Asynchronous Federated Reinforcement Learning with Policy Gradient Updates: Algorithm Design and Convergence Analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:961b1d9ae37fe09c5c8f94cc25bfdbac166df786434fee45ed26968a3f3af9d4","observation_id":"3ce7a08f-8bd1-4439-85be-5d2d287d9f99","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Optimization in Heterogeneous Networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:af733bc534112ad865b7c9d7552b36ee76045e7d79a276f633fefba435d5a2a5","observation_id":"8cf678f8-6f16-4867-9e46-297fe616b151","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.22342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:07:17.963064Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342","venue":null,"work_id":"68750301-56f9-48c6-8d7f-714cfae22bb4","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:82883b1e23e82972ddaab8ffa8ecd0a2e94249051855c95b61795e47e19c96dd","observation_id":"2ca3e619-eea7-4b4e-a3e0-028441013a65","resolution":{"observed_at":"2026-07-02T01:36:25.627126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Communication-Efficient Learning of Deep Networks from Decentralized Data","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:4dcd1c1c9d020ecd49f68374288b959591d7c9d93b1f3b0d105ce7fd73153488","observation_id":"bcbd946c-3474-4863-9e84-688380b64805","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.02833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:36:25.638921Z","title":"arXiv preprint arXiv:2508.02833 , year=","venue":null,"work_id":"3273d088-9210-421b-85eb-74e5c46e29e7","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:1bee99ea394bfeaab56f88198af554c086471575bc3152338e6e54f43035abd4","observation_id":"b3fd9138-3dd4-43e3-8f17-f61d06bd8139","resolution":{"observed_at":"2026-07-02T01:36:25.640889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Reddi, Zachary Charles, Manzil Zaheer, Zachary Garrett, Keith Rush, Jakub Koneˇcný, Sanjiv Kumar, and Hugh Brendan McMahan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:6a85a88a3c129c58377ff5bfb073b122afbece9c29d87e2c88ecb0af7f8547e2","observation_id":"b9851825-ceeb-4f5f-8c5d-7d1ac1b4c0ca","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Ensemble-Directed Offline Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:ef75c02f238ccdd1e11a62bb15c1f7e2da1e95660e9cf5b4e2e2b0b57a0811cd","observation_id":"9616074f-fa5a-4ffa-a361-14939d56222a","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:193b6feadc9183cf4191f5f37c2deb0d7b7e0fe77dd760237d5375121e36599f","observation_id":"931c6ec8-8f3b-4f51-9162-7e28cfb80ed3","resolution":{"observed_at":"2026-07-02T01:36:25.617700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:8ac9157298abe578c20a36dd8b2a49aae06dcf72d8ca7775da9f119d8288d2e5","observation_id":"189e0812-88db-4cda-adf6-e3750250d072","resolution":{"observed_at":"2026-07-02T01:36:25.623448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Momentum for the Win: Collaborative Federated Reinforcement Learning across Heterogeneous Environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:40dd42d0c51143835f10815d9c1a56744b0006551a902e03b87e4b4ed09a7827","observation_id":"895a0291-6346-404b-9ddf-b27ce5ec45cc","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"The Blessing of Heterogeneity in Federated Q-Learning: Linear Speedup and Beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:aa6a7fb96489ae0b2c6a4ec5fe852c50e231b9a17db1df2510206cee0defe0e4","observation_id":"6cc4499f-e160-4191-b3a6-063c61465d71","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:e71c85448e6b2387259fe877bfb38beb94d3f0d7e7bf2cfb540fbb324c919f3b","observation_id":"2473d4ac-4869-423a-893c-51a8a9695d1d","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-07-06T21:34:43.519872Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.01261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01261","snapshot_observed_at":"2026-07-02T01:36:25.635046Z","title":"Xie and S","venue":null,"work_id":"c1f924e3-6530-4ee1-8a49-abe540fb26b7","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2506.01261","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:a43b8b5970969136b82c976bce87ab884f47d57221b504d28123a97c04207ab1","observation_id":"1377c879-6903-497f-b020-dba0efa9ead2","resolution":{"observed_at":"2026-07-02T01:36:25.637603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"On the Linear Speedup of Person- alized Federated Reinforcement Learning with Shared Representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:f998ac84c8d598e5ba884c297835e3086b18e49a67a9c22bf084618b51f0d689","observation_id":"4a966b9b-9663-4304-8db4-c2506a92a7c0","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:f8f67419546f49a637308fa59e0963e94a370b641ac8074ef745b53250facb7c","observation_id":"2b672abb-9b7b-49e9-9ccf-eaac0810f9d7","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"On Classes of Summable Functions and Their Fourier Series.Proc","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:fa9b16e82ff87432b1c450bd772740449753f6ef01d0efd36a6c794a7a33e0c4","observation_id":"2075e713-5ec0-4798-a7ec-baea2701e6bb","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:d7ae931f6e689be662c9e46530776522d49f096afa746b55446577cc36d117e0","observation_id":"6227c12d-1497-40c1-9404-c6d1676e7e24","resolution":{"observed_at":"2026-07-02T01:36:25.620697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Finite-Time Analysis of On- Policy Heterogeneous Federated Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:e9945e9a1e8421663d331dbe03dd21ae4300e1826b0f756d809f7ead878afd73","observation_id":"c3def03c-36a7-4de1-85bd-9f66f43636c5","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:36:25.609734Z","title":"and Zuo, C","venue":null,"work_id":"6a78d888-f8e3-40a2-a776-9656f16a07fe","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:d7a9467a890626ccac46a7ac255a77585882c6a5c2f4960ebcd4f797135f5e70","observation_id":"163796d0-0c2b-42ce-ad3d-b44af6b9d091","resolution":{"observed_at":"2026-07-02T01:36:25.611991Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2509.08827","doi":"10.48550/arxiv.2509.08827","metadata_source":"pith","pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"7618c14b-e527-4268-9926-d4f462ea9925","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:f80a8b35fef260856f2f1aa03c6780b59caf430d3204d93535c19a0abde3ab34","observation_id":"e6979688-09c7-4088-a6f5-3712c954d57f","resolution":{"observed_at":"2026-07-02T01:36:25.614991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:6b39793bab7ebaa6be8fec1f454f2f4623f6a6b229fdde2c0ec729dcf6f6f164","observation_id":"fec8d277-6c01-42bb-b628-d45fa8947f96","resolution":{"observed_at":"2026-07-02T01:36:25.633440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Recent theoretical research has focused on establishing rigorous convergence guarantees under the unique constraints of sequential decision-making","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:7dcbd86c2208c56dc79ef735615b033df728e7a6e3c2e146593c15f1110d4c39","observation_id":"4a5abb1e-3902-4d64-8583-86407890b6eb","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"collaborative single-policy coverage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:d0be93cf3c5c3dade3880366ab7bc04f5af358df681e78ed2f22dcfbdc148b25","observation_id":"a2661299-5acd-46d9-8ffe-5770b2399223","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:44:53.211503Z","title":"Similarly, DAPO [36] introduces a decoupled and dynamic sampling system designed to stabilize long Chain-of-Thought (CoT) reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:8b21b8e116c8dc4f09765af1440a49a6cf590c99f4397d0c1cfcc07ee327272e","observation_id":"f5ef04ab-4657-42fa-bf47-c4803efb1d77","resolution":{"observed_at":"2026-06-28T11:44:53.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T19:53:44.659839Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":29,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.03094."}