{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:057fe4874c44a090c80c359270d5a6301a97403c6a85aaf950590d4abcbd078c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.12160/citation-record","integrity":"/paper/2604.12160/integrity","json":"/paper/2604.12160/citation-record.json","paper":"/paper/2604.12160"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:c4179dcf53a40bdd0120a538df01c4da1485a1b5d6944bc803f6ca20df30e29f","observation_id":"65083332-4263-4475-9d35-f7512bdf980f","resolution":{"observed_at":"2026-05-11T09:21:00.321774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:b39e8d16cbba7193c817fbdb0d19035d6f6b50dde2f38bd6e6dc92306d6f13da","observation_id":"a1fe332c-1917-4aba-beda-7c12085fb0c8","resolution":{"observed_at":"2026-05-11T09:21:00.327042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:d927d38b9b5acbb9ef8750ca58478192df39733c0d00e91ece98a68dfb7cd270","observation_id":"d641c100-c1e7-4cd0-acd4-bdb524dbe66d","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:055ef5da0bbd1c1efc65d34def3c29a69fe932c436840a9d9a283ae8adecccee","observation_id":"07c5dbba-d228-4d05-aeae-fa4ae0032d28","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:628ef4dc8b11dadf1c1df8d1202004eafb76806bb2ed5961b1795e1d2ffe50b8","observation_id":"a6b7218d-e4e3-44be-b610-3fec15388bf8","resolution":{"observed_at":"2026-05-11T09:21:00.278676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06335","last_updated":"2019-09-13T17:26:20Z","snapshot_observed_at":"2026-08-02T11:40:53.964079Z","submitted_at":"2019-09-13T17:26:20Z","title":"Measuring the Effects of Non-Identical Data Distribution for Federated Visual Classification","version":1},"cited_work":{"arxiv_id":"1909.06335","doi":"10.48550/arxiv.1909.06335","metadata_source":"pith","pith_arxiv_id":"1909.06335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring the Effects of Non-Identical Data Distribution for Federated Visual Classification","venue":"cs.LG","work_id":"1e8d2981-bd90-4c86-8676-223498b6d816","year":2019},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/1909.06335","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:cd395847751286fd5890e16ec8761658768ae82b4a75d2f8e032a26ccab35195","observation_id":"726b6feb-5b21-4df8-a272-61076c574b96","resolution":{"observed_at":"2026-05-17T17:37:07.837719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11479","last_updated":"2023-10-19T14:11:11Z","snapshot_observed_at":"2026-07-06T07:17:33.790455Z","submitted_at":"2018-11-28T10:16:18Z","title":"Communication-Efficient On-Device Machine Learning: Federated Distillation and Augmentation under Non-IID Private Data","version":2},"cited_work":{"arxiv_id":"1811.11479","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.11479","snapshot_observed_at":"2026-07-10T13:47:05.783646Z","title":"Communication-efﬁcient on-device machine learn- ing: Federated distillation and augmentation under non-iid private data","venue":"cs.LG","work_id":"92d889c4-fcfa-46e0-be03-2aa9586e3aa3","year":2018},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/1811.11479","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:d1a83ecfcf3e1694a4317de4b0265a4803f17576f490cc550905e25d7587faf0","observation_id":"9a6de2a1-2fd0-4b17-84f6-656c31b44031","resolution":{"observed_at":"2026-05-11T09:21:00.241050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.03652","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fedexp: Speeding up feder- ated averaging via extrapolation","venue":null,"work_id":"f91448a2-b149-4d89-81ce-b31d60306750","year":null},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:1ba95e43727b1519f47bea949a0036e118eb51a6f34134519246a9670757ea6e","observation_id":"5bec4052-a4e5-4958-85cd-32505e80d068","resolution":{"observed_at":"2026-05-11T09:21:00.122341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05492","last_updated":"2017-10-30T20:52:14Z","snapshot_observed_at":"2026-07-06T05:15:00.158639Z","submitted_at":"2016-10-18T09:11:51Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","version":2},"cited_work":{"arxiv_id":"1610.05492","doi":null,"metadata_source":"pith","pith_arxiv_id":"1610.05492","snapshot_observed_at":"2026-07-04T19:50:10.985326Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","venue":"cs.LG","work_id":"dbe54fa3-b463-4453-844f-8aba26dcf434","year":2016},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/1610.05492","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:b5711e67f3cd40a2e43ea3093c430ab92af12872ebb10b5d29bb318673d26bc3","observation_id":"9277bd67-1dda-4ae2-a44b-5e058ca566d0","resolution":{"observed_at":"2026-05-12T13:42:53.107840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13541","last_updated":"2025-07-17T21:21:54Z","snapshot_observed_at":"2026-07-06T21:59:01.331899Z","submitted_at":"2025-07-17T21:21:54Z","title":"PrefPalette: Personalized Preference Modeling with Latent Attributes","version":1},"cited_work":{"arxiv_id":"2507.13541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13541","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prefpalette: Personalized preference modeling with latent attributes.arXiv preprint arXiv:2507.13541","venue":null,"work_id":"6ca982cc-14e0-4930-8ca2-a82249e5c8ac","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2507.13541","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:71f5152691c044cd6f47e2b5b7a7e819928da476a6a16b1704654dbd19ba1ae0","observation_id":"423370ac-265b-4082-a7ff-3a85f455d3f8","resolution":{"observed_at":"2026-05-11T09:21:00.232553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04823","last_updated":"2025-08-18T16:06:09Z","snapshot_observed_at":"2026-08-01T18:18:48.262400Z","submitted_at":"2025-04-07T08:22:45Z","title":"Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models","version":2},"cited_work":{"arxiv_id":"2504.04823","doi":"10.48550/arxiv.2504.04823","metadata_source":"pith","pith_arxiv_id":"2504.04823","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantization hurts reasoning? an empirical study on quantized reasoning models.arXiv preprint arXiv:2504.04823","venue":"cs.CL","work_id":"a26b5b9f-bd80-409d-9593-c781040e06f9","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.04823","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:8a564a2abbb002a87e9c3d6876bc7dc15318f7d30ee392a11bdce38e3fbc69fa","observation_id":"ce61cc47-e1c6-41d3-bf1f-ec1b7f1a2004","resolution":{"observed_at":"2026-05-11T09:21:00.245549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22257","last_updated":"2025-05-30T03:55:41Z","snapshot_observed_at":"2026-08-02T18:18:01.345594Z","submitted_at":"2025-05-28T11:42:33Z","title":"Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training","version":2},"cited_work":{"arxiv_id":"2505.22257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22257","snapshot_observed_at":"2026-07-04T08:09:40.626687Z","title":"Revisiting group rel- ative policy optimization: Insights into on-policy and off- policy training","venue":null,"work_id":"6a3cdbc2-27a6-44d4-8d98-35c8234b8616","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2505.22257","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:22d7e543a76667f53da429fba7f7d4bb9f9d746a51379f34c8920ba34a85fd62","observation_id":"fe178f05-98da-46a3-8006-a447f50916ff","resolution":{"observed_at":"2026-05-11T09:21:00.258805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17238","doi":"10.48550/arxiv.2506.17238","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M.et al.Training a Scientific Reasoning Model for Chemistry (2025)","venue":"arXiv (Cornell University)","work_id":"4462c0d0-104f-476e-a4c6-6532c131f8be","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:0e22b0fc7d498ceb7f8f7cb2675bfc5181b4e1ae6e36be4b7673adcfab92bc4b","observation_id":"8d7cbd9a-5351-42bb-b6e8-beba46412eaa","resolution":{"observed_at":"2026-05-11T09:21:00.284072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ravan: Multi-head low-rank adaptation for federated fine-tuning.arXiv preprint arXiv:2506.05568","venue":null,"work_id":"f9c408dc-bf8f-4e4b-bb6f-ca7466fdbef3","year":null},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:391e02dc3f390eb8c51464c4f5308e9d645b4ffdbcd6657c23118977f9b3429f","observation_id":"0c5aee3e-89a3-4651-a174-68cb24c46ea3","resolution":{"observed_at":"2026-05-11T09:21:00.265395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-07-06T09:01:12.515300Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"cited_work":{"arxiv_id":"2003.00295","doi":"10.48550/arxiv.2003.00295","metadata_source":"pith","pith_arxiv_id":"2003.00295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive Federated Optimization","venue":"cs.LG","work_id":"489d9e1f-7fc7-4bb8-aa65-92d6e85bd798","year":2020},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2003.00295","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:a038ddb796a9c850d9c449710e9c787c4092ea6788c88be525dffd9acb30235d","observation_id":"92472a1f-1c46-4874-8ef1-6149062488f1","resolution":{"observed_at":"2026-05-21T10:30:59.208172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fedpaq: A communication-efficient federated learning method with periodic averaging and quantization","venue":null,"work_id":"1c05d532-3ba6-4fcb-9d06-e311e2398179","year":2021},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:6cb4e618a144160c3635de00d1a5b5ccc5da28225e58e8a626123f451272dd44","observation_id":"8b6d19cf-4052-426c-8a0a-1762b5be3ab0","resolution":{"observed_at":"2026-05-17T17:02:00.092090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:59a06d1744c02b0cfcabd5ff686f8736b1245d338a75c5b35cbd5c405c290fa4","observation_id":"1c576c64-f1f4-4ee3-a761-f7d1e783454b","resolution":{"observed_at":"2026-05-10T16:05:33.602522Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:115755fc7264ec78a40cda68ac4640462fa111c1abde27901dc7f76b1af61e5b","observation_id":"50c7f524-6b95-409c-8aa4-6b89417563b9","resolution":{"observed_at":"2026-05-11T09:21:00.249814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07024","last_updated":"2025-08-23T00:44:49Z","snapshot_observed_at":"2026-07-06T21:54:34.271025Z","submitted_at":"2025-07-09T16:54:21Z","title":"FlexOlmo: Open Language Models for Flexible Data Use","version":4},"cited_work":{"arxiv_id":"2507.07024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07024","snapshot_observed_at":"2026-07-04T07:09:37.876775Z","title":"Smith, Luke Zettle- moyer, Pang Wei Koh, Hannaneh Hajishirzi, Ali Farhadi, and Sewon Min","venue":null,"work_id":"8a9ecf2d-7ec5-43e3-8cf9-76d81dffc168","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2507.07024","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:a0e5dfee05c507de2819f788785a8f49caac4a0374db88123bb01ba96420f596","observation_id":"3807499f-d513-405a-8343-7e6d560ad2df","resolution":{"observed_at":"2026-05-11T09:21:00.178520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07291","last_updated":"2025-05-12T07:24:33Z","snapshot_observed_at":"2026-07-06T21:22:21.577606Z","submitted_at":"2025-05-12T07:24:33Z","title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.07291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07291","snapshot_observed_at":"2026-07-01T20:56:13.377646Z","title":"M., Straube, J., Basra, M., Pazdera, A., Thaman, K., Ferrante, M","venue":null,"work_id":"9233b23c-abcc-4449-8d29-93e7185d2028","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2505.07291","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:08345662a746d1929e052bde60d4a7e1cea942adebbe6500d0a580b7156d1c4e","observation_id":"240dbc33-de94-4ae2-981d-3980c4c9e09a","resolution":{"observed_at":"2026-05-11T09:21:00.205866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can public large language models help private cross-device federated learning? InFindings of the Association for Computational Linguistics: NAACL 2024, pp","venue":null,"work_id":"81093f5a-72ed-4cdb-8ee9-a18519f52306","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:a895e86e53f4de6ad8ef21a1596a24833e7834d8e702a0e86e7b8a6afb0ad054","observation_id":"47236bed-1e76-4aef-96f4-5d47aee8fe7e","resolution":{"observed_at":"2026-05-17T17:02:00.084056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15777","last_updated":"2025-04-22T10:38:00Z","snapshot_observed_at":"2026-07-06T21:13:00.237924Z","submitted_at":"2025-04-22T10:38:00Z","title":"Tina: Tiny Reasoning Models via LoRA","version":1},"cited_work":{"arxiv_id":"2504.15777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15777","snapshot_observed_at":"2026-07-03T14:08:21.920833Z","title":"Tina: Tiny reasoning models via LoRA.arXiv preprint arXiv:2504.15777, 2025b","venue":null,"work_id":"c1ef596d-9edc-4ce5-8034-1d13826b4e2e","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.15777","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:5e9a7138eb72b71ba1056d32393e85e96520f0a76a9fe03661a5af33c8f82c0f","observation_id":"778680e8-6a2d-4598-a560-5dee44fcee29","resolution":{"observed_at":"2026-05-11T09:21:00.199168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.00453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fedmoa: Federated grpo for personalized reasoning llms under heterogeneous rewards","venue":null,"work_id":"96d85767-0f61-4204-9733-0a991ae1ce76","year":null},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:3b352680e841fd5a9fa6d8f33b48bd4590a18e1de0798c186bbe9b9ad4d71aee","observation_id":"f27d821f-e8a4-47e5-8677-2973226010e0","resolution":{"observed_at":"2026-05-11T09:21:00.308041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2504.13818","doi":"10.48550/arxiv.2504.13818","metadata_source":"pith","pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","venue":"cs.LG","work_id":"e6d53e5b-2180-482b-82ca-0e64d572c87f","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:c34114d8aac77855a455c15473c2c0c4f60af906756b3b8456d50329ccea3805","observation_id":"571871b6-4f68-4628-bc06-e14f18faf41b","resolution":{"observed_at":"2026-05-11T09:21:00.164171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:a53fa8b9070ace2cbccaebb90bb49e91ef6c74e03840e30d20dbafc244653d38","observation_id":"8f1ffc40-0ad6-4637-95eb-e492f4978d1d","resolution":{"observed_at":"2026-05-11T10:15:55.036587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:4c440a5e25b76b2ff474dab2e6aa8a3afc98c97c12cf88fdde680b6608012d5a","observation_id":"5839b5d1-cc61-4b0d-8472-7c01d14b2e17","resolution":{"observed_at":"2026-05-11T09:21:00.110671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-07-06T22:23:00.681940Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"cited_work":{"arxiv_id":"2509.03403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.03403","snapshot_observed_at":"2026-07-03T16:48:39.972038Z","title":"14 Preprint","venue":"cs.LG","work_id":"94cb6c9f-d0ab-44e9-b66e-7397f3a9f117","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2509.03403","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:289a1dd729a1d491bdf4570630754ca74494efe44e9dd650203e8e6075f3b767","observation_id":"1c6dfa7e-b427-4dfc-b064-156d1e48a47d","resolution":{"observed_at":"2026-05-20T00:02:06.167523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13659","last_updated":"2024-07-02T11:57:07Z","snapshot_observed_at":"2026-07-06T17:33:21.399878Z","submitted_at":"2024-02-21T09:45:08Z","title":"Privacy-Preserving Instructions for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.13659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13659","snapshot_observed_at":"2026-07-03T01:27:31.680002Z","title":"Privacy-preserving instructions for aligning large language models","venue":null,"work_id":"d5c7667f-8528-4d9a-b2a2-ebe5035d1682","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2402.13659","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:cb9211de08de96e09a48bb11fe2f573569da57fc692fcaadef3c0338992899ad","observation_id":"042e56c1-f948-4226-ab85-e70ced49770f","resolution":{"observed_at":"2026-05-11T09:21:00.143270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:b35eef5bcde92ddec02d87c032506e851a439d413f03c74dd4ea2d0ab34f3d72","observation_id":"11ed0fa9-d735-4b7e-aeb4-42078a3277c6","resolution":{"observed_at":"2026-05-11T09:21:00.139140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards building the federatedgpt: Federated instruction tuning","venue":null,"work_id":"dc3f2beb-f0e5-4d71-bd27-c46834d1db50","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:e45e84f793ad66e5c19d5f62488aa8a4336cae1de6873645ec9e56432bcdd9c0","observation_id":"56611336-6c53-4551-93d4-a2634db6bcd9","resolution":{"observed_at":"2026-05-17T17:02:00.080302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15716","last_updated":"2025-04-22T09:01:04Z","snapshot_observed_at":"2026-08-01T16:49:44.601227Z","submitted_at":"2025-04-22T09:01:04Z","title":"DianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.15716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15716","snapshot_observed_at":"2026-07-03T16:48:40.026061Z","title":"Dianjin- r1: Evaluating and enhancing financial reasoning in large language models","venue":null,"work_id":"7bfcf92e-6ded-4546-8fb6-c5f8f846c865","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2504.15716","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:687e6edbd9526086a111c15093b34b5520078e90b539bdbd0f4cdca035070d2d","observation_id":"fc2a2d5a-d91c-4693-9596-38dd5e3ea19f","resolution":{"observed_at":"2026-05-11T09:21:00.135174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":"2406.11931","doi":"10.48550/arxiv.2406.11931","metadata_source":"pith","pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","venue":"cs.SE","work_id":"713a39be-8c4e-4ee3-8671-11cf9379262f","year":2024},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:f0787c2432270bdfbfdd41711cd56813c22458220fb4dcc5808e765f084b2ce2","observation_id":"da23b531-6680-48cd-ae91-000459973ea8","resolution":{"observed_at":"2026-05-16T01:06:07.964742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If M(t) i (x, θ) =m , let Y (0) i (x), Y (1) i (x)","venue":null,"work_id":"6361b19f-c2cf-4883-b723-83e4d72b4397","year":1977},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:1210c7c97193fb4da9cca3440f4d830a172eeab8b7e6c995502d14d9afd1e568","observation_id":"4b4c5c57-65e5-47ce-8690-2375150e3fd9","resolution":{"observed_at":"2026-05-17T17:02:00.076529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Balanced method and aswapperiod of 2 is used here for response aggregation withPubSwap","venue":null,"work_id":"5cd10861-9728-49a5-8b30-7e6f7d586885","year":2048},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:5a6c55970334e18bb9f9cbcb73d45442d3ea21726fd14de25dc75eafc8647d51","observation_id":"e063a454-8462-4ddc-a7e8-7ee1f59d83a0","resolution":{"observed_at":"2026-05-17T17:02:00.088324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":25,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2604.12160."}