{"as_of":"2026-08-08T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d81e370f9cfbd6398e91dba9baa2b196485e259f598e549895789bc50cce585e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:45:34.358581Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.18954/citation-record","integrity":"/paper/2606.18954/integrity","json":"/paper/2606.18954/citation-record.json","paper":"/paper/2606.18954"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:ce6a496fa9a7560a1e11c601f169601578a5de5ce3c30306967541495cb3a087","observation_id":"8dff9ab2-4629-462e-8d72-07cc2c53e6e5","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:32ecb7385bc8fbe4308a1ffb4def312eba7b992b8b9116ad72699b2de50b3212","observation_id":"5c8eb38e-11c7-4454-9b7e-5af16271b794","resolution":{"observed_at":"2026-07-04T00:59:21.131847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:f99d99898d8d63af96a9aaea07a0c99346257d3cdad7a3b915a7dc85354f0bba","observation_id":"10e64322-081a-4b21-bf6d-5ef9da81a23f","resolution":{"observed_at":"2026-07-04T00:59:21.136079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Troll: Trust regions improve reinforcement learning for large language models.The Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:68752e7287ee448f3be6a13eb19d57d246163637528abf5b652fba5e237f9405","observation_id":"6186bd2b-0d40-4153-97eb-ad116e9d2736","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Geometric-mean policy optimization.The Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:744db3cdef38b85f1c40dbef470dae17e949becb4e059efbac3e87d21e9f4d93","observation_id":"d5f35f13-6697-4efe-939c-53eda433a491","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Dapo: An open-source llm reinforcement learning system at scale.The Thirty-Ninth Annual Conference on Neural Information Processing Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:dcb71f760699732797b0912ffac9760ee743cd36857e61690ce3fd0905c5aaab","observation_id":"186abeb2-b2bf-46bb-825e-8d1bd640faaa","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Vineppo: Refining credit assignment in rl training of llms.Forty-Second International Conference on Machine Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:1382dfb7420562c1d6d2f8ddd5dfe36c53d6751b93d05d17de35f1af7b19ec45","observation_id":"4efbfb10-56ea-4be6-a2d3-6b62be733658","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:4ece329235515c1bedce51a147d453afaf29914f9c9e7f8da6b2c0b58ba0020e","observation_id":"76b02761-259f-438c-8a17-e2fafa6fa6d1","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:59:21.123280Z","title":"Treerpo: Tree relative policy optimization","venue":null,"work_id":"77a18a55-496d-41d7-a504-ec3009aa183f","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:5eefa365729bc6fa0109b96bcb17da838734b0f6144a0e011be0709de367726a","observation_id":"f5c085b3-aa18-4734-b883-6e45e2fae371","resolution":{"observed_at":"2026-07-04T00:59:21.125901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Pros: Towards compute-efficient rlvr via rollout prefix reuse","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:06e55d883f60ff185ed8d79f8212d79ea85aae67f3fab68bba7708ae341cb49c","observation_id":"acb03cb7-9e4e-4464-b7f3-e144367ad852","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Let’s verify math questions step by step","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:5f06ba331ed7ad82d10e0d9cc90050294c3d61672a4976d3ae095e7caa7d8b9e","observation_id":"f47b9ba8-f051-415c-9919-7d43b6af8005","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:de12b0494663c6ec2b2725f2ecd2b41ad2a8029ec9985c878224d48830374ce6","observation_id":"bfa5b26d-4c54-4a3b-81e1-98cbd7147f95","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:953ec274fdada314b1caf08860a1800da676f041ea40932c65a63056dbfe132b","observation_id":"ee3f39c5-b15b-4fb6-845e-67da2186bd5a","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Alphamath almost zero: process supervision without process.Advances in Neural Information Processing Systems, 37:27689– 27724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:e2c0fac8196a8f8a579a04dfd95a253e571479fbf115099a248ab442f07ac96c","observation_id":"da18bede-5249-4ce9-bc84-fccd1ff1cb3e","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Mutual rea- soning makes smaller llms stronger problem-solver","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:d72bd522810cdf0598c6cef69a4796b206eec2f8ea013cd549cd54ab3991e3f2","observation_id":"836e8882-9224-4902-a3fb-4fa7e9148f62","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:666acfdc902a98ec4bd0c6325c1cdd28676c6c6a9f4378dd6a41f3f0efed8378","observation_id":"35bb6f08-2990-436d-b05a-bd0046532499","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:d3c8ff7ad015a7fae0011e763e230a0d1e1056e9ee5413027db6931cfc5f2a9c","observation_id":"c42f5a30-dc60-41d4-9404-c94ffdd0109b","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Treepo: Enhancing policy efficacy and inference efficiency with tree modeling.OpenReview preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:48423c3753b6c13588a08c148d561ca58adf2e25a50d23fd713763df1de065dd","observation_id":"ecce0114-b2bd-4bf6-aed9-1ccbf7985667","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Tree search for llm agent reinforcement learning.The Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:f105d7942a355bece1cbe2535cbe69ab527acce726ecafce0a6346a4ecd55e05","observation_id":"9e2732ea-080b-42ba-8ceb-759f4f9aa2ca","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Scheduling your llm reinforcement learning with reasoning trees.The Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:62b3657ca7eb754edf48b7de4ec14626ca53a1c3b240d847114211334d07f54f","observation_id":"56ec75b2-e39e-4919-8cd1-3a3d255ab08e","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Treerl: Llm reinforce- ment learning with on-policy tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:26f74dd0c979a32e2b17fee99d95a715fae5bd751cbc5f4a669591b4c0e6b8ac","observation_id":"6965f263-65d0-4ed9-af76-1ef22fb2016f","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Segment policy optimization: Effective segment-level credit assignment in rl for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:25e705f1411f48cef92017c05ad64f5f9eb15b38c16a4f82ff754001d7dcbb52","observation_id":"d013ac53-d5bf-458f-8b51-778ec161b81a","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:7e1308f00a6d8400dd1e41cd7e759aeb54fb0bd131a726265da02197f2cc59d1","observation_id":"162318d0-7d84-4a9d-89e0-b6d07c6a8a0b","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Reasonflux-prm: Trajectory-aware prms for long chain-of-thought reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:e6a2abc954eeb6082ed125e1e3ecf0b3735c11e6b41d0c2cc67558654216317c","observation_id":"bc01ea30-bac9-4079-835b-c5c2020e3223","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Trust, but verify: A self-verification approach to reinforcement learning with verifiable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:84d33dee542984eb15708bf6b12e7bbc8ef24658504893dbb904b0fc09b27215","observation_id":"8f79709e-c423-4c08-af2e-6aa2b519d306","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Self-aligned reward: Towards effective and efficient reasoners","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:7f188fb34dddfb23bd1ffb4a4a19fc2c51f3cecaff70507074dab3075cbf194a","observation_id":"2a747e75-e1c5-44b2-985c-093e772b4535","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Lookahead Tree- Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:17a7c325ac5136a8d6549230471ac8c0409907e0e79263a24976fa14703fe91f","observation_id":"c355564d-ee87-4d03-a596-caff5e02d204","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Monte carlo planning with large language model for text- based game agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:fdfcca30278c003de7451d664d926333dd35c898e157c5189db8fe781322ac1b","observation_id":"cc422f2d-f099-4766-87dd-68e38d4eb3ee","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Tree-opo: Off-policy monte carlo tree- guided advantage optimization for multistep reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:ab0e2a52f03879068c8b378f09e4c8e6a14e4beeb9a60bab5fbcc19c1976e2d8","observation_id":"9987b6af-ba42-4086-bacf-a3295a1599a1","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:82669e51d8bc96fa1cb13b42107f4949a0a6eb3a8518e7669679593a10affabb","observation_id":"d471033c-c55d-4639-abba-a464500ab285","resolution":{"observed_at":"2026-07-04T00:59:21.117938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Sfr-embedding-2: Advanced text embedding with multi-stage training, 2024.URL https://huggingface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:5ff101ef411dd4b2203d3f0be325aad3a3b131c72fa6096e54f528f099ee4c6c","observation_id":"5e4cadbb-64c8-4ab5-befe-874b5049d2a1","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Mirb: Mathematical information retrieval benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:50d2846862d37d0ffb62d3ef091db4a7d37ac7b8e26dea8732a57851f886c949","observation_id":"4280ba47-1a47-4c75-aa8e-b92753d9cb03","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:0452320338f71bd4db23388a52f546b062338e7c464f2d8bd87c40365b49e575","observation_id":"d5c81dfd-292c-4304-9cc5-b66c06108c54","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:fda1df0c12c5f0ab1df0eb78dfa47fbe88de95ff37491be49050d35c8ef0c447","observation_id":"6b8ef730-76a6-4a1e-b505-0d3b40019dc1","resolution":{"observed_at":"2026-07-04T00:59:21.109577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:a0c0a8e94d371266f697206698ba88719e34116d54bd02351affbb4a2619cff1","observation_id":"0ba5668f-0211-472a-8b22-70e6fb6b3e6a","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:8add7652019e510ba1827c33903b872fb6d01f3f461a54c4e267e7987ff159b7","observation_id":"6c77f631-e089-48e8-b859-2dde477567a4","resolution":{"observed_at":"2026-07-04T00:59:21.096630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:692ca31d394c13da74944379336d685fcc6431a3e9b0f81925d004c1cea4c33f","observation_id":"febc5756-6855-4390-8cba-ba02069345e2","resolution":{"observed_at":"2026-07-04T00:59:21.091999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:18d4a969acd3ad695979d00891af0365a4bd17b267827fd2736625ad539ab1d4","observation_id":"cebc2f51-77a2-4280-8743-a833f62dc8c8","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:110f9bdfb93aa72c952d8634e9d7922f08d990f98c35e14ef8cd665d1d06c4a5","observation_id":"8428aa38-5a3a-461e-89d5-a23352a8bea3","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Webwalker: Benchmarking llms in web traversal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:03360bde14a2afb624a8e76237b12a54fac55e3d214cf731a02d9f120ecd5cf4","observation_id":"b5fa9e74-5bc6-4582-891c-a33e8f274bcb","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":"2504.12516","doi":"10.48550/arxiv.2504.12516","metadata_source":"pith","pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","venue":"cs.CL","work_id":"25adb508-d97c-49d6-ae43-7a70c2478a34","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:29575c3eca9f92db7915d4b826a5e19d720b48ef98dcba17f998ae7fc66a2ebe","observation_id":"7db7f2f3-3662-41d6-a3d9-2304da408e02","resolution":{"observed_at":"2026-07-04T00:59:21.100303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13651","last_updated":"2025-06-16T16:16:14Z","snapshot_observed_at":"2026-08-07T00:25:54.557015Z","submitted_at":"2025-06-16T16:16:14Z","title":"xbench: Tracking Agents Productivity Scaling with Profession-Aligned Real-World Evaluations","version":1},"cited_work":{"arxiv_id":"2506.13651","doi":"10.48550/arxiv.2506.13651","metadata_source":"pith","pith_arxiv_id":"2506.13651","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"xbench: Tracking agents productivity scaling with profession-aligned real-world evaluations","venue":"cs.LG","work_id":"b7f0bdf6-3821-4735-b55e-be58f6ef326d","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2506.13651","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:7ddfebe6964718e3e51ce31304ddaadbac85efe073893cf90778cdc235125144","observation_id":"ec24d86c-2fba-4017-9059-2d1d5c438c71","resolution":{"observed_at":"2026-07-04T00:59:21.105637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:8ec11967f99716791ccc87c025922b7c10d6bb51484818ed50409b9f0652d02e","observation_id":"746c2ad8-3d3c-4f91-84fb-eb4681e81b9c","resolution":{"observed_at":"2026-07-04T00:59:21.113786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:3bdbc51bc1de1ece258811a3e1d022f77de3a15de209e7572cb5b20e1ddab285","observation_id":"baa2e284-b63d-4b09-a156-b1d6afd451d4","resolution":{"observed_at":"2026-07-04T00:59:21.121536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:45:34.358581Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:adeb0db9355facd1240a1418ad62fe3ac4f2f69c8f5fed883a95be04b65f3255","observation_id":"908ee632-e64d-4de9-a39c-f3d80b968738","resolution":{"observed_at":"2026-06-26T20:45:34.358581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:1f670c2d7624b85b62ace8a597d802886d5d4e152b09d26e2d753bcff17f152b","observation_id":"09f2649a-192c-4916-a237-73606cc87ee8","resolution":{"observed_at":"2026-07-04T00:59:21.078049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07976","doi":"10.48550/arxiv.2508.07976","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond ten turns: Unlocking long-horizon agentic search with large-scale asynchronous rl","venue":"ArXiv.org","work_id":"cf9b5d87-269e-421e-aec4-52f7899c89f0","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:a40cf4254ca3d8b0f9dc840546a97b35dad1b6d4ef77e8ea266ffa9647cbbdc8","observation_id":"e1e84055-8f76-4c8f-b2cc-b92a9b9f7422","resolution":{"observed_at":"2026-07-04T00:59:21.082677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":"2505.22648","doi":"10.48550/arxiv.2505.22648","metadata_source":"pith","pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webdancer: Towards autonomousinformationseekingagency.arXivpreprint","venue":"cs.CL","work_id":"ca106a7e-910e-4725-b167-348c28d18f1c","year":2025},"citing_paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T20:45:34.358581Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2606.18954"},"observation_digest":"sha256:ec938506fb711d07d35d54d32522bc4ed6a41e947d2f9e873b93235663142f47","observation_id":"4d045f32-4ff9-4b3f-86cc-1072348a3461","resolution":{"observed_at":"2026-07-04T00:59:21.087774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.18954","last_updated":"2026-06-17T11:37:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:37:54Z","title":"GraphPO: Graph-based Policy Optimization for Reasoning Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2606.18954."}