{"as_of":"2026-08-05T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9f465636b66bd5b59662bd08a5128803877fbff2a1ba65faf9ddb725953e957","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T22:45:56.857810Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:51:22.327336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T10:29:44.758886Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2605.11461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11461","snapshot_observed_at":"2026-07-04T10:29:44.758886Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","venue":"cs.AI","work_id":"75434ebb-d0a4-430f-8b30-1aa1244071e4","year":2026},"citing_paper":{"arxiv_id":"2606.23867","last_updated":"2026-06-22T19:09:25Z","snapshot_observed_at":"2026-08-03T04:34:33.273751Z","submitted_at":"2026-06-22T19:09:25Z","title":"Exact Schur-Sylvester Dimensionality Reductions for Non-Smooth Stochastic Complexity and Manifold Sampling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T08:51:22.327336Z"},"links":{"cited_paper":"/paper/2605.11461","citing_paper":"/paper/2606.23867"},"observation_digest":"sha256:66ba7091fe00bb7858936bdf831f49a061f837eafc1b565bbb2221398b076ef0","observation_id":"e7956f53-6352-4c8a-8d0e-ad631586c4cd","resolution":{"observed_at":"2026-07-04T10:29:44.760416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.11461/citation-record","integrity":"/paper/2605.11461/integrity","json":"/paper/2605.11461/citation-record.json","paper":"/paper/2605.11461"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2505.15134","doi":"10.48550/arxiv.2505.15134","metadata_source":"pith","pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","venue":"cs.LG","work_id":"f8d10af5-2f58-4959-97c3-4e23db3983ad","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:e49c25d066ba42f278759fd30c0c8e64bd44851cfab938df37e2f7eca638d0a4","observation_id":"70d21982-717d-46cb-8a73-a099bac0bbdd","resolution":{"observed_at":"2026-05-20T22:49:10.670654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05837","last_updated":"2026-04-13T12:17:34Z","snapshot_observed_at":"2026-07-06T22:31:53.944103Z","submitted_at":"2025-10-07T12:02:03Z","title":"EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget","version":2},"cited_work":{"arxiv_id":"2510.05837","doi":"10.48550/arxiv.2510.05837","metadata_source":"pith","pith_arxiv_id":"2510.05837","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget","venue":"cs.CL","work_id":"4aaa5ae8-ce96-4214-84a0-75d4a6e9c04c","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2510.05837","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:58c3cb2740e566bf9e78fc1b8b29e31074624c359bf52c2cb61e3e5bd36ac18f","observation_id":"1ee6409a-599f-4fbf-beeb-625ef87d80d0","resolution":{"observed_at":"2026-05-20T22:49:10.533825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.04784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Post-training large language models for diverse high-quality responses","venue":null,"work_id":"e924bdfa-703b-436e-a1e6-0e64ccd0eede","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:e3cd937522a45549b51ae6c02f345f43ba8d74ce0893169628e197d6bb32c935","observation_id":"8350d31e-0e02-4dae-98d5-3179fb64b761","resolution":{"observed_at":"2026-05-20T22:49:10.541535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-01T16:48:14.960826Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:9b60458b8e1b9b7541a94066627fca1f8cd1183232a130780c9851f667db4312","observation_id":"4efd0409-3d61-4fff-90f7-0358f16c0b19","resolution":{"observed_at":"2026-05-20T22:49:10.563663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:f9fb0a483c8799f2b7bdc6751121cda2993df593d2b3271c5894288139b9bfbe","observation_id":"a070d93c-9384-4c88-afa0-96c44f6c1948","resolution":{"observed_at":"2026-05-20T22:49:10.692002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:22e9347d3175402a380ab3537ec11fd15789a58b9d312a1fc88d7c903ef2877a","observation_id":"e955fdf2-5dc6-4b94-bc6d-eb0fd198b68c","resolution":{"observed_at":"2026-05-20T22:49:10.616959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:09f329c9f45d511cc9a1cf1c270bf326be7847b16d2689f6cadd0453ac80a0da","observation_id":"03444957-c485-4a6e-b590-c17ad6fdeabe","resolution":{"observed_at":"2026-05-20T22:49:10.637728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:45e39ef6960c17f7c8ae01a44dfeaf83a3a1c1b74ef146997935177814a77880","observation_id":"9ea2ef30-4495-4cbf-bc27-c79752a0aa7d","resolution":{"observed_at":"2026-05-20T22:49:10.590794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.038755Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"81ec356b-c432-49ab-a9e5-e7e5f7d699cc","year":2023},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:5dc5d97437a363de8b87c5427a44dc2dd604ac8273f402c3cbe8e70691915561","observation_id":"2cc5077a-38db-4781-ad42-8594a5809f32","resolution":{"observed_at":"2026-05-20T22:49:11.928668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:b87b849c445fc7616ad7ee056f7f58d8039241abc15cf530421955abfe3ff0f7","observation_id":"e8eaa5d6-ed76-4b13-a4d6-2d5f0fd87b2b","resolution":{"observed_at":"2026-05-20T22:49:10.577261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:dbc017a283e5e6af0e3a9be2d7218e2b1ff0663e634d353d55302404f1cc1d71","observation_id":"eb03bcd3-6957-47a1-a2e4-64716fcd618c","resolution":{"observed_at":"2026-05-20T22:49:10.677272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-02T09:44:45.484509Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":"2501.11651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-07-08T22:25:39.474855Z","title":"Advancing language model reasoning through reinforcement learning and inference scaling.arXiv preprint arXiv:2501.11651","venue":"cs.LG","work_id":"5285cf94-5260-4da6-9f74-84d71071d5be","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:6ee3ed33598aa70e5ab96a26ba37985e06f917f805ac779646160ae7e86c4bd8","observation_id":"b0e72bd3-cb95-465d-8f94-3ec23d0f8b01","resolution":{"observed_at":"2026-05-20T22:49:10.497847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.477082Z","title":"Diversity-incentivized exploration for versatile reasoning","venue":null,"work_id":"846fe449-c3cf-44da-a88e-6acd249d801b","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:b38a27a9f115a1b0dc548b28fac334e1d4efeaf1f2286f224e44e4863eff5c7d","observation_id":"af82c7b1-a355-4249-8089-deb2cf0fbeea","resolution":{"observed_at":"2026-05-20T22:49:10.518109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"8df7186d-e789-4512-a208-6beaa02e1c9c","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:3a4f04800c8da646dabb506c59284b70b2431e37a3619cb29b2a5d5c6ed25002","observation_id":"30ab1d08-2b81-4c5b-8294-fb3a40483662","resolution":{"observed_at":"2026-05-20T22:49:11.961511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:51.889995Z","title":"Risk-sensitive rl for alleviating exploration dilemmas in large language models","venue":null,"work_id":"5b61409b-b39b-4a73-9c84-3b226b1cbac2","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:6c62d2bb544b40461c0673c7f783aaa39bdbb1a8e629304f1540d3c1a624f90e","observation_id":"443734eb-332c-4926-96c8-8add893700f7","resolution":{"observed_at":"2026-05-20T22:49:10.504480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Determinantal point processes for machine learning.Foundations and Trends® in Machine Learning, 5(2-3):123–286","venue":null,"work_id":"d8b296b9-e533-4cb2-8207-43423a6c799c","year":2012},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:a724adb4d2e70b4fd93ca91eaf1816d7739b28b51c7ce579de25e76805681f5c","observation_id":"00aa646e-b135-450b-b338-c058bb2559dc","resolution":{"observed_at":"2026-05-20T22:49:11.964645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:14:00.902487Z","title":"Solving quan- titative reasoning problems with language models.Advances in neural information processing systems, 35:3843–3857","venue":null,"work_id":"35f20160-250e-4a1b-9b1a-f00caf5d6247","year":2022},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:9d71ef2480a559062c0b4a1c08f26833b77f8dfcef86e1a8a6818fbbbd3f2b91","observation_id":"71d12950-3c14-472b-a866-16637fcb7633","resolution":{"observed_at":"2026-05-20T22:49:11.967728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-07-06T22:22:26.392981Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:7f94d66deacff5050d329f88e6d368a758f48266203e5d654f7874097ab3f276","observation_id":"72698e9c-aeeb-4466-9574-642f650d7f34","resolution":{"observed_at":"2026-05-20T22:49:10.604622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:a875df53eed9181a40812c922b29cf127ff9f659843fc3f838594ebf7968b771","observation_id":"ef0cc360-6e4b-4d05-afa4-6b06fb9bea5e","resolution":{"observed_at":"2026-05-20T22:49:10.697979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-02T16:49:32.082324Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"cited_work":{"arxiv_id":"2508.11356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11356","snapshot_observed_at":"2026-07-10T12:07:03.473290Z","title":"Ettrl: Balancing exploration and exploitation in llm test-time reinforcement learning via entropy mechanism","venue":"cs.LG","work_id":"61f883f4-4072-4ec3-a7b2-f8139ee1feb2","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2508.11356","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:518598d4437fd7ee38a2a70a3c08d48bc31592a5f3d8ee52b8fc1ecb12890b87","observation_id":"c66f6f6f-a551-420e-9bfe-5397881f3863","resolution":{"observed_at":"2026-05-20T22:49:10.526067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:761e60519ae64b90a5a83f70aa7857693c3e65f358c39a37e1685558c3ccd542","observation_id":"844b31fa-83ab-44a1-8b2e-f7d5ebd5d7fd","resolution":{"observed_at":"2026-05-20T22:49:10.664024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-t5: Scalable sentence encoders from pre-trained text-to-text models","venue":null,"work_id":"1349ab0b-8df9-4716-a3f3-2f891df695e9","year":2022},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:e38c71a80651d3c57cad3d5a0f8c9ee04a3444c8ff6150640cf6e16665ebc084","observation_id":"d6b2dc71-89b8-4fdb-9d1e-97c4e4b026dd","resolution":{"observed_at":"2026-05-20T22:49:11.954614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms","venue":null,"work_id":"b0584b31-6a45-414b-a22b-9d51d9d81a84","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:23dcff7a3c6020c9c797756ef5844480b27db3f511799b35d9c04feeebb7f977","observation_id":"c7075981-c91a-4a0f-a810-57b64ee9d761","resolution":{"observed_at":"2026-05-20T22:49:11.957722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":"e39dd368-2b4d-4dbe-a5f5-bebce273fd75","year":2019},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:49a2f4bac1dbacf6207a04249dd584b57e966ac51c8c0eca65ceee132fc99cff","observation_id":"755233fe-efc9-4947-b4c9-10284346a5ad","resolution":{"observed_at":"2026-05-20T22:49:11.947952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:bdd2e140f06ab85323841752c1e92cd910f6bd22f2407bd38fefbefe20d62de5","observation_id":"e2c65282-b7f7-4495-8dd5-93ee85ad2b4f","resolution":{"observed_at":"2026-05-20T22:49:10.584090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:61d097fe7cd01ed9753eda52cfe8c4ba72e8d2428f2a33843f854daf31a5f110","observation_id":"a03971a1-5704-4292-8086-ce84dda4f711","resolution":{"observed_at":"2026-05-20T22:49:10.657573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:f4eedfa37e62e23c68f418489707f82e49d7ffacd54363e9b83786da7570c172","observation_id":"cab2ade1-93c5-4c8d-a98f-7e4710d69843","resolution":{"observed_at":"2026-05-20T22:49:10.651666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03493","doi":"10.48550/arxiv.2509.03493","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493","venue":"ArXiv.org","work_id":"d2abae43-fc14-4255-b3f8-027a818c366b","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:15e60efdc5c5304ad917750fb4cc71edaa44f64667e338492bc9909b9e71d15d","observation_id":"8955f1d1-a9a0-40fa-9d01-56b61553ce5c","resolution":{"observed_at":"2026-05-20T22:49:10.597759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.023423Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"37ada09c-055c-4ab6-99e5-393107343cd6","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:06e255d5532f720e52bdea8bb4d0de94155037e7db2e5418b2ea261602f4ea1e","observation_id":"fd5f24e5-6eff-4771-8935-3a34573bd62b","resolution":{"observed_at":"2026-05-20T22:49:11.944851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:430bc7c870d2b3ed442ffe99c9f5e0175580de4f99e6f7cac78e981136daf4aa","observation_id":"fcaecc92-9650-4fb4-8d0e-7b3ab5a8e1bd","resolution":{"observed_at":"2026-05-20T22:49:10.610581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many shapley values for model explanation","venue":null,"work_id":"669d6454-5f68-40d4-9e1a-b6a88b011e99","year":2020},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:ec20b62e7b813055f0f229d4a75e1a07a0930862f985d54cded61281c8b4a8cd","observation_id":"466fcc94-82a5-4593-b724-04ae1d33bf5e","resolution":{"observed_at":"2026-05-20T22:49:11.951199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":"2505.15201","doi":"10.48550/arxiv.2505.15201","metadata_source":"pith","pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems","venue":"cs.LG","work_id":"89595483-89ea-4826-91ac-09421f814681","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:ae6c6e7bf9ce7251a3688375a462051cca102615df90685afae4ae6c79c639f9","observation_id":"eb66909f-1c90-42cf-a969-d4655d265920","resolution":{"observed_at":"2026-06-11T02:08:32.357336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:09f82888e4c81c7f265240c7a6e5dac51c0a020f0539c19ccef546b967b2305a","observation_id":"5a959122-a490-40ed-9625-6df7f2c79558","resolution":{"observed_at":"2026-05-20T22:49:10.554561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.345368Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290","venue":null,"work_id":"8ce2e771-bc8c-4b3b-a834-6303b981b746","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:d822ffdc343f6463e355ce9bb5e6f1f2d6c9edaff61a4ae22c97ed2d0e9943d3","observation_id":"2df71e25-67fe-44d9-ba7f-6b8c2a16ca6c","resolution":{"observed_at":"2026-05-20T22:49:11.942241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14843","doi":"10.48550/arxiv.2507.14843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The invisible leash: Why rlvr may or may not escape its origin","venue":"arXiv (Cornell University)","work_id":"71f17397-1cd4-4f68-ab1d-e91bb5f5953d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:11341931152b4a26378e43690028aef39ebe395e45b0d883a2f6e1847126db66","observation_id":"9d86e4cd-3a7b-438f-b782-2247e5dbad5d","resolution":{"observed_at":"2026-05-20T22:49:10.548282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05013","last_updated":"2024-07-06T09:07:11Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T09:07:11Z","title":"Progress or Regress? Self-Improvement Reversal in Post-training","version":1},"cited_work":{"arxiv_id":"2407.05013","doi":"10.48550/arxiv.2407.05013","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05013","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progress or regress? self-improvement reversal in post-training","venue":"arXiv (Cornell University)","work_id":"47bdc03d-001b-410a-9be9-edfa321c68f5","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2407.05013","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:f76ae4cb9b28e1581468e751507c265a15075b1efde485f60838d78213e21b24","observation_id":"d470ffd1-8c8a-4988-b95b-259261b16831","resolution":{"observed_at":"2026-05-20T22:49:10.644947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:54:26.364955Z","title":"C- pack: Packed resources for general chinese embeddings","venue":null,"work_id":"253406a3-4f2d-4827-a50c-0381898b9269","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:3b52bbf591c5df977fa49e91c1aa9b094821833dae45087189a95b1ff93b09e5","observation_id":"e8d4f60f-6755-490f-b372-f6c88097eba1","resolution":{"observed_at":"2026-05-20T22:49:11.939099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:bcea7d0ebf35e5edb383fcb752f17b9ee94c62f55212ada4db3c1405841ebe76","observation_id":"12d63714-7461-4126-b065-582ce3ea7b9e","resolution":{"observed_at":"2026-05-20T22:49:10.624071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23433","doi":"10.48550/arxiv.2505.23433","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diversity-aware policy optimization for large language model reasoning","venue":"ArXiv.org","work_id":"4b83b560-bb2a-4494-bece-309e23edbe44","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:1a5704cef68706a1ee0ec004ac7efe199882b0179daf73cf612a909a22bfb1b9","observation_id":"54bd6d96-2304-43ac-9860-3709fcd52c96","resolution":{"observed_at":"2026-05-20T22:49:10.631105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:24:52.582155+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:24:52.582155+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:abeb6736a79c69ba0b8fb6338df51935625d8a911bf553ccbfa80f21f1ecaedb","observation_id":"5585099f-ce1f-4d6e-91bc-1b055664ba2d","resolution":{"observed_at":"2026-05-20T22:49:10.683745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-07-06T21:05:59.227458Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":"2504.05812","doi":"10.48550/arxiv.2504.05812","metadata_source":"pith","pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization","venue":"cs.LG","work_id":"307cd976-c17b-46e9-b54f-41fd64b30e5e","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:0aa133fc08f141d102257324df7811c55122e85463ee57ca327dac8a3081c3db","observation_id":"bcb43b4b-7ee9-4305-bc98-03103ae8f655","resolution":{"observed_at":"2026-05-20T22:49:10.570853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:12.480934+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"k_ i=1 (ri = 1) # =E","venue":null,"work_id":"b3f14a38-b4ba-4232-8650-c41c468c79a8","year":2024},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:8ab7aeff4b4501cc843807de216be06194cbd1601742dd984de270ec6825c02b","observation_id":"0de2b83e-5274-4270-9f29-31a86aa97994","resolution":{"observed_at":"2026-05-20T22:49:11.936726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f65b001d-5bd9-4965-8bd6-6184c674e31d","year":null},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:91c96d25885dbc82f99c1beda9a281724614af660afc56e2befbe33325124b2f","observation_id":"1b255a29-cb82-4e9d-b49b-353f906279cc","resolution":{"observed_at":"2026-05-20T22:49:11.931541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"double-counted","venue":null,"work_id":"c8a35086-c108-4db7-aad8-3d0ad9043033","year":null},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:b06929f75a074cdbd90dd3ce2e7fe9159824a500bb1ce76e521d930991b94426","observation_id":"5b0f3a68-188b-435f-a50d-851ac05918bf","resolution":{"observed_at":"2026-05-20T22:49:11.934089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":30,"verified_fuzzy":13},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2605.11461."}