{"as_of":"2026-08-22T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abe2f2975d609cb2272ad13bd82d6c1d3f97f2b8481a874bb094e519ea12773a","coverage":[{"denominator":1,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:52:31.630467Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:59:13.695065Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.674459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:138bc87c8ec3e6c95fd2ae76534a1149ed8c2fb48dbbd4ddac53f0161121388a","observation_id":"7ca6cd1f-eb8a-45c4-b1fb-2af1848a39f1","resolution":{"observed_at":"2026-05-14T01:29:56.804738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-05T11:39:24.525311Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-19T21:15:01.063385Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:24.525311Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:b3348844dfbec0a0672ad2b3bab2d153c7d963f5b5fe5083724084105de39af0","observation_id":"0900ce65-3114-406d-b631-cf22dd7b6e5f","resolution":{"observed_at":"2026-08-05T11:39:24.525311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-04T13:53:34.594743Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25004","last_updated":"2026-06-08T14:01:20Z","snapshot_observed_at":"2026-08-17T08:45:49.972915Z","submitted_at":"2025-09-29T16:29:04Z","title":"CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:53:34.594743Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2509.25004"},"observation_digest":"sha256:45981cff30610bb9e0053ab5bf05af7dbaf00dd06b48723287ec87a3c607631c","observation_id":"04876c42-aeff-4d4f-a0a3-29234d105387","resolution":{"observed_at":"2026-08-04T13:53:34.594743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2509.26522","last_updated":"2026-04-08T14:33:47Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T16:59:37Z","title":"Entropy After </Think> for reasoning model early exiting","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:58.579048Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2509.26522"},"observation_digest":"sha256:fb279003ba4eea7403468e9182d1579ac09915baad00a409348ef5257a8be354","observation_id":"db490758-5cb1-4c81-84ac-8cfb3c9f1d3f","resolution":{"observed_at":"2026-05-18T11:52:35.589387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-04T07:59:53.568100Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-19T09:10:57.779829Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:53.568100Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:fecc726d2f3bce898132fec9dc33dcf8a0ad41253f304ab8234edafd114c82ad","observation_id":"9d0c0b69-7c66-4482-bd2d-baf3af814805","resolution":{"observed_at":"2026-08-04T07:59:53.568100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:a9433003479aed07c58972de191c79dc27986daf088f997721dc5ee885b5fcf2","observation_id":"639e8c14-3980-4fb4-a234-08fec123b9f1","resolution":{"observed_at":"2026-05-15T05:31:55.977831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-03T02:53:07.787439Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, brian ichter, Fei Xia, Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09591","last_updated":"2026-06-10T09:27:06Z","snapshot_observed_at":"2026-08-13T10:57:12.104744Z","submitted_at":"2026-02-10T09:45:42Z","title":"On the Optimal Reasoning Length for RL-Trained Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:07.787439Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2602.09591"},"observation_digest":"sha256:b3556f1403de79c495e7c51a042260a2460cf396caf15f76d1aa570d5774eeff","observation_id":"681976d1-cafc-406a-81b2-c2f48d0a2e84","resolution":{"observed_at":"2026-08-03T02:53:07.787439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-03T02:35:00.092811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.19585","last_updated":"2026-07-31T08:30:05Z","snapshot_observed_at":"2026-08-21T02:40:06.142510Z","submitted_at":"2026-03-20T02:57:50Z","title":"SaFRO: Satisfaction-Aware Fusion via Dual-Relative Policy Optimization for Short-Video Search","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T02:35:00.092811Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2603.19585"},"observation_digest":"sha256:d5bb9a688b75ee7f70528102c25e347cbbf5960f199bfdbb8d02ed3a4d10aedf","observation_id":"3b8e6644-4e16-4148-a510-4cf06df27157","resolution":{"observed_at":"2026-08-03T02:35:00.092811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-08-14T11:40:15.905224Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:05e702ce767b14263394f726f0bf37edc48c72302be6d6b61820a11f6af0a9b5","observation_id":"6f2b12b8-3864-47d4-a1f7-9d783f69f61f","resolution":{"observed_at":"2026-05-13T20:28:14.101220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2604.09852","last_updated":"2026-04-10T19:30:29Z","snapshot_observed_at":"2026-08-11T16:31:36.929717Z","submitted_at":"2026-04-10T19:30:29Z","title":"MEMENTO: Teaching LLMs to Manage Their Own Context","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T17:16:36.784237Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2604.09852"},"observation_digest":"sha256:ae7daaceb23939609b1edd395d873df0c7f96dbf6c0ff703b3f14108902b8490","observation_id":"57db2f98-aae0-45df-b0ba-5df45881d80f","resolution":{"observed_at":"2026-05-11T07:10:59.536875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:0f62a37c4d87f7d53b52f1f54bc72ab96719e72c741eeb6245545b429541988e","observation_id":"56a82c10-1f5d-4c11-87b8-bd938c5ff4ad","resolution":{"observed_at":"2026-05-10T23:15:49.138259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-08-17T00:27:13.360022Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:6252a98a8082dac8b5e896d03aaa871996cefc5ef98df52f9336f943c081617b","observation_id":"0601cb36-b6d1-4f2f-b3b8-0ced460d87b3","resolution":{"observed_at":"2026-05-11T20:06:09.567133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.06523","last_updated":"2026-05-07T16:30:28Z","snapshot_observed_at":"2026-08-18T11:15:10.600591Z","submitted_at":"2026-05-07T16:30:28Z","title":"On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:53.063991Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.06523"},"observation_digest":"sha256:68aaaed8a85661069d2d90db931b92ecf9e77e5fffb949d98c9f73477c5c176d","observation_id":"e9bbfbd2-b9f0-4854-bd3f-0f8f257169e5","resolution":{"observed_at":"2026-05-11T19:06:10.144628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.08873","last_updated":"2026-05-09T10:51:58Z","snapshot_observed_at":"2026-08-12T23:04:59.858122Z","submitted_at":"2026-05-09T10:51:58Z","title":"CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T00:59:44.364491Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.08873"},"observation_digest":"sha256:215aa65f6bf35590868ff2496cddc2aed6c3487f71c8fe12514449c288e8de33","observation_id":"da80c282-8fdb-4372-9e38-5bc65c867b1c","resolution":{"observed_at":"2026-05-12T08:31:26.475965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-08-15T23:09:32.166278Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:ddd6da1446c321738de5f0a6dbd60bd28475561ef15e72a7675f01ea91c84c28","observation_id":"d9bc6d0a-3e5d-4c4c-b93a-0a7c701686d0","resolution":{"observed_at":"2026-05-12T02:31:16.791011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.25183","last_updated":"2026-05-27T01:23:42Z","snapshot_observed_at":"2026-08-13T06:58:25.550814Z","submitted_at":"2026-05-24T17:23:41Z","title":"Knowledge Graph-Driven Expert-Level Reasoning for Neuroscience","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T11:36:03.804989Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.25183"},"observation_digest":"sha256:a036be2118bc4da94983d7ce040fa06e668e965a1bf35d8ee9696bb4f9024d81","observation_id":"a1e89810-fdcf-488f-9b69-72280cbe00b7","resolution":{"observed_at":"2026-06-30T11:44:38.725141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-08-20T08:59:49.978001Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:5611c303e5abcbd456aaba454de7ba6a581d82c2fb1213d40480c48d5c5b4637","observation_id":"a4ec028c-7bf4-477f-9a6d-f5b3532c8d46","resolution":{"observed_at":"2026-06-29T19:53:55.807528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":252,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:a860dc0e05929b592db8907bfe1c753e52b90ad71cd85dc6a318978b8b129b96","observation_id":"accc5c3e-6d9f-42cf-b194-b36f7fe05c6a","resolution":{"observed_at":"2026-07-01T20:56:13.635585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.03234","last_updated":"2026-06-02T06:51:15Z","snapshot_observed_at":"2026-08-15T10:07:50.406997Z","submitted_at":"2026-06-02T06:51:15Z","title":"Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:13:21.565082Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.03234"},"observation_digest":"sha256:ab603fbad577f977e9e76987dd21c692f30a0b1abf427ef0714040c8be3172da","observation_id":"459eabe6-40ea-4059-8e66-c0f25668fd16","resolution":{"observed_at":"2026-07-02T02:06:27.265290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.05606","last_updated":"2026-06-04T02:27:51Z","snapshot_observed_at":"2026-08-10T18:02:53.776353Z","submitted_at":"2026-06-04T02:27:51Z","title":"Cross-Epoch Adaptive Rollout Optimization for RL Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:32:07.961430Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.05606"},"observation_digest":"sha256:0e10829066d79ef9485c6dc38a249774194ca3ea482a564726663992d1aec269","observation_id":"9ddff3ca-dc50-4f7c-b576-9d6fc362d8ff","resolution":{"observed_at":"2026-07-02T12:06:55.809734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.10768","last_updated":"2026-06-09T12:21:27Z","snapshot_observed_at":"2026-08-13T03:49:52.489287Z","submitted_at":"2026-06-09T12:21:27Z","title":"N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T14:02:05.833651Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.10768"},"observation_digest":"sha256:3b163f3405b2c0146f4538128ba68935be7d5655edca13868ab415ecccc7927e","observation_id":"059fc053-6e17-4231-8f5c-9eb0a3866f2c","resolution":{"observed_at":"2026-07-03T04:17:37.320254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:53274f51faa45ea4f6da48d039dba3c745777799766e1b93303dbb4a731f8f5f","observation_id":"cd0bdc94-adc8-44e8-99f0-492753b6a445","resolution":{"observed_at":"2026-07-04T07:59:40.676004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-02T10:49:24.859537Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22629","last_updated":"2026-06-18T21:19:38Z","snapshot_observed_at":"2026-08-19T02:05:06.398311Z","submitted_at":"2026-06-18T21:19:38Z","title":"Masked Distillation: Internalizing the Chain-of-Thought in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:24.859537Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2607.22629"},"observation_digest":"sha256:3d9fd1d604f2f8903abea32c816db7f84d89d34e0aee3d49bc75a41d0998e935","observation_id":"769bde3a-c21a-4e9f-9df6-fd0c78feeab1","resolution":{"observed_at":"2026-08-02T10:49:24.859537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-08-10T04:59:13.695065Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07417","last_updated":"2026-08-07T17:02:02Z","snapshot_observed_at":"2026-08-20T22:05:48.969737Z","submitted_at":"2026-08-07T17:02:02Z","title":"I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T04:59:13.695065Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2608.07417"},"observation_digest":"sha256:02cf77c1ed30dc7ce41f70551abf562d895c0457da79670d1b4c0c176328b9c3","observation_id":"31e47036-5fe7-4a9e-afcb-100e785c55ca","resolution":{"observed_at":"2026-08-10T04:59:13.695065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09726/citation-record","integrity":"/paper/2508.09726/integrity","json":"/paper/2508.09726/citation-record.json","paper":"/paper/2508.09726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09717","last_updated":"2025-08-13T11:11:33Z","snapshot_observed_at":"2026-08-22T10:23:10.369030Z","submitted_at":"2025-08-13T11:11:33Z","title":"Multimodal Sheaf-based Network for Glioblastoma Molecular Subtype Prediction","version":1},"cited_work":{"arxiv_id":"2508.09717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09717","snapshot_observed_at":"2026-08-05T20:52:31.710479Z","title":"Multimodal Sheaf-based Network for Glioblastoma Molecular Subtype Prediction","venue":"cs.CV","work_id":"47e65b66-6846-47d7-93a2-c9fd2ee06837","year":2025},"citing_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:52:31.630467Z"},"links":{"cited_paper":"/paper/2508.09717","citing_paper":"/paper/2508.09726"},"observation_digest":"sha256:59d6f680cd8c3d4f60358003c83bf5a3e1e251dfa10926370bfcbed770d7d4c6","observation_id":"ef922b12-4e41-4768-bb96-cb30769cd74d","resolution":{"observed_at":"2026-08-05T20:52:31.742741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T02:41:33.705818Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning"},"reference_resolution":{"displayed":1,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":1},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 1 of 1 outbound references and 24 inbound Pith citation observations for arXiv:2508.09726."}