{"as_of":"2026-08-04T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0ab24bf35bbeb147508b2894fc742b35129f14b9f027bf48bff1f531ba3a785","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:19:22.140009Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:30:26.557823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:694b86fa88062da90000de6028c056ee55a949e0b123f99ea0a7159cf4aad989","observation_id":"2d8dbdd4-e35d-448a-9846-9108b89328fc","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-03T03:23:56.857266Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:8a0c4720a041caf988b3c11770fb21d61f652f51199088ca77a66456db907ca1","observation_id":"2f529aae-b5d1-4972-941d-275476032a54","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T11:02:41.335059Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2503.21620"},"observation_digest":"sha256:fca56bfc41f801c01fd186ae43653ff7213149056cf2962ead7588809e4c3423","observation_id":"1a32c312-b75e-4471-b2cd-b264538e1092","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-04T05:22:17.465931Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:0c119508c883940981877025f3daa35964045c6c7298d9a0a383d1057004273c","observation_id":"817ac0f4-1ee8-47a8-befb-7b032f40701f","resolution":{"observed_at":"2026-05-22T19:32:01.109400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2507.12549","last_updated":"2026-04-28T23:40:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-16T18:01:26Z","title":"The Serial Scaling Hypothesis","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-19T04:08:11.344622Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.12549"},"observation_digest":"sha256:c31e88491014e9a03ba5ca17c949402a3d1d7851ab4aec299583ad9cc06003e2","observation_id":"18446a07-4e0b-493c-94a6-4ccc267d50cc","resolution":{"observed_at":"2026-05-19T04:12:02.524975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2508.10164","last_updated":"2026-04-15T15:39:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-13T20:00:09Z","title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T22:26:52.748349Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2508.10164"},"observation_digest":"sha256:6c48d241f91f167954ee574615766ae1f8d5006eafad044cd2cfc004b67dabd7","observation_id":"1fd82ba4-ebcb-4b60-997f-7bf0b3e2a295","resolution":{"observed_at":"2026-05-18T22:31:53.193553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2509.05489","last_updated":"2026-04-16T20:13:16Z","snapshot_observed_at":"2026-07-06T22:24:51.648354Z","submitted_at":"2025-09-05T20:39:43Z","title":"Self-Aligned Reward: Towards Effective and Efficient Reasoners","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T18:27:23.076544Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2509.05489"},"observation_digest":"sha256:291dd36e5b0ea3117666431da783f5656086633ab0394c15b6a93628925f6996","observation_id":"b2ec4e48-900c-46f7-9d15-d3368ee9c60b","resolution":{"observed_at":"2026-05-18T18:31:44.558504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:a53a29839ae828512e7121a0f08dd7286a38a6b3580b3ddfde346984e5b630bf","observation_id":"1107291a-a3b1-42ef-968f-dd80ab2f007a","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-04T00:18:54.255096Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-04T00:18:47.262435Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.255096Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:fe7d034175e77cd6bb02264369826f38c271dd32e147fa51a6d29a6583ea5429","observation_id":"5aeae402-b595-4ac6-9205-079dbeecfc93","resolution":{"observed_at":"2026-08-04T00:18:54.255096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:016e5b04dc868e47e07032f0fc5f3d1052d86ef2f6471492ac6e71ac5ac55f95","observation_id":"ff693d59-b172-4e5b-a32a-fe37107681d4","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2601.05300","last_updated":"2026-05-04T11:14:47Z","snapshot_observed_at":"2026-08-03T03:42:08.545849Z","submitted_at":"2026-01-08T13:24:49Z","title":"TIME: Temporally Intelligent Meta-reasoning Engine for Context-Triggered Explicit Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T15:49:26.750021Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2601.05300"},"observation_digest":"sha256:8806c621a65d25337ee9af7793c5930344d846b7f2da6ecbefe58beed1abbb09","observation_id":"cd61e5c2-b858-4ead-b612-3acf27a2c984","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-03T08:09:47.113503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.18146","last_updated":"2026-07-16T10:27:29Z","snapshot_observed_at":"2026-08-03T08:09:41.690574Z","submitted_at":"2026-01-26T05:09:07Z","title":"Think When Needed: Model-Aware Reasoning Routing for LLM-based Ranking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T08:09:47.113503Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2601.18146"},"observation_digest":"sha256:2854144ba0d39402706d91e59c748b225aba7e5b823650bd886d452169c2dc97","observation_id":"c6678ef3-6f58-47d7-84ec-448e66f9b3fe","resolution":{"observed_at":"2026-08-03T08:09:47.113503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-03T05:43:52.654039Z","title":"and Welleck, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01472","last_updated":"2026-06-24T08:53:47Z","snapshot_observed_at":"2026-08-03T05:43:51.520535Z","submitted_at":"2026-02-01T22:31:19Z","title":"ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T05:43:52.654039Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2602.01472"},"observation_digest":"sha256:beb7abde7f77aa15cc37ab32060ef8bf47da81cd45c1f881013b69d64c6b6b9a","observation_id":"6924bb75-9a4e-4f58-9547-652c19bc877e","resolution":{"observed_at":"2026-08-03T05:43:52.654039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-03T04:17:27.149056Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-07-27T11:11:55Z","snapshot_observed_at":"2026-08-03T04:17:25.654898Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.149056Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:bfc6461088a3b2325b45459d6ca0c2a971fe5af27fd4a6801a04f0c644550ad5","observation_id":"1323ee15-722b-4546-b5d3-f3b96a4aae2a","resolution":{"observed_at":"2026-08-03T04:17:27.149056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-03T03:04:42.897700Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-03T07:10:48.024369Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.897700Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:777e6a947e74433c7cdfdd07dd801efacaeb4cedac74c61e7c0cecb377e819a5","observation_id":"1644e321-7682-4755-bb86-b97c71eed2ad","resolution":{"observed_at":"2026-08-03T03:04:42.897700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-07-15T14:32:24.776402Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T15:43:43.892684Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2603.05433"},"observation_digest":"sha256:8daf38dad2698420f0a7e2974784ea087149441ec3952a4ef8a96cf81796ca6b","observation_id":"2f59d64a-cd9f-4bd5-ae3a-7e17876ea507","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-02T12:55:23.015782Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:62fef890004085d5ea7493519b784bfbda30d66c836ab80c682b1b6bf165aef1","observation_id":"0c860a27-a842-400f-b339-ab2fce5648d3","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-03T10:51:29.519900Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:d35e91fbb2077b4710c77faf457e51556881a22d101cb5a89aa2a08b7cbc6cc8","observation_id":"d3c2db13-f82f-4ffc-8961-46c6d0502710","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-13T14:28:35.916911Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01301","last_updated":"2026-06-09T22:21:28Z","snapshot_observed_at":"2026-07-13T14:28:32.940454Z","submitted_at":"2026-04-01T18:05:32Z","title":"Numerically Optimizing Shortcuts to Adiabaticity: A Hybrid Control Strategy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T14:28:35.916911Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2604.01301"},"observation_digest":"sha256:b2627eb103093aadca90dbcd562661df982ca97202e938bc1f9956e7335a8a90","observation_id":"39be36f2-4c63-4c89-ba81-63a78e240b29","resolution":{"observed_at":"2026-07-13T14:28:35.916911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2604.04120","last_updated":"2026-04-05T13:43:12Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T13:43:12Z","title":"Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T17:16:47.284564Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2604.04120"},"observation_digest":"sha256:bafd93207add5532c6ccea58b26cd266ce23d01a1331fbd0831d0de80a11868e","observation_id":"40e3c3b6-7117-43ec-ba3a-ec6518019675","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2604.10034","last_updated":"2026-04-11T05:13:33Z","snapshot_observed_at":"2026-07-31T08:50:30.342805Z","submitted_at":"2026-04-11T05:13:33Z","title":"AI Achieves a Perfect LSAT Score","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:01.079284Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2604.10034"},"observation_digest":"sha256:5c36d069fe7a2d1f33e4a619782869f8cbb107cd289329d61c3828571adeabed","observation_id":"ae0c2924-0e93-4178-9fae-b430b5453e30","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:40ce21c5c040238d6c788f70acdf4686fe7d8461793135e946b71f25b4f7a0f0","observation_id":"9e3c924e-b2de-40c9-b9df-3535548e64b9","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.08221","last_updated":"2026-05-06T13:58:55Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T13:58:55Z","title":"NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:40.815981Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.08221"},"observation_digest":"sha256:b8a3a76b51d4c0176be159f2cfb63dc8274d27656153726d2fb1c10d2dda0818","observation_id":"fffc6d1a-6ad4-448b-88b6-d16ea9b7d2f2","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.08776","last_updated":"2026-05-09T08:04:47Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T08:04:47Z","title":"Reasoning Compression with Mixed-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:29:02.387691Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.08776"},"observation_digest":"sha256:56bd6eeba0240527e3b2bca2af3b0f55aae5d12ad1c08754f85974d762c17539","observation_id":"803a5ec3-ef33-4874-93f2-2af4b5f69543","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:3632eeca651250297b3df9f16ec3a34382de246de8e713a87e58245cc2a60915","observation_id":"df7b3897-72d3-407c-ae08-636e4bc3c5c5","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.11625","last_updated":"2026-05-12T06:51:31Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:51:31Z","title":"Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:21.377700Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.11625"},"observation_digest":"sha256:b7be4be2e41160dbd37c1e32bcfc7d3f8f60bd5e232a13263ff69eee64e93ced","observation_id":"aca0d2ea-0c44-49e1-b212-ddc0ad5e0407","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.13165","last_updated":"2026-05-13T08:28:05Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:28:05Z","title":"STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-14T19:25:07.440630Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.13165"},"observation_digest":"sha256:7c72c7ac6407d0ec1fab162773ba131bbfa581fb6701468526c06a89392fa285","observation_id":"5a6d6e28-7551-4c74-8fea-92619d3c1a59","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.13641","last_updated":"2026-05-13T15:05:18Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:05:18Z","title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T19:24:05.375951Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.13641"},"observation_digest":"sha256:a22dfb34da4dd389fc14ec266b3073378026b8d8209a6604a8adf6ab4cadd4fd","observation_id":"023a4cb0-f4b3-4b31-bb7f-d58fe5f2b03a","resolution":{"observed_at":"2026-05-18T00:19:22.325854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:99b67de928407ba2d58e78590c8c0368d096e3d4ed434e76dee4cbd7af595c2b","observation_id":"d78ba50b-a751-4e15-abc0-ebbc5afdbf05","resolution":{"observed_at":"2026-05-20T06:43:05.918289Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.21463","last_updated":"2026-05-20T17:51:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T17:51:05Z","title":"Mem-$\\pi$: Adaptive Memory through Learning When and What to Generate","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T04:27:25.041652Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.21463"},"observation_digest":"sha256:3e7296e32e45e7b94d823748707c34bce757b2300383ee9f3974ee2455b40fd4","observation_id":"312bb44a-2a3e-4037-8b2b-3602306f0a2f","resolution":{"observed_at":"2026-05-21T04:29:34.591072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.22138","last_updated":"2026-05-21T08:11:54Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:11:54Z","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T06:33:36.846345Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.22138"},"observation_digest":"sha256:68a6bdd2670b98b1b80e7ec2a367e4e515a821a4ec4b935b52f8e5f4c9fa0ac4","observation_id":"f2b77133-3e36-4d22-a3b9-9d75b5f433a2","resolution":{"observed_at":"2026-05-22T06:34:41.019224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:5f0221b400190dc75534c775f99558ad18753334aff64556e77058131aa7d79d","observation_id":"696136e2-793a-455b-b747-29311ac43f46","resolution":{"observed_at":"2026-05-22T05:51:08.252527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.23926","last_updated":"2026-04-21T05:32:02Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-04-21T05:32:02Z","title":"How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-05T10:18:18.717871Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.23926"},"observation_digest":"sha256:d072b3b3a7d72b6d89dd130794aa34dc20c32297c03f6c9e98a1bbb3a1c784e9","observation_id":"0c77cd8e-4cbd-49a9-9019-d8dfe8a8da12","resolution":{"observed_at":"2026-07-05T10:20:57.261652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.25443","last_updated":"2026-05-25T05:42:57Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T05:42:57Z","title":"Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T22:18:10.508034Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.25443"},"observation_digest":"sha256:5ad888fd41f411b85d55e9ff44a37393b02c4d60dc1b5701b31bd5e37ec7c285","observation_id":"f264eb7c-f68a-442e-a821-c30051363312","resolution":{"observed_at":"2026-06-29T22:24:00.390648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.25604","last_updated":"2026-05-25T08:55:16Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:55:16Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T21:29:31.723326Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.25604"},"observation_digest":"sha256:1a16b51d831c22b9e2c39698e11b952dfa34a0eed448c67804862728548ac26d","observation_id":"f89ebc58-fb66-410a-a04a-f1c084358a2c","resolution":{"observed_at":"2026-06-29T21:33:59.247448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.25745","last_updated":"2026-05-25T11:57:09Z","snapshot_observed_at":"2026-08-01T16:24:25.899006Z","submitted_at":"2026-05-25T11:57:09Z","title":"Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T21:42:08.610000Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.25745"},"observation_digest":"sha256:75407dae6f8a1d247eae70536dd65918ebdf08a20336d95261be6d396e00169d","observation_id":"0fe43f3e-450b-47fe-9999-357dd4ae2610","resolution":{"observed_at":"2026-06-29T21:43:59.086669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2605.30832","last_updated":"2026-05-29T04:37:49Z","snapshot_observed_at":"2026-07-06T23:40:03.151978Z","submitted_at":"2026-05-29T04:37:49Z","title":"SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:27:30.783923Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2605.30832"},"observation_digest":"sha256:84f04604e054467321b663efbb9cac27a370fc7813abc74be33b1231bbde9578","observation_id":"bcb92eb5-13f0-4a01-bddd-76825724e788","resolution":{"observed_at":"2026-06-28T22:32:44.430054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":245,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:4ed9f580a2a3127d4a71fc622ac3fe9dd590d64d2f5d8cabe3a6894220b0d2ec","observation_id":"1a962ff9-7b82-4e6a-acc6-3009f4b6c7ae","resolution":{"observed_at":"2026-07-01T20:56:13.617303Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.01532","last_updated":"2026-06-02T03:44:54Z","snapshot_observed_at":"2026-08-02T09:06:49.074757Z","submitted_at":"2026-06-01T01:28:42Z","title":"Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-28T15:48:48.046003Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.01532"},"observation_digest":"sha256:38159ca0b9b6c8a47c8a7642e720bdb81262e62cf58ed092db3fa676925c610e","observation_id":"7ffc2a5e-d264-46fb-b4b3-cd022fbf7bae","resolution":{"observed_at":"2026-07-01T22:06:16.189252Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.02871","last_updated":"2026-06-01T20:36:06Z","snapshot_observed_at":"2026-07-06T23:43:12.737017Z","submitted_at":"2026-06-01T20:36:06Z","title":"Adaptive Latent Agentic Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T14:24:22.855486Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.02871"},"observation_digest":"sha256:16e26e8a17c32b4fa5f2f3e946809148dd5f201c76b70c0444d709eae31b2ec1","observation_id":"27c7c1cc-dd59-47ac-8d31-8150c27874e9","resolution":{"observed_at":"2026-07-01T23:26:22.290730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.03102","last_updated":"2026-06-02T03:42:04Z","snapshot_observed_at":"2026-08-03T04:21:57.609394Z","submitted_at":"2026-06-02T03:42:04Z","title":"Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-06-28T10:25:10.559953Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.03102"},"observation_digest":"sha256:a1c2fa8ab8253b305c0017bf86c733aee91414aaaf853442e5fa61be18d5ca6e","observation_id":"da594ade-0083-4092-aa11-9d7cec5744ae","resolution":{"observed_at":"2026-07-02T02:56:29.846576Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:ab5f2f9bf2b0d78e070b0ec2d25402b238a67ac0ba48e7879c990c56d270f593","observation_id":"6a17d518-577d-485f-93ec-a358ec9531a0","resolution":{"observed_at":"2026-07-02T03:26:28.727043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.07074","last_updated":"2026-06-05T09:10:50Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:10:50Z","title":"SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T22:54:44.329613Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.07074"},"observation_digest":"sha256:f4ca7937d5ab38b5718cb2092fa741b77981297b94367b2aca37e576a752fed5","observation_id":"a9b2f759-910e-4fb0-a6a8-1ff9d0254e77","resolution":{"observed_at":"2026-07-02T16:17:08.734755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:a555a5c2fbbd1171cc2220ea2833e8834f7620a4115a615c920332f24ce092f2","observation_id":"ede45ea7-fef4-4441-b872-83bbe816f0e5","resolution":{"observed_at":"2026-07-04T07:59:40.641042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:47b24c4ea351c0cd92125eae050353db37fee17d8369d69009775a306870d009","observation_id":"fbabde79-d719-4723-9e30-c79d3e012503","resolution":{"observed_at":"2026-07-04T09:19:43.895953Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.26463","last_updated":"2026-06-27T05:05:34Z","snapshot_observed_at":"2026-08-03T01:41:10.487866Z","submitted_at":"2026-06-24T23:55:15Z","title":"Finding the Time to Think: Learning Planning Budgets in Real-Time RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:08:19.504454Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.26463"},"observation_digest":"sha256:330167e4e4eb248329aefddf80d3bef42e867f20db79e482b9312e3d51131dea","observation_id":"e700ee3d-95c6-466e-b68e-4c00cc452bf3","resolution":{"observed_at":"2026-07-04T13:29:51.940709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.26463","last_updated":"2026-06-27T05:05:34Z","snapshot_observed_at":"2026-08-03T01:41:10.487866Z","submitted_at":"2026-06-24T23:55:15Z","title":"Finding the Time to Think: Learning Planning Budgets in Real-Time RL","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T09:26:31.944405Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.26463"},"observation_digest":"sha256:c6fb82aaaac64f59053150d1368922200e529771dad65d07f84c1a041d660469","observation_id":"88044151-cb10-4bd7-91d0-dd242c5ba572","resolution":{"observed_at":"2026-06-30T09:34:34.913753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.31580","last_updated":"2026-06-30T12:35:48Z","snapshot_observed_at":"2026-07-30T06:10:13.388285Z","submitted_at":"2026-06-30T12:35:48Z","title":"LASER: Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T03:07:28.653313Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.31580"},"observation_digest":"sha256:01505e873fdb2b13505604309b245cd2306e14273e96d66aafde2d9d81d6876d","observation_id":"4ea7314e-e216-4389-88cf-15489acf6310","resolution":{"observed_at":"2026-07-01T11:55:43.672011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2607.00862","last_updated":"2026-07-01T12:27:14Z","snapshot_observed_at":"2026-08-02T04:50:53.247552Z","submitted_at":"2026-07-01T12:27:14Z","title":"CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-02T13:22:27.566432Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.00862"},"observation_digest":"sha256:3ca48ea377e6f8da4a3312ad91338bd20650f3d5b240c112f0da55c264537c10","observation_id":"3b3ce192-d2c2-4d9e-a1a7-9850e6fcaf07","resolution":{"observed_at":"2026-07-02T13:26:58.146529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2503.04697 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-03T04:57:20.508738Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4b668dd4e8440b3d4a9053d601f631f0dc8506f0a2bf0b31b6e5ec45bbd85865","observation_id":"fc8a6eaa-0aec-49cf-8452-22b4f1c2fea2","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2607.07690","last_updated":"2026-07-08T17:49:14Z","snapshot_observed_at":"2026-08-03T14:09:50.236027Z","submitted_at":"2026-07-08T17:49:14Z","title":"Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T02:29:12.366018Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.07690"},"observation_digest":"sha256:f230b56d3a629ecdb4425b458daf3f6114551b911dbf997ca7573c5ebd21f28b","observation_id":"f0f61310-7bfc-4e5a-98d5-f0c3f2e26e29","resolution":{"observed_at":"2026-07-09T02:35:53.844868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-14T15:45:54.532529Z","title":"L1 : Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-04T05:27:19.005783Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T15:45:54.532529Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:1d9fb4cea347848cd33eab4a3f559b34bf2cb55036b6e51049b881e9a5917a6a","observation_id":"e2a4b3ad-323c-44bc-a3c7-dcde0069c807","resolution":{"observed_at":"2026-07-14T15:45:54.532529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-02T08:06:10.752086Z","title":"L1 : Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-04T05:27:19.005783Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T08:06:10.752086Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:a16d1691f205a1547e8c9cad12d831a4af2a403ae272dbc9aea8ad98df849071","observation_id":"4c5c03a6-9d1f-48da-8fd4-5589d1c98456","resolution":{"observed_at":"2026-08-02T08:06:10.752086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-04T04:30:26.557823Z","title":"L1 : Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-04T05:27:19.005783Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:26.557823Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:f7bb3498631180991e8c845a02e133841a7c27742011aad1aef6a84e913720ab","observation_id":"97701c45-53b2-43a6-a8f8-5ae87c201e40","resolution":{"observed_at":"2026-08-04T04:30:26.557823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-01T22:30:26.382580Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15736","last_updated":"2026-07-17T08:15:35Z","snapshot_observed_at":"2026-08-03T03:41:46.829412Z","submitted_at":"2026-07-17T08:15:35Z","title":"Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T22:30:26.382580Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.15736"},"observation_digest":"sha256:6679d67807a2cc2e2fcdc76af5758a5f2299f52438eb78c7cf4a7e602f85655f","observation_id":"4ca6bead-6994-420f-a141-59d3a0c82426","resolution":{"observed_at":"2026-08-01T22:30:26.382580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-01T18:49:25.932836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17188","last_updated":"2026-07-19T11:00:59Z","snapshot_observed_at":"2026-08-01T18:49:24.925518Z","submitted_at":"2026-07-19T11:00:59Z","title":"Is Your Model Thinking or Just Stagnating? PUMA: Diagnosing Reasoning Pathology via Phase-Momentum Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:49:25.932836Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.17188"},"observation_digest":"sha256:8f91699f85a60ef60af47c080e12ce7a4a004209967343d7e31a7e4a87e25835","observation_id":"41008c75-52f7-41f4-80a7-895bdf913391","resolution":{"observed_at":"2026-08-01T18:49:25.932836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-02T12:48:50.195619Z","title":"arXiv:2503.04697 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19358","last_updated":"2026-05-29T03:05:29Z","snapshot_observed_at":"2026-08-02T21:18:00.004024Z","submitted_at":"2026-05-29T03:05:29Z","title":"LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T12:48:50.195619Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.19358"},"observation_digest":"sha256:2471d491f3c5a59ba8b7c429fdeb166d39b143c94ef62b37b1a50f3cb2933834","observation_id":"87a3a126-65b9-4054-bf34-fadf898fb3d6","resolution":{"observed_at":"2026-08-02T12:48:50.195619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-02T10:49:22.213737Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22629","last_updated":"2026-06-18T21:19:38Z","snapshot_observed_at":"2026-08-04T03:42:49.281362Z","submitted_at":"2026-06-18T21:19:38Z","title":"Masked Distillation: Internalizing the Chain-of-Thought in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:22.213737Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.22629"},"observation_digest":"sha256:f4bd41834fa6c189bab8726af48187dca779f224e40816881a770c4949f26566","observation_id":"d07c7f28-408c-4824-8cbd-92ddd48df36d","resolution":{"observed_at":"2026-08-02T10:49:22.213737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-01T00:28:58.772850Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-01T23:34:12.781091Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.772850Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:164e9794868786a8f96fb24cf52f39e72c7e17e561e1dcc668861e9aabf03d3f","observation_id":"f23f478a-906b-4dba-8968-13c4034c7211","resolution":{"observed_at":"2026-08-01T00:28:58.772850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.04697/citation-record","integrity":"/paper/2503.04697/integrity","json":"/paper/2503.04697/citation-record.json","paper":"/paper/2503.04697"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let‘s sample step by step: Adaptive-consistency for efficient reasoning and coding with LLMs","venue":null,"work_id":"9d63d9c6-8835-4890-92f7-f325536277c9","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:d3d656304275235694281605efc2a907fdf9278fbc12a83b4d269f61f45c091d","observation_id":"4fa81d11-7996-46ed-8743-588e7aa90531","resolution":{"observed_at":"2026-05-18T00:19:22.324673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.761","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:40.713551Z","title":"doi: 10.18653/v1/2023.emnlp-main.761","venue":null,"work_id":"625824ce-0fc5-4de5-8dcd-265ca8b9e51f","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:1ddaa61406bfda3acaccad51403fc400ac280af9b47bddd62376a366d7750490","observation_id":"bb9e500a-512d-4bcd-90f5-e9a1159aa4cc","resolution":{"observed_at":"2026-05-18T00:19:22.166445Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04463","doi":"10.48550/arxiv.2502.04463","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Training language models to reason efficiently","venue":null,"work_id":"ddc0d049-f0ca-4946-aa25-6843f6072e08","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:3a8a3b4657f210413085fcf6c5fe50b302107aa0a2dc5b67e38d9c1bd72c4b19","observation_id":"0175b9e3-d0be-475d-a0ba-0bfcab57c2ae","resolution":{"observed_at":"2026-05-18T00:19:22.181628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11937","last_updated":"2024-12-16T16:22:27Z","snapshot_observed_at":"2026-08-04T00:02:17.499163Z","submitted_at":"2024-12-16T16:22:27Z","title":"Precise Length Control in Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.11937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11937","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xingyu Chen, Jiahao Xu, Tian Liang, Zhiwei He, Jianhui Pang, Dian Yu, Linfeng Song, Qiuzhi Liu, Mengfei Zhou, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, and Dong Yu","venue":null,"work_id":"8705f307-3325-4df8-abe7-9c4ce8dfb7af","year":null},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2412.11937","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:d93254921dcd3bfd9afc768573a4bf0d2ad42398ceac1eb6e053e5d300eb0650","observation_id":"8457cd01-76f5-4779-8d85-06dfbc2b3392","resolution":{"observed_at":"2026-05-18T00:19:22.190910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2412.21187","doi":"10.48550/arxiv.2412.21187","metadata_source":"pith","pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-07-10T11:37:03.272167Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","venue":"cs.CL","work_id":"d79f8b7d-560d-4fbd-bd70-4d084f6d9ad6","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:637dde53cb2ccc9d70c6187b683fb634321a200ed33cc5ca8ef5bc36dff6fcfa","observation_id":"693e5b07-7cca-48f0-b816-fb3b36404d09","resolution":{"observed_at":"2026-05-18T00:19:22.196152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:22dc6f3fd000ee9f5fad35da059b2a0070b8a64cab354b9ac8fbdf85ff8c9ccf","observation_id":"1dd3c76e-bd63-468f-9143-dfa452f4a92c","resolution":{"observed_at":"2026-05-18T00:19:22.201688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-02T10:35:57.002867Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:daaaa9bed7a3272b2e7ddd2b427d8584d94cde9b228010b22f992ce343a6878d","observation_id":"906baf4e-c8d2-41ed-9100-66a0d22d47f7","resolution":{"observed_at":"2026-05-18T00:19:22.206556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:c5b69d1bc8587f0c69f98a5401f3e1b0ae6311e09946dc553ce2c90d1bb1980f","observation_id":"ca3a1670-4346-4d94-9258-7c191e6aa7e9","resolution":{"observed_at":"2026-05-18T00:19:22.211767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T01:08:06.256034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":"2303.17651","doi":"10.1007/s10664-008-","metadata_source":"pith","pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":"cs.CL","work_id":"59181e7f-e58e-45d3-8146-4477a9f53d5a","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:24c90773a3781a1b6bdea73f6e3137e921c5747d6ffbc5fd89f38fa623c62b1c","observation_id":"f679074e-85d3-4ca5-9804-e9bb25ce8be0","resolution":{"observed_at":"2026-05-18T00:19:22.216675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":"2412.09413","doi":"10.48550/arxiv.2412.09413","metadata_source":"pith","pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","venue":"cs.AI","work_id":"c917c167-9618-4111-9a7c-fb60c4fc7795","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:519f53eac9363d3936c6b870a15cf5a17119bc12c34fdc1f4a46aca3d79c58f4","observation_id":"970e4475-3336-4207-bfad-bb842a42f4d7","resolution":{"observed_at":"2026-05-18T00:35:31.553327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Cand`es, and Tatsunori Hashimoto","venue":null,"work_id":"6eac46db-800e-491a-8660-4d121e772e66","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:c1b588051987c0ee00e540fb1ebd7daa496a51c19cac313cc24654d8a9b50fac","observation_id":"b03cabc5-fb79-45e5-b738-f67594039a59","resolution":{"observed_at":"2026-05-18T00:19:22.309637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:4737cd8c4e20ff6a1b526d52a711d69a7d6ece1000ebbea3172078a4f8f99652","observation_id":"6889fe3d-f329-40cc-ad02-9442b8617701","resolution":{"observed_at":"2026-05-18T00:19:22.227539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:1e055fe2338cac6b95edfe551d1fddc92b0101c123f3b83872b8ac1cd59bad38","observation_id":"51bca921-17ac-442e-a70b-b5b802bdf172","resolution":{"observed_at":"2026-05-18T00:19:22.234153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-02T23:46:38.854124Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-10T14:47:14.590391Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:64f32b0c32fc8eea6faebb28db9ad634a18b792d80ea1a71333528298b98c4ac","observation_id":"f6542abc-4698-49bf-908a-6df105a069b8","resolution":{"observed_at":"2026-05-18T00:19:22.241234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:3c3e265776b6e4b01fe2bc133e6d6bd32bffacf70bd5686089460fc21cef591f","observation_id":"ca35c44e-b644-488a-abf7-f99c6e96115a","resolution":{"observed_at":"2026-05-18T00:19:22.247265Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":"2310.03716","doi":"10.48550/arxiv.2310.03716","metadata_source":"pith","pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A long way to go: Investigating length correlations in rlhf","venue":"cs.CL","work_id":"23d0dfe6-c919-4498-8696-1e298c7834e9","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:f2ea849b3a1bb7eb5e7f011813f759fddce976c744b22204996c3983ee141ee9","observation_id":"b57e7a6a-64d3-4f8a-b014-b0291c7ecc5c","resolution":{"observed_at":"2026-05-18T00:19:22.253420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:21.130019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:3ea41a0d6472291f2d8a90a1ddfd0e29e88812c677552018db81322514e109f7","observation_id":"b9360124-0598-4a90-8084-6954ed8f2422","resolution":{"observed_at":"2026-05-18T00:19:22.259367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:2f57f6983696544e14950a34535f009edbdf40427fce9cebffbce2fb638391a6","observation_id":"36eda330-1dec-4839-b241-50e9e4941b91","resolution":{"observed_at":"2026-05-18T00:19:22.263660Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-07-06T20:28:33.378335Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2501.18585","doi":"10.48550/arxiv.2501.18585","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms","venue":null,"work_id":"9e77f92a-cc32-432e-b16d-26706ae03f03","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:63c7a898ad5152beb21542c80b4d273a5b7944d934220acf80aa98862edbbcba","observation_id":"c1ca1916-90d6-425e-9400-bf4524171c3a","resolution":{"observed_at":"2026-05-18T00:19:22.271647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:5dcb392498196fae0b0300d8556c6114edc721610c923068f0b1d029d595c93f","observation_id":"293b0fbd-a5c3-4c8b-891c-47ef59a14796","resolution":{"observed_at":"2026-05-18T00:19:22.277539Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T01:08:13.648188+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":"2408.00724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-07-04T11:09:46.442555Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","venue":"cs.AI","work_id":"cef2c407-5d51-46a9-8eb6-f382b419502e","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:b7a57d497d950f04f8d1e7ba9bbf58c338b865029d61d19672f94d2b309ab8c5","observation_id":"758d6a05-6046-44ac-83b5-af68e33c09c1","resolution":{"observed_at":"2026-05-18T06:38:37.536547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08152","last_updated":"2024-08-15T13:40:03Z","snapshot_observed_at":"2026-07-06T19:01:06.124684Z","submitted_at":"2024-08-15T13:40:03Z","title":"DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search","version":1},"cited_work":{"arxiv_id":"2408.08152","doi":"10.48550/arxiv.2408.08152","metadata_source":"pith","pith_arxiv_id":"2408.08152","snapshot_observed_at":"2026-07-10T18:17:33.833710Z","title":"Deepseek-prover-v1","venue":"cs.CL","work_id":"55434196-a74f-4c2f-bdad-e1c22de14f3b","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2408.08152","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:bd6eee2209f98d414cd0842ae47bf17bce1a524e3450896db417d23320af6ecf","observation_id":"2be1dd12-3a24-4ba3-bc55-51dda81dff4c","resolution":{"observed_at":"2026-05-18T00:19:22.290253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-14T11:49:49.279756+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T11:49:49.279756+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.10601","doi":"10.48550/arxiv.2305.10601","metadata_source":"pith","pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":"cs.CL","work_id":"07adb06e-4ed5-4ec5-a7ae-ff288fd214fb","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:5bf7c31e5131e437144a4a8b54738d500b3a8fbcbe95e7caa20939c49d2001fa","observation_id":"12234fc8-e450-4c76-b010-59c7d10c6538","resolution":{"observed_at":"2026-05-18T00:19:22.300226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T01:08:14.037057+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17744","last_updated":"2024-06-25T17:29:52Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:29:52Z","title":"Following Length Constraints in Instructions","version":1},"cited_work":{"arxiv_id":"2406.17744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17744","snapshot_observed_at":"2026-07-04T09:59:44.716297Z","title":"Wanjun Zhong, Ruixiang Cui, Yiduo Guo, Yaobo Liang, Shuai Lu, Yanlin Wang, Amin Saied, Weizhu Chen, and Nan Duan","venue":null,"work_id":"76d73728-cebe-4afe-afe4-f5aaf1255e65","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2406.17744","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:5c994812cad81e0c7c3793fd65c5e1f22cac9892b4be297d19de577dba12e34b","observation_id":"1d7e3f5f-15e0-41f1-bb05-ad519c6b1cbb","resolution":{"observed_at":"2026-05-18T00:19:22.295347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:f9b68a96095f65bac2de192a3a7677dd4061bd56c24d78e07a91090079c7b15d","observation_id":"16882dc6-a0b9-46f2-89f8-3a2bbe4acf2b","resolution":{"observed_at":"2026-05-18T00:19:22.173928Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f7d5896-3ba1-44c3-b715-60a2c880a7ef","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:944a87a3c4ff4bf7d5ca066c76486b2d58bc07b4775b291c831ca229b5ee7304","observation_id":"9958e3e8-5516-4bad-a013-495a4c099ce4","resolution":{"observed_at":"2026-05-18T00:19:22.313163Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8b0bdf66-f596-471c-ac4c-886b939ca523","year":2048},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:cad94cc3ba406c90bdfac75a392e4b10cf1f1bec7ab5e0187c01b83be42f7df9","observation_id":"22f01b3f-12f3-42f8-b33d-5fc46c21dac5","resolution":{"observed_at":"2026-05-18T00:19:22.317336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"These results highlight the effectiveness and potential of LCPO to scale to even larger reasoning models","venue":null,"work_id":"811e7579-b5ac-470f-8ded-a52473de8312","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:7f101e523438a40edfedfe304fa3fa0c87660a0096c60b7b6e71214563bebab1","observation_id":"4faff704-0b5c-4030-bbd5-fe6f709c50ef","resolution":{"observed_at":"2026-05-18T00:19:22.320897Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thus, the maximum real part is approximately 625.6","venue":null,"work_id":"4e1c6e1b-18f6-4779-a2da-5c6b4f873b4a","year":2025},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:01fb666303189cd80939a08ef79a1a07088a3fecca35807305d5842683ad86e4","observation_id":"e9e9129a-40a4-46fb-b373-6b9e9ab6df1b","resolution":{"observed_at":"2026-05-18T00:19:22.304302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":3,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 59 inbound Pith citation observations for arXiv:2503.04697."}