{"as_of":"2026-08-05T01:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b49264b405ebd5c46744aa072a70f73ec4a77dd811662cbb41088b12b5f8a221","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T01:19:55.164835Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:56:14.756026Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T23:56:15.159436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"cited_work":{"arxiv_id":"2606.17890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17890","snapshot_observed_at":"2026-08-04T23:56:15.159436Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","venue":"cs.CL","work_id":"63d34398-fe42-49ab-8915-97a0072a95a5","year":2026},"citing_paper":{"arxiv_id":"2608.01630","last_updated":"2026-08-03T03:00:43Z","snapshot_observed_at":"2026-08-05T00:31:44.634942Z","submitted_at":"2026-08-03T03:00:43Z","title":"RING: Retrieval-Internalized Generation for Continual Large-Scale Knowledge Injection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T23:56:14.756026Z"},"links":{"cited_paper":"/paper/2606.17890","citing_paper":"/paper/2608.01630"},"observation_digest":"sha256:964196a53bddd3fb97898229beabfc4be5207ec8ebfb0e0ed0cc8a630a205f5a","observation_id":"f9291e07-7c74-4341-85ae-c0dbfef7462e","resolution":{"observed_at":"2026-08-04T23:56:15.163187Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.17890/citation-record","integrity":"/paper/2606.17890/integrity","json":"/paper/2606.17890/citation-record.json","paper":"/paper/2606.17890"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:1b1627a0b6de0545d8ce4d88836d09532de12cb48f8699efc6857c229522ad4c","observation_id":"19af4c52-33ce-42b9-81b5-cde8d0740526","resolution":{"observed_at":"2026-06-27T01:20:20.417002Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:be7876ad102768fe188dc0edbf828fdafa228db4930fa363fccc5ed0aa21dfda","observation_id":"dad79881-0cd5-4ff8-8ac1-4679e8b2ec71","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:beda487b0ff230fdd23ee0e59287a116371762dfb7a1910ebbac7e32f1fd4455","observation_id":"4e825fd0-57ff-4e37-925d-a85ebce1b320","resolution":{"observed_at":"2026-06-27T01:20:20.466847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:9be4cb4e3309d2c3caf73bc71d2ef79f102902efb8620ae7e949a42c09fdfbc1","observation_id":"1a824276-315b-4efa-821d-de3b518bc006","resolution":{"observed_at":"2026-07-03T20:28:55.672673Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"2025 , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:d00eaa3fcbb099a967d8cdf7c5ae6167b7a84a05fa805136ab9ca8ffa2f7e540","observation_id":"f026f964-c5be-4ae9-a483-802765abe360","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":"2503.24235","doi":"10.48550/arxiv.2503.24235","metadata_source":"pith","pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","venue":"cs.CL","work_id":"d4eaadf8-a3c6-4eee-98fb-1b337dd42e2d","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:195c9daf580d7dbb3106ec764f5997547e05c095d5362bb2070d58aa5c52c5eb","observation_id":"8eb7da15-fae3-4903-99e1-a21da45fda28","resolution":{"observed_at":"2026-06-27T01:20:20.424956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":"2502.17419","doi":"10.48550/arxiv.2502.17419","metadata_source":"pith","pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","venue":"cs.AI","work_id":"67495af7-38a4-40b1-bd10-fd9d939c7abd","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:6a0fce4aff6a9dc29bb4eb67c2d2313d3382a224397f8d7ffaea37a4b496350e","observation_id":"9cde0d36-7585-4f9a-a4ab-d2b522e4f35a","resolution":{"observed_at":"2026-06-27T01:20:20.479970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Stop Overthinking:","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:76684b274e5449872ca230982703bad59da187295c6701a4adba2a48ffe55296","observation_id":"3baafb09-be1c-4d2a-9faf-7491f3bf1ee3","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24377","last_updated":"2025-03-31T17:58:07Z","snapshot_observed_at":"2026-08-03T14:46:00.668771Z","submitted_at":"2025-03-31T17:58:07Z","title":"Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.24377","doi":"10.48550/arxiv.2503.24377","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.24377","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2503.24377 , year=","venue":null,"work_id":"7a35731d-66ee-4074-8f61-ada405088e32","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2503.24377","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:eca48d3676e7de1e76a715f44e1114d5dcaaa9a5d87bdb78978f041dbe1c6f72","observation_id":"e1e0ba81-caca-453c-8cbb-93274f58aa9d","resolution":{"observed_at":"2026-06-27T01:20:20.407741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06023","last_updated":"2024-07-24T18:40:36Z","snapshot_observed_at":"2026-07-31T10:52:02.949801Z","submitted_at":"2024-07-08T15:17:46Z","title":"Distilling System 2 into System 1","version":3},"cited_work":{"arxiv_id":"2407.06023","doi":"10.48550/arxiv.2407.06023","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06023","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Distilling system 2 into system 1","venue":null,"work_id":"4f8d3ad5-1b0a-45d2-83fa-622fcc28e3a9","year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2407.06023","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:a5d9587d8a8ca9798b1e149577926424f0d33a8aa6d8c4c848144438df605af6","observation_id":"b962f982-3edd-4d66-9356-c796f94b344b","resolution":{"observed_at":"2026-06-27T01:20:20.448324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i23.34608","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:11:30.065109Z","title":"AAAI-25, Sponsored by the Association for the Advancement of Artificial Intelligence, February 25 - March 4, 2025, Philadelphia, PA,","venue":null,"work_id":"5414a5d9-4c2c-4505-aa2c-a4cd03a90804","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:315876378dce65544028b0ffaa873eddd428194069216480b6a0b37d65629387","observation_id":"928c4a76-0e7a-4c4e-9943-a38a3637f8cd","resolution":{"observed_at":"2026-06-27T01:20:20.419589Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , year =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:108abe6754f2d3872c60a9af33195b2aa9db42773adcd54731770919ada2c151","observation_id":"7b2357ed-6a3c-403f-aeeb-0b8233a6b20c","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:810e99adb3dcdad234921ef0001c36a9d1c59b99b3fa8bc281735e470aef216a","observation_id":"5368e969-2474-456d-a6cc-5d5eab2a9724","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Can Language Models Learn to Skip Steps? , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:86a0b468750781d379a725bf919e5384dc6851b5c9ba86441dc923667833e3dc","observation_id":"b64f57a9-5df5-45d7-8af4-5ffd85f7e1db","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:fcf965aa910125219332d808d2e7fcf36e29cdc11577793f12c8043e16300c81","observation_id":"051c7cd6-0507-4e99-b240-0c40e6847112","resolution":{"observed_at":"2026-06-27T01:20:20.458337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":"2501.12570","doi":"10.48550/arxiv.2501.12570","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":"133f3b9f-d49a-46dd-9844-40063846c9ee","year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:f538c3067fc96eedd90afc4114537dc77f0bcdb7b11ee05201d7b4d162e122c4","observation_id":"66a84732-3d1d-47bf-abed-772c10a71ce1","resolution":{"observed_at":"2026-06-27T01:20:20.477310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Second Conference on Language Modeling , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:23a7454a5b22cb915e9b2089835bd17ad9684723abc81ba5373f5e639bce9e4d","observation_id":"10b2fc23-8611-434a-9926-6419f25d6a85","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Weston and Yuandong Tian , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:cc11c9a5909da20c961b26daa1fa751cab7022495b6e6481e5d16d3edec9cf64","observation_id":"fc63ee45-7a8f-497a-9280-54a85dfc5e07","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , year =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:8738a47d604b2d56e47e01a68ad83200608e5cf479e4b6c4ac9045b87645fd3d","observation_id":"3b74bfb3-6c72-490d-975d-c86454c660e4","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13171","last_updated":"2024-12-17T18:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-17T18:50:33Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","version":1},"cited_work":{"arxiv_id":"2412.13171","doi":"10.48550/arxiv.2412.13171","metadata_source":"pith","pith_arxiv_id":"2412.13171","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","venue":"cs.CL","work_id":"5d72fcbb-d14d-4ac0-8644-50807a64d543","year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2412.13171","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:2b1c08af28b0b9f38ef2044a1a656f04530291eaf9749f4bf8c82be2b6f937e5","observation_id":"34908b32-4c0c-4a7a-a55f-972cf9fe749f","resolution":{"observed_at":"2026-06-27T01:20:20.488804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:538f21484811c9484273c74cee6f25dac06553d484cfd1a7ba8de5a7c4cef0aa","observation_id":"78ceec20-2394-4e8b-8ef6-c20aa9a7a53b","resolution":{"observed_at":"2026-06-27T01:20:20.472173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.1274","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T06:45:28.984494Z","title":"Token-budget-aware LLM reasoning","venue":null,"work_id":"aced01a2-ea77-4f44-bc94-469663483aec","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:caa0260db4a599dd4b7e3a4b4a2bc25c32a65ca283cb61ddfeb4aa492df4896c","observation_id":"8ba32e1b-27d5-401b-9136-70e8aa103061","resolution":{"observed_at":"2026-06-27T01:20:20.440299Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01141","last_updated":"2025-04-01T00:41:36Z","snapshot_observed_at":"2026-07-06T20:45:27.814045Z","submitted_at":"2025-03-03T03:48:20Z","title":"How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach","version":2},"cited_work":{"arxiv_id":"2503.01141","doi":"10.48550/arxiv.2503.01141","metadata_source":"pith","pith_arxiv_id":"2503.01141","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"How well do llms compress their own chain-of-thought? a token complexity approach","venue":"cs.CL","work_id":"21e3a5ff-8dd1-4b00-823c-baeba601afb5","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2503.01141","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:37bd5837257128e35ecc7755a696d6ff79f7f71f187bd5b1cc008c6ab7f1f198","observation_id":"94a043c8-4983-4d23-a67b-97e9b9be399f","resolution":{"observed_at":"2026-06-27T01:20:20.433389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:02.583941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:02.583941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-07-06T21:08:47.660019Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":"2504.09858","doi":"10.48550/arxiv.2504.09858","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasoning models can be effective without thinking","venue":null,"work_id":"848a6fed-fc7c-4c68-ba43-321a7b12e9bb","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:4bb083244a7657ca13eed0ab90b1fad2267712cd558f7e4127e46ba76b919a8a","observation_id":"2208c267-3661-479a-91fa-1ec6c1a8c73c","resolution":{"observed_at":"2026-06-27T01:20:20.410691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"ICLR 2025 Workshop on Foundation Models in the Wild , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:98159f6711b58abf4cb693e02110ed16ccfe7bf83619c66bddbd26093fe8e5ef","observation_id":"821f09f2-014f-4f52-908d-b527c50a65ca","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07986","doi":"10.48550/arxiv.2504.07986","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Seal: Steerable reasoning calibration of large language models for free.arXiv preprint arXiv:2504.07986, 2025a","venue":null,"work_id":"cccd3307-66b4-4820-9f16-9e572699abc2","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:cc049a3e7fef7cca9cd0b80ecb197a727c1c1bfa17cb7c00acb9557b49f36464","observation_id":"dd00c702-9405-42d4-9e44-32d499c17dd2","resolution":{"observed_at":"2026-06-27T01:20:20.442980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"The Fourteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:a55d7a7b5e61ef67b8d263842203d5541aee8bf73986c0a51e9ff9322b73efd8","observation_id":"c69b05d2-50f6-40a5-9a9a-44f704b3b9ca","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:a18ae3f35af28dd5490d701b5bb23f71ca94c3dbba635c672813d6dda1d1331c","observation_id":"bccb366f-1943-4c80-a936-05b7423a85bf","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"The Fourteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:28844eb255173869d19512ff19ea14001223d8088613ec61e134c235025672c4","observation_id":"130a2e5d-78a2-4b78-8107-b402bbf2b606","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.02536","doi":"10.48550/arxiv.2506.02536","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Answer convergence as a signal for early stopping in reasoning.arXiv preprint arXiv:2506.02536","venue":null,"work_id":"125b44ab-fe4c-401f-9212-9a320bdf3efd","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:ffa9b0e87f8ebf1025a1f2708cb2e05b2d3d5087e42be66036f1c25a80c2091e","observation_id":"b938dcb8-f066-4242-aec9-db628bc12bbf","resolution":{"observed_at":"2026-06-27T01:20:20.491283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:ba838157a183721c10b6784233348d77c9475bc12993c4c0a99d74d2ec24d8ca","observation_id":"d83e4d72-44a5-41a2-96ab-9d5af7a230b3","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08354","last_updated":"2026-05-12T08:51:24Z","snapshot_observed_at":"2026-08-02T06:13:05.770451Z","submitted_at":"2026-02-09T07:38:22Z","title":"Does Your Reasoning Model Implicitly Know When to Stop Thinking?","version":4},"cited_work":{"arxiv_id":"2602.08354","doi":"10.48550/arxiv.2602.08354","metadata_source":"pith","pith_arxiv_id":"2602.08354","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Does Your Reasoning Model Implicitly Know When to Stop Thinking?","venue":"cs.AI","work_id":"58d28bc4-d0ff-40e1-b64c-8f40a45b21e7","year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2602.08354","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:cfb6878e669bcb348daaaf1a4a5f161c46ec20f7478631d37e550a09bfff183d","observation_id":"0effb874-2f0a-469e-b734-8f1a5cd3b589","resolution":{"observed_at":"2026-06-27T01:20:20.485987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24872","doi":"10.48550/arxiv.2505.24872","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Proxythinker: Test-time guidance through small visual reasoners","venue":null,"work_id":"c6786e56-4afd-4e72-bd2e-6cc86fe9d8ef","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:3ff88a97f1e4483eb0380485a59f3f7e46240b053d62da65b53873dfb936a202","observation_id":"f5629f6e-05b2-4f83-9aeb-45cf0d3c743d","resolution":{"observed_at":"2026-06-27T01:20:20.436395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16142","doi":"10.48550/arxiv.2505.16142","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2505.16142 , year =","venue":null,"work_id":"8f565867-ec60-473b-bce1-275efd4cf01a","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:431006a37ab88141f099780d9b041e61bc8f5408787e9deb160a6454f5563b8d","observation_id":"122cc56d-829d-458e-a32b-598604d67000","resolution":{"observed_at":"2026-06-27T01:20:20.482859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:1cd1152c15a541163e07cf8df4d36938447cd706dad76243662e08ff31ced630","observation_id":"9d5f2695-ba0e-461e-abfe-036d6d9d4751","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:a6720071128129ff73e556b238e021712b1a6e5b5d15be4e1bfbfdbaeb5ae9f5","observation_id":"a8040bf1-5352-4add-ad47-f6a9a7db81ba","resolution":{"observed_at":"2026-06-27T01:20:20.474640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Forty-second International Conference on Machine Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:0ab0e247f3f1436b5b71c3afa5606186e91ade41913fbf8ea027efd350b47fed","observation_id":"30463d4b-51c1-40e7-8dcb-95f70dc2b80d","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-07-06T20:35:16.369243Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":"2502.08235","doi":"10.48550/arxiv.2502.08235","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The danger of overthinking: Examining the reasoning-action dilemma in agentic tasks","venue":null,"work_id":"4600dc6b-7c39-4ddb-9872-e03cb8a7efae","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:c7a1f41567ebbbb83176401314ab36f5ffcd2aedf56f4104062c1dfe80dd9b3d","observation_id":"9f9b1fce-5308-449c-9279-b3faeb261aff","resolution":{"observed_at":"2026-06-27T01:20:20.427621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Bowman , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:fcc66a3e148cc35d507f8ac31fe09ae4e652242d34d9029f3a62aa51d0b75c09","observation_id":"87b9f984-2fe7-4fe4-800d-db18d699125a","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:c854d24884f4785fe13797b714cfd62b838f914b116c248b51b39713ca601515","observation_id":"64850e6b-02cc-4e95-9a14-53db735465d2","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11363","last_updated":"2018-10-24T13:08:24Z","snapshot_observed_at":"2026-07-06T07:10:47.707646Z","submitted_at":"2018-10-24T13:08:24Z","title":"CatBoost: gradient boosting with categorical features support","version":1},"cited_work":{"arxiv_id":"1810.11363","doi":"10.48550/arxiv.1810.11363","metadata_source":"pith","pith_arxiv_id":"1810.11363","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CatBoost: gradient boosting with categorical features support","venue":"cs.LG","work_id":"d7241046-2695-4a41-89ab-c1e8619bee8c","year":2018},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/1810.11363","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:ea54f0ddef43aaececabeb69b4e108bb0840a4066331669c0998be0fb747241e","observation_id":"875ab860-dfd0-49c9-bfff-14c4c2a17e71","resolution":{"observed_at":"2026-07-03T20:28:55.670228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23480","last_updated":"2025-05-29T14:30:02Z","snapshot_observed_at":"2026-08-03T03:41:53.562451Z","submitted_at":"2025-05-29T14:30:02Z","title":"Revisiting Overthinking in Long Chain-of-Thought from the Perspective of Self-Doubt","version":1},"cited_work":{"arxiv_id":"2505.23480","doi":"10.48550/arxiv.2505.23480","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23480","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Revisiting overthinking in long chain-of-thought from the perspective of self-doubt","venue":null,"work_id":"ef8adebc-fabb-42d3-a9d6-2ffb82853c30","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2505.23480","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:79a35e797814bcff390d1f09f4759131d8e33b3c4c74ba0c3198a9bed6d59ab9","observation_id":"63cdcf28-7f01-4254-ac58-860ae92b80b5","resolution":{"observed_at":"2026-06-27T01:20:20.430752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T19:20:38.806839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T19:20:38.806839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05419","last_updated":"2025-04-07T18:42:01Z","snapshot_observed_at":"2026-07-06T21:05:44.765030Z","submitted_at":"2025-04-07T18:42:01Z","title":"Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification","version":1},"cited_work":{"arxiv_id":"2504.05419","doi":"10.48550/arxiv.2504.05419","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.05419","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasoning models know when they’re right: Probing hidden states for self-verification","venue":null,"work_id":"dfd8a469-f618-4fbc-9109-9d7295807ed8","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2504.05419","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:fa863fd639f20ef4abaf959ad78d1b3a543b5f09f1fdc36faf21ab5045770ac9","observation_id":"9c75a31b-a1b5-4f76-93b5-bce026bddc92","resolution":{"observed_at":"2026-06-27T01:20:20.414019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Proceedings of the 42nd Annual Meeting of the Association for Computational Linguistics, Barcelona, Spain, July 21-26, 2004 - Poster and Demonstration , publisher =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:db319f6f7c7a18f29708b09041ce26e4d15b0d0cfcdf6018c9ed634a8ac1249b","observation_id":"915c136d-ffa7-4926-99a0-0c210dab04e4","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.05176","doi":"10.1016/j.displa.2025.103255","metadata_source":"pith","pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","venue":"cs.CL","work_id":"bab684a8-d933-426c-a19e-2c855a0d1f59","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:561414168a1fdc06a5930ba3b87bc5ac307409ee40e303ceb221c08f1b896da4","observation_id":"d2fcfcb6-f5cd-4aae-803d-1a18f4f4f5dd","resolution":{"observed_at":"2026-06-27T01:20:20.460749Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.904","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:43:25.269403Z","title":"Answer convergence as a signal for early stopping in reasoning","venue":null,"work_id":"e07fb09b-d6c5-418d-b57d-bc4197204e15","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:a4a8de76a18038a74dd1ea163f54f7abb87e47b89d6ab5451375b47bac1adc82","observation_id":"f6b8bc6c-820a-491e-a546-4a2bf05e08f7","resolution":{"observed_at":"2026-06-27T01:20:20.451214Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10103","doi":"10.48550/arxiv.2510.10103","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Stop when enough: Adaptive early-stopping for chain-of-thought reasoning","venue":null,"work_id":"b8bacf7a-d816-4942-9986-b76e7c2d4229","year":2005},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:1219524a356a728cb334c2a8b9ce2fe0526c9f9001c738c508b8560f95b57db5","observation_id":"fc34335f-3fb4-4612-9a7f-d1a3610b2ccf","resolution":{"observed_at":"2026-06-27T01:20:20.455211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-07-06T21:11:15.204298Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":"2504.13367","doi":"10.48550/arxiv.2504.13367","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CoRR , volume =","venue":null,"work_id":"0170e772-1a0d-4c60-b6c0-fcfc4561b6ee","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:e53f2fbf9595a35e5862114d0cf100688256b3280c0db81b4a000a9c77e8a878","observation_id":"14627de6-5ed9-4683-92de-60bac275179f","resolution":{"observed_at":"2026-06-27T01:20:20.464479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18883","doi":"10.48550/arxiv.2509.18883","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Introducing LongCat-flash-thinking: A technical report","venue":null,"work_id":"d83b56e1-68ce-4e32-b9c0-fc080b79c8fd","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:d1eaff2781ba6bc84fdb0dcde481defd7f290cbc65e92fa9bfcb003ef013d0fb","observation_id":"b6be4521-cc61-4f29-ab5d-14c4c3bc7aa0","resolution":{"observed_at":"2026-06-27T01:20:20.445767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:3afb6116de35d4a9cbc8144c71b6fd44164edb74266450fca1dba9eb67782b60","observation_id":"1a1ccc34-5b04-4df7-adab-e8c470ae2c6c","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:609b3534d784bd3fba9b1f76f16bd897c01a8f5fceb270971dcf55ad161ede39","observation_id":"68f461a4-51ca-4079-8372-3c5f2e54d8b7","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"The Fourteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:f71c2107422d6f9c470ce5e5be492f24adaa1bda069d88237f56cbfc47b53d06","observation_id":"3172a978-5950-4bcf-b0b8-41bff2d9b5b3","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00127","last_updated":"2025-04-30T18:48:06Z","snapshot_observed_at":"2026-07-06T21:17:19.119854Z","submitted_at":"2025-04-30T18:48:06Z","title":"Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs","version":1},"cited_work":{"arxiv_id":"2505.00127","doi":"10.48550/arxiv.2505.00127","metadata_source":"pith","pith_arxiv_id":"2505.00127","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Betweenunderthinkingandoverthinking: Anempiricalstudyofreasoninglengthandcorrectnessinllms.arXivpreprint","venue":"cs.CL","work_id":"b686084f-7501-4f71-bba5-86b60b1504f7","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2505.00127","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:88190a7863f7154a9a539aa232ccf303672e29e27ac79c6d416cac1ef9f38492","observation_id":"fd03b8c5-8032-43ac-9176-5da1f969216c","resolution":{"observed_at":"2026-06-27T01:20:20.404474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.17627","doi":"10.48550/arxiv.2508.17627","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The evolution of thought: Tracking llm overthinking via reasoning dynamics analysis","venue":null,"work_id":"98557e1d-08c1-4e80-9191-3cfa49b39612","year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:d6d3dfcabf1a062183e2f4309b1feaa25dd87922833c24f14de7bebc0a305136","observation_id":"fa8043a2-74ba-4037-a898-d80c21ac9bb2","resolution":{"observed_at":"2026-06-27T01:20:20.394714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23024","doi":"10.48550/arxiv.2509.23024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2509.23024 , year=","venue":null,"work_id":"a16ba123-a608-436d-bb44-ec0816030361","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:87c6289a3e28403926612b92cac01877268a0b3543609e77ad6da7a10d6deede","observation_id":"3844f17a-6ff0-4657-b60e-cb50109e83a7","resolution":{"observed_at":"2026-06-27T01:20:20.379323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21549","doi":"10.48550/arxiv.2509.21549","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"In NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM)","venue":null,"work_id":"47b31ec9-f543-4e70-b516-a926bd2a60ab","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:8f2326519c8d6ba105f5880dbf342a2f9fdf3301bf5eacfbac895232c1afd40c","observation_id":"2793d116-fdcf-4db7-b403-7eb8c5a445a0","resolution":{"observed_at":"2026-06-27T01:20:20.388880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09782","doi":"10.48550/arxiv.2510.09782","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The geometry of reasoning: Flowing logics in representation space","venue":null,"work_id":"3b44ca19-0946-4676-8504-ba3a5c16eac7","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:25a9b13bd5f2290be89372b2133987d217ab85512615d02c720c58a6eb53a371","observation_id":"eaa7aeff-abeb-4ed9-b411-a7e4a1cd06d9","resolution":{"observed_at":"2026-06-27T01:20:20.391753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:0665b7f3b7510b492b6b50c5d10b484c859c20b12a8ba3e3db944ab668c18fc4","observation_id":"0f47999a-197d-4b56-abef-192d3bd6a512","resolution":{"observed_at":"2026-07-03T20:28:55.674815Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:88cc979a5708781790d0f8c7d5d4d933e19f2b6a0644bd082ea49935f33e69e5","observation_id":"0c66043d-ab02-4817-ab44-633d04a7ee4d","resolution":{"observed_at":"2026-06-27T01:20:20.384992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:1a5269e6bce69414f8c32b5df1bb3a9e843bcae475110d8b2fa69700a9b4988e","observation_id":"85d85f9b-1ba0-4ff3-9f70-b9b0eb3345ad","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:33691f73521e5d534c6536018232d192b57ab3280c23474c371a166afa13b8cb","observation_id":"80c37040-d1ab-4db5-b4e1-35e7b39b70de","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:19:55.164835Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:ae1592960f94e078da48d2f9890be313190af63c749bc453755a3ba1c51b8def","observation_id":"722a1cb1-2076-40c3-a3f3-663b42a6ab7c","resolution":{"observed_at":"2026-06-27T01:19:55.164835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24248","doi":"10.48550/arxiv.2509.24248","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CoRR , volume =","venue":null,"work_id":"ede64eb0-b8f0-46c5-b01f-bb71c6e154b5","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:074fdf53903a3b25860a6ecbf10d2e6a5cee34645c3b02087e880a93b348146b","observation_id":"7de60c0a-a784-43eb-8721-f0f0428df11d","resolution":{"observed_at":"2026-06-27T01:20:20.397961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":25,"verified_exact":31,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2606.17890."}