{"as_of":"2026-08-09T12:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aad727881777309fb323cbcf2b9aba28bd7399cfb6188cb62edc36f87b5ebb21","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:31.536924Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.890896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.297902Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-06T17:54:17.890896Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.890896Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:e61764d7542a007867a1609217d0e56825b152a11101d13d6137f3603a847d0f","observation_id":"c090e580-0bf6-4349-920f-77f28307ce44","resolution":{"observed_at":"2026-08-06T17:54:17.890896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-04T07:59:54.120284Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning.arXiv preprint arXiv:2506.05256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-09T00:53:49.879051Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:54.120284Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:58145423630b50e971d634042dcfe5c98d283f70f6a276ab880222fc0518ef2d","observation_id":"16630b78-1342-41b9-9ed6-dc4aacfcc365","resolution":{"observed_at":"2026-08-04T07:59:54.120284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2512.19995","last_updated":"2026-05-11T11:26:21Z","snapshot_observed_at":"2026-07-06T22:39:52.837578Z","submitted_at":"2025-12-23T02:44:25Z","title":"Schoenfeld's Anatomy of Mathematical Reasoning by Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T20:39:34.858032Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2512.19995"},"observation_digest":"sha256:13baccc89a19972bec6b2b40b6f48d35ef3bf41d9da27f97f08e48adbe247cfc","observation_id":"4e8c6e8f-b5e7-42ac-8320-38c74b5bfdf1","resolution":{"observed_at":"2026-05-16T20:41:15.359772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-03T11:02:10.268276Z","title":"question_id","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.08010","last_updated":"2026-07-13T20:15:15Z","snapshot_observed_at":"2026-08-09T04:50:04.479222Z","submitted_at":"2026-01-12T21:24:45Z","title":"CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:02:10.268276Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2601.08010"},"observation_digest":"sha256:b372e7db6998bd7571058d8e368c929a3f848332087d4968be1227b1926286b8","observation_id":"4200b067-bc3b-474c-96d4-a8b2e435ba8a","resolution":{"observed_at":"2026-08-03T11:02:10.268276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2601.11340","last_updated":"2026-04-15T07:21:40Z","snapshot_observed_at":"2026-08-02T05:43:35.759183Z","submitted_at":"2026-01-16T14:38:18Z","title":"Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:21:36.606855Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2601.11340"},"observation_digest":"sha256:0d383508984eb57ad5e2afe871daef09a3a23f802eb662effffb076951af0b92","observation_id":"39b95d97-b81b-4681-bedc-cdd7eba02034","resolution":{"observed_at":"2026-05-16T13:22:55.264368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-03T02:53:07.791956Z","title":"Feng Yao, Liyuan Liu, Dinghuai Zhang, Chengyu Dong, Jingbo Shang, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09591","last_updated":"2026-06-10T09:27:06Z","snapshot_observed_at":"2026-08-09T07:44:31.275218Z","submitted_at":"2026-02-10T09:45:42Z","title":"On the Optimal Reasoning Length for RL-Trained Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:07.791956Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2602.09591"},"observation_digest":"sha256:0f49432132d61c576e80fbc2cca7986b20f3ae7f46eb47b509114fa538c6d85d","observation_id":"713381ab-65ec-40bf-a8ce-7c0fa3ade253","resolution":{"observed_at":"2026-08-03T02:53:07.791956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2602.09953","last_updated":"2026-04-17T15:42:08Z","snapshot_observed_at":"2026-08-03T00:49:45.538658Z","submitted_at":"2026-02-10T16:40:22Z","title":"ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T02:44:18.723713Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2602.09953"},"observation_digest":"sha256:674445c1e30500858c2c3be9d01b4cc1dd03bca6815ecb8bf72c57a4228de829","observation_id":"a4a96d6c-7bae-4897-91f2-4885d260985a","resolution":{"observed_at":"2026-05-16T02:47:10.890611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2603.08659","last_updated":"2026-04-06T09:23:11Z","snapshot_observed_at":"2026-08-03T00:34:34.031576Z","submitted_at":"2026-03-09T17:37:15Z","title":"CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T14:23:00.793443Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2603.08659"},"observation_digest":"sha256:b0a21e15de915e78012f3ccb1fb43e1552b1b9b748d35da296e8934396fe6f15","observation_id":"886e77fa-05e3-4eae-8cca-de6899a4bc07","resolution":{"observed_at":"2026-05-15T14:25:55.461203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-07T10:42:27.644514Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:0b4df353c32d1cf5bdb1099c303b982b9649b14771cbeee5f654a34c54323ebd","observation_id":"84601f54-4850-4575-a90c-73210dcff0f1","resolution":{"observed_at":"2026-05-12T09:31:26.152468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T15:28:13.138448Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T15:28:13.138448Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:8bfd6acb305885f5a9aad382f18f8521215f4093bc89d0dfebd5600b04b1d6f5","observation_id":"344b53f1-e67c-445a-b1a3-61e04d7501c6","resolution":{"observed_at":"2026-08-02T15:28:13.138448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-09T11:43:52.076241Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":227,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:95365550b213db3974ab7cb2e30e5c6e96e5f76bc0074c3722106d1f3b6961ba","observation_id":"724ea3d7-2db4-4f6c-b903-a7e256621619","resolution":{"observed_at":"2026-05-11T17:26:04.968571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:4ba646434b460aa2214e52ef97a691621ccc26aff49d384d0b5d9348b0b539c2","observation_id":"0933af8a-9e79-4afc-921b-197b5fea19cc","resolution":{"observed_at":"2026-05-12T07:46:28.454063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.09806","last_updated":"2026-05-10T23:05:02Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T23:05:02Z","title":"LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:42.407934Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.09806"},"observation_digest":"sha256:4927e48ba90984452847c1095d9b2070cec4b82b6a84e0e40e8c3b4bf0230a00","observation_id":"df06833a-2720-4f97-a639-0fa242ebb1a6","resolution":{"observed_at":"2026-05-12T02:31:16.760115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:423cfaabd7b26c771c9fddc831bee86137297f35a1fdf3421234a1bfa35a5226","observation_id":"deecccc9-3022-4352-bddd-5df8ab3f24d5","resolution":{"observed_at":"2026-05-20T06:43:05.955153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:990c33de48285471e50b7fe30f0d8897c527311009d4a936959ad15d5fa2cfdc","observation_id":"07878212-db95-4bed-acb5-058a6488d63c","resolution":{"observed_at":"2026-05-22T05:51:08.348019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:816c5cb945ca566594630c5c5ea9240116c3f5c1a9e630df810fba8038bf7d1b","observation_id":"b7ff19b3-3818-4609-aad2-73facda3bc15","resolution":{"observed_at":"2026-07-01T20:56:13.590565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:a72f5f8fa86cb794deeb883abad904d3ed52860dd628c1b1dd772e9eba169dcd","observation_id":"bae9feb9-53fe-44eb-96f0-cc4d667df1c3","resolution":{"observed_at":"2026-07-02T02:16:27.163309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:dabfa9fd81fa4872474c1592a921c6648fdf41337bb704055c2aea5cc84a74f9","observation_id":"57c65ba3-1f45-48aa-acd3-0038a3bd3b17","resolution":{"observed_at":"2026-07-03T20:38:56.069868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:e6f7b4dd85c4c7cdd2f93a4bb33e48374c13fc5dfadf3eddd10a350d9348e0cb","observation_id":"14dfd15c-1b8c-4bd1-bbbb-bea699947083","resolution":{"observed_at":"2026-07-04T05:09:36.866760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T10:49:07.680058Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:07.680058Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:b9273c22273701ab54ad6112e3170f039a24616c4eb30d7bbc5b6602db781ad2","observation_id":"3e778285-b681-44bd-9652-4e0890b5ae65","resolution":{"observed_at":"2026-08-02T10:49:07.680058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:e3c470fc636d4c2e7678812582eaa8e0807d31015cb5a3e77f077be3cb6832ed","observation_id":"a8dac336-9aea-4217-932d-7a2c3366b668","resolution":{"observed_at":"2026-07-04T07:59:40.698593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:da334660e87a3e1c83de40153b2b24915204e2bf430352c1d42870b4f5e9a03c","observation_id":"124265fb-a462-4763-ba7b-0bd2a6e40fdf","resolution":{"observed_at":"2026-07-04T09:19:43.879965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:2fc4914242cb3cf577e9c7d075c905f4bc203a9b0dd7daa6fbc5b6f7d8523f2e","observation_id":"3742ff11-eeed-4114-8244-565d834dc2c9","resolution":{"observed_at":"2026-07-04T18:40:03.299162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-04T18:40:03.297902Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":"3264baac-3c10-43e1-8ad6-8dd6a491afbe","year":2025},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:af188b51820997c774fe1ad73d30b8ce6bddda56f8470d5a7d4ed44dc61b6a69","observation_id":"59b6edb1-7561-488e-8233-1e658a261cf1","resolution":{"observed_at":"2026-07-01T18:15:59.049118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-07-14T15:45:54.532529Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-14T15:45:54.532529Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:acedfaf43cab572ffd44906d5cc4014f8d320f586e5134a08c92869aa7376781","observation_id":"25ff8107-92f1-4eb6-a063-61c8481c02df","resolution":{"observed_at":"2026-07-14T15:45:54.532529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-02T08:06:10.856964Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T08:06:10.856964Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:591af6cc1c731c7585820d6da3e9232fb42255d9feabdb87911c91135d813d3a","observation_id":"72a9e867-bdbe-411f-8fa7-12cecb22928b","resolution":{"observed_at":"2026-08-02T08:06:10.856964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-04T04:30:30.198277Z","title":"Just enough thinking: Efficient reasoning with adaptive length penalties reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:30.198277Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:2da888ce5147c9893c420b402e5c7466bebb295502e4ecf648c81af5b7de8ed2","observation_id":"1c6f5859-2199-4f0b-a129-13d2f68e69a2","resolution":{"observed_at":"2026-08-04T04:30:30.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-01T09:52:11.853588Z","title":"arXiv preprint arXiv:2506.05256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:11.853588Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:fbcc06a04300e776ef3f9021192088fcbaf026dac7cc60d5851c1b85de2d1809","observation_id":"22d43118-764f-4480-89c7-77bb223199be","resolution":{"observed_at":"2026-08-01T09:52:11.853588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05256/citation-record","integrity":"/paper/2506.05256/integrity","json":"/paper/2506.05256/citation-record.json","paper":"/paper/2506.05256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:30.048003Z","title":"Xingyu Chen, Jiahao Xu, Tian Liang, Zhiwei He, Jianhui Pang, Dian Yu, Linfeng Song, Qiuzhi Liu, Mengfei Zhou, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, and Dong Yu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.048003Z"},"links":{"citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:7fd76bd06498a2d765f87deefe3dde2b31dc327af950c6f9e64715cc118b2ba4","observation_id":"1c2e65a2-a26b-454f-a04d-17ba24728abd","resolution":{"observed_at":"2026-08-07T10:28:30.048003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T10:28:30.149754Z","title":"DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.149754Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:e50f858973c669d1bd7e784411494e77e1d775638a97911e37420c6633570a11","observation_id":"21756724-5271-4197-82a1-57ed4f1d5c21","resolution":{"observed_at":"2026-08-07T10:28:30.149754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:28:30.270494Z","title":"Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.270494Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:61a4566f8b098b9cb1faabe83e5ad298189c5925636fc72e6baf220002dd699e","observation_id":"d7fd6e85-6f0c-4ed1-88e5-0df5bdedf482","resolution":{"observed_at":"2026-08-07T10:28:30.270494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T10:28:30.467637Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.467637Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:f37fe729136a25959c3f49d16f1774df31f41fcc89b3dd37cff66f83664aef98","observation_id":"c17b38e5-69a3-4707-bee7-f1d9912d501c","resolution":{"observed_at":"2026-08-07T10:28:30.467637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T10:28:30.568819Z","title":"Aaron Jaech, Adam Kalai, Adam Lerer, Adam Richardson, Ahmed El-Kishky, Aiden Low, Alec Helyar, Aleksander Madry, Alex Beutel, Alex Carney, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.568819Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:645662ed111d48523ebdad67c4f2bcf072e370c79d68a15aba4c587c452b235a","observation_id":"506a3c43-7cb5-4e58-9910-0f3a7236edaf","resolution":{"observed_at":"2026-08-07T10:28:30.568819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T10:28:30.642928Z","title":"Yingqian Min, Zhipeng Chen, Jinhao Jiang, Jie Chen, Jia Deng, Yiwen Hu, Yiru Tang, Jiapeng Wang, Xiaoxue Cheng, Huatong Song, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.642928Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:72f55e57b8265fbf84c3b766c31034ea598b6cc6a3d6f844bd98a95ffc3bd776","observation_id":"6266d389-f09d-486d-90b0-605c95de981e","resolution":{"observed_at":"2026-08-07T10:28:30.642928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T10:28:30.721513Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.721513Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:f647de47e90f369242fd88b5d173961f3fcc7189478f69f89799a5018ca96c14","observation_id":"3b9d6cb8-82a1-4aef-85bd-e8ee20e8affa","resolution":{"observed_at":"2026-08-07T10:28:30.721513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:28:30.799790Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.799790Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:108e32077f80dff1d70ffa8e6846c8efc14767a3c5fd339b6b95d2ec487ba7d9","observation_id":"fc219677-9c0c-4254-ba77-9456d1e1314d","resolution":{"observed_at":"2026-08-07T10:28:30.799790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T10:28:30.901007Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.901007Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:91ee04f3a7826434242967275a987f5af7faacafe9da15abcd589576db5fc11a","observation_id":"aa4c12c2-f0d5-4d45-a420-c80e7d78f85f","resolution":{"observed_at":"2026-08-07T10:28:30.901007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T10:28:30.991793Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.991793Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:933e7b95d677819b7a8513ec5dbd40e846db96ea5f73bef9543f8e67177eed5f","observation_id":"90f3d839-d2ed-47a8-b0f0-16b8717c79e3","resolution":{"observed_at":"2026-08-07T10:28:30.991793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T10:28:31.092526Z","title":"Yue Wang, Qiuzhi Liu, Jiahao Xu, Tian Liang, Xingyu Chen, Zhiwei He, Linfeng Song, Dian Yu, Juntao Li, Zhuosheng Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.092526Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:2e144ea9b3c9443b7eb9e126eff439fe9a4a4932c1e668ae6690ae3d9297f3a0","observation_id":"73b43e58-27e3-456e-afad-2512004f8b5c","resolution":{"observed_at":"2026-08-07T10:28:31.092526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-07T10:28:31.175370Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models.arXiv preprint arXiv:2408.00724,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.175370Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:d1f1c1712e76ece8380071d99a12936e96e7ef3662fdd661bba6b67e765351c4","observation_id":"49c3822b-ec35-401e-a7dc-565487c5fc36","resolution":{"observed_at":"2026-08-07T10:28:31.175370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04682","last_updated":"2025-01-08T18:42:48Z","snapshot_observed_at":"2026-07-06T20:18:21.419068Z","submitted_at":"2025-01-08T18:42:48Z","title":"Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04682","snapshot_observed_at":"2026-08-07T10:28:31.296126Z","title":"Towards system 2 reasoning in llms: Learning how to think with meta chain-of-though.arXiv preprint arXiv:2501.04682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.296126Z"},"links":{"cited_paper":"/paper/2501.04682","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:63d77f2b563fc9891d58163d4768d8e5ada81a9af30d1a3ffbf8cc1347ea178e","observation_id":"79876e20-bc1d-4a1e-be92-fa16de0f8d84","resolution":{"observed_at":"2026-08-07T10:28:31.296126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-09T04:48:29.237275Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T10:28:31.403312Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning.arXiv preprint arXiv:2405.00451,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.403312Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:28dd0a7563dbc89370bb63907e5be3741bfb5ed1ff2f30a4216c3b0550360950","observation_id":"f65d5de8-86c7-4087-8689-c8d1d2d00d61","resolution":{"observed_at":"2026-08-07T10:28:31.403312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:32.053321Z","title":"Backtracking","venue":null,"work_id":"03089200-d49e-492a-b4c0-64838ffe19b9","year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:31.536924Z"},"links":{"citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:d2b9b421dc2a1d7c349b2bc25df18e5e85f417407f30ccf5ecf974c44f468baf","observation_id":"58daa4dc-cb8d-4f60-915a-c311ae2b4f9c","resolution":{"observed_at":"2026-08-07T10:28:32.170425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T10:28:30.367732Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:30.367732Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:52512eb2c270ed4f608e5c082d98b722d0b5a9cb341532f5d3c7b5cce8b5095b","observation_id":"419cdef7-efd5-4303-9654-5891a7af65a2","resolution":{"observed_at":"2026-08-07T10:28:30.367732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T10:28:29.980350Z","title":"10 Arash Ahmadian, Chris Cremer, Matthias Gallé, Marzieh Fadaee, Julia Kreutzer, Olivier Pietquin, Ahmet Üstün, and Sara Hooker","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:29.980350Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.05256"},"observation_digest":"sha256:9d1b9d9e7f19c6701e53dcec52b945912092426601cafbf0ff0eb6c4449a77ec","observation_id":"99687c21-cddc-4122-ad45-a82abd54e362","resolution":{"observed_at":"2026-08-07T10:28:29.980350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T04:48:56.146302Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 28 inbound Pith citation observations for arXiv:2506.05256."}