{"as_of":"2026-08-04T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7248e59d9438645b9cf9b2378cbfdb1d8299d4c802d37731af7a09114f3d8280","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:07:16.700499Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T02:43:21.225324Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03503","snapshot_observed_at":"2026-07-14T02:43:21.225324Z","title":"ThoughtFold: Folding reasoning chains via introspective preference learning.arXiv preprint arXiv:2606.03503, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11849","last_updated":"2026-07-13T17:38:22Z","snapshot_observed_at":"2026-07-16T23:20:03.329744Z","submitted_at":"2026-07-13T17:38:22Z","title":"AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T02:43:21.225324Z"},"links":{"cited_paper":"/paper/2606.03503","citing_paper":"/paper/2607.11849"},"observation_digest":"sha256:03343241964d9dd5f9879e6aae0bb3ca4332fe5613a3d19abc16d9391934e4f2","observation_id":"2cb42830-614a-4c62-bcd0-5bb19caaf82c","resolution":{"observed_at":"2026-07-14T02:43:21.225324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.03503/citation-record","integrity":"/paper/2606.03503/integrity","json":"/paper/2606.03503/citation-record.json","paper":"/paper/2606.03503"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.04697","doi":"10.48550/arxiv.2503.04697","metadata_source":"pith","pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","venue":"cs.CL","work_id":"ad7236fb-3752-48a9-b782-a384899c45a0","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:2a6249205a7c5b5a81961ba9ce5055805177ad5c0d7f270e2a7a9ad1777ecbca","observation_id":"6a17d518-577d-485f-93ec-a358ec9531a0","resolution":{"observed_at":"2026-07-02T03:26:28.727043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04463","doi":"10.48550/arxiv.2502.04463","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Training language models to reason efficiently","venue":null,"work_id":"ddc0d049-f0ca-4946-aa25-6843f6072e08","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:f95b86cf16f10f45cecea1f3ae6134962bb80dacbb13b690157283eb0352154f","observation_id":"f49cf19f-65d6-4322-bcfc-d2f993da2c88","resolution":{"observed_at":"2026-07-02T03:26:28.749820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:f32c23928234ec89fc16b987a6337e985bd0e31924cb97ba7343d21667f76fe0","observation_id":"b90073b6-9a96-4cb8-80e1-c83b82a53349","resolution":{"observed_at":"2026-07-02T03:26:28.742888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2412.21187","doi":"10.48550/arxiv.2412.21187","metadata_source":"pith","pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-07-10T11:37:03.272167Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","venue":"cs.CL","work_id":"d79f8b7d-560d-4fbd-bd70-4d084f6d9ad6","year":2024},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:0a9f6a911a62b8a6ebc453c68d838f0a504a6977ce5a8fc78f6b87daec60157d","observation_id":"a08c83bf-c2b8-453c-9c63-8599e7c17ba4","resolution":{"observed_at":"2026-07-02T03:26:28.695641Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:6852368eab6edf0e2c2ee76b3f4414eeb4fcc601a648bad9dc613e97a5d7ba9c","observation_id":"424624be-bd9d-4c71-9937-eacdacd03bca","resolution":{"observed_at":"2026-07-02T03:26:28.682833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:89e59d6b0a3b315a2f3f3bfdea0f224feeb66b70861a82772498598ea559dfc8","observation_id":"00d49656-5c80-4b7c-a988-356d2dd7e3bd","resolution":{"observed_at":"2026-07-02T03:26:28.711411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07686","last_updated":"2025-05-17T04:01:57Z","snapshot_observed_at":"2026-08-02T07:33:26.998080Z","submitted_at":"2025-05-12T15:50:44Z","title":"S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.07686","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07686","snapshot_observed_at":"2026-07-05T18:41:19.734115Z","title":"S-grpo: Early exit via reinforcement learning in reasoning models.arXiv preprint arXiv:2505.07686","venue":"cs.AI","work_id":"730f0353-5985-4718-8b70-09b5c5ffa80c","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2505.07686","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:4a4467e21b2f5818e77627065ae0a3044efd5aa01da44764fff2532e071fc0f2","observation_id":"5df9ee55-0072-4fd6-bfff-245c931b6251","resolution":{"observed_at":"2026-07-02T03:26:28.760292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:7fce9b89173814daa0718f127da29080a827ba8d9d64b564455779e9fa23a0fa","observation_id":"3b9681ed-768e-4778-b904-b2b54736f487","resolution":{"observed_at":"2026-07-02T03:26:28.775702Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02846","last_updated":"2025-03-04T18:20:24Z","snapshot_observed_at":"2026-08-03T19:01:37.968921Z","submitted_at":"2025-03-04T18:20:24Z","title":"Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs","version":1},"cited_work":{"arxiv_id":"2503.02846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.02846","snapshot_observed_at":"2026-07-03T10:48:02.049869Z","title":"Mask-dpo: Generalizable fine-grained factuality alignment of llms","venue":null,"work_id":"e27a75f9-ee76-4491-98c0-c3b81dda99b2","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.02846","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:4f761f9f5cec6fc98141ff336ca3890e6ba7103c66bedf4e93630e7dc9d6fd5e","observation_id":"456ea93d-5648-4ef8-b3e9-cf9f254949de","resolution":{"observed_at":"2026-07-02T03:26:28.742129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:26:28.757379Z","title":"Learning to reason faithfully through step-level faithful- ness maximization.arXiv preprint arXiv:2602.03507, 2026a","venue":null,"work_id":"98a69d19-2a0b-4d6e-989d-fc6b1378d443","year":null},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:a91567907b065e295177c1334294e258d08f3245f64197c3544f9ab0d39b30b1","observation_id":"b1985960-767d-4637-8247-67a50ccada79","resolution":{"observed_at":"2026-07-02T03:26:28.758857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:6694437e2d1ccd02da355c3a12563d7fec06594af03bb3a7c0887bec78a66391","observation_id":"7fb7b005-ff50-4cc2-a597-31b394148e56","resolution":{"observed_at":"2026-07-02T03:26:28.773294Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01141","last_updated":"2025-04-01T00:41:36Z","snapshot_observed_at":"2026-07-06T20:45:27.814045Z","submitted_at":"2025-03-03T03:48:20Z","title":"How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach","version":2},"cited_work":{"arxiv_id":"2503.01141","doi":"10.48550/arxiv.2503.01141","metadata_source":"pith","pith_arxiv_id":"2503.01141","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"How well do llms compress their own chain-of-thought? a token complexity approach","venue":"cs.CL","work_id":"21e3a5ff-8dd1-4b00-823c-baeba601afb5","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.01141","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:2ba110e9f835a0d3dde34d57ecef98c70eca01118fd77eb149740275dbd390af","observation_id":"26cf7ce9-43bb-4cb4-a279-853901432f8d","resolution":{"observed_at":"2026-07-02T03:26:28.750825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:02.583941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:02.583941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:19:43.845608Z","title":"Drpo: Efficient reasoning via decoupled reward policy optimization","venue":null,"work_id":"9841afa4-9ee4-487f-9af4-d8f4bcf6b782","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:c0ee84c6133b8f2d2ba6a8273311441af789b321423fe758f7aa20420621a3a2","observation_id":"6e195617-8c4b-4b9e-9fa8-cf4dc2706ae0","resolution":{"observed_at":"2026-07-02T03:26:28.744968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19324","last_updated":"2025-06-26T03:14:46Z","snapshot_observed_at":"2026-07-06T20:29:07.258163Z","submitted_at":"2025-01-31T17:19:57Z","title":"Reward-Guided Speculative Decoding for Efficient LLM Reasoning","version":3},"cited_work":{"arxiv_id":"2501.19324","doi":"10.48550/arxiv.2501.19324","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19324","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Reward-guided speculative decoding for efficient llm reasoning","venue":null,"work_id":"460cb265-1bb5-4de5-a476-57fe86423688","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2501.19324","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:fa81a2e44303ab15a3dc52145d51a30c70305503145b04d44f3734f5f26dbf17","observation_id":"8c66803d-ef90-423c-94bd-8205ca26b35d","resolution":{"observed_at":"2026-07-02T03:26:28.717883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:a7d10b3fe7caae46eee3531f26015aeff45b5fd1d8b4aa57b75fafa1e4d58a8f","observation_id":"fd6a2328-aa74-4ade-942f-ff01d09b57fc","resolution":{"observed_at":"2026-07-02T03:26:28.729967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30159","last_updated":"2026-05-28T16:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-28T16:17:19Z","title":"Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2605.30159","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30159","snapshot_observed_at":"2026-07-02T03:26:28.755836Z","title":"Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents","venue":"cs.AI","work_id":"8722da0e-248e-4d65-801c-177bda494802","year":2026},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2605.30159","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:2fac8d58ca9b0f9be0596b64f86810e5906be7edd96a607e702005e1eafad7a6","observation_id":"07c7eee8-2297-4021-9873-67667021732c","resolution":{"observed_at":"2026-07-02T03:26:28.757256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":"2501.12570","doi":"10.48550/arxiv.2501.12570","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":"133f3b9f-d49a-46dd-9844-40063846c9ee","year":2026},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:bbf971ce39b88b5a774f3732220faa1d9a47c04ad7fe34aca91afe86b07f56fe","observation_id":"c9ec2970-a2df-4853-99da-8c2886a0abc0","resolution":{"observed_at":"2026-07-02T03:26:28.714337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T19:58:53.669210Z","title":"Frost: Filtering reasoning outliers with attention for efficient reasoning,","venue":null,"work_id":"071665ca-c084-4203-937f-d44de8817aa7","year":2026},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:879a2467a9069438a0ec1b2129ca62e6682f0a33b48e47a24c747761a311b479","observation_id":"b86c0352-790e-429e-90fc-b886c36b1cfc","resolution":{"observed_at":"2026-07-02T03:26:28.667074Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":"2406.06592","doi":"10.48550/arxiv.2406.06592","metadata_source":"pith","pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","venue":"cs.CL","work_id":"9906447b-5bb3-4367-91f9-b9d556c9ee7f","year":2024},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:dc519c29535e60570249f8aa97c0b64257fbdcfe06822613239bc0f96b5debd5","observation_id":"66151ee2-93b0-491c-af25-4bdabfcd5357","resolution":{"observed_at":"2026-07-02T03:26:28.663008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-07-06T21:08:47.660019Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":"2504.09858","doi":"10.48550/arxiv.2504.09858","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasoning models can be effective without thinking","venue":null,"work_id":"848a6fed-fc7c-4c68-ba43-321a7b12e9bb","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:9c12cb7f1aa5a02c3fe7a5b32cca25d0128e3c15000c5de4d99a70f171cbc83e","observation_id":"977a99e0-495d-45ce-8a61-167a6847f610","resolution":{"observed_at":"2026-07-02T03:26:28.714701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:26:28.734784Z","title":"Topology of reasoning: Understanding large reasoning models through reasoning graph properties","venue":null,"work_id":"d21fb9ce-f3b3-4fc0-8fa0-c1b44e23a5be","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:dd505ee09d2aa1b48f7950593777b15537446a26f40a5e07c2bf8c6d199fcbf2","observation_id":"dc880a4a-ee00-4cfb-bbb6-da8304e9a34d","resolution":{"observed_at":"2026-07-02T03:26:28.736408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:66562f2b91588f5653afaf20a78b59c90ca3620cf7d551b15101e6aa8ed342c6","observation_id":"ead1920a-fd43-4a17-acb3-f7ceeb88bbd4","resolution":{"observed_at":"2026-07-02T03:26:28.780710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-10T13:57:06.874927Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:1fca7a00557bf3bb600d9fc128a2a7f7c807fff5b5216ae20c3cab1c53dbb778","observation_id":"58b9f8cf-c810-4e1f-a792-f6977e045ab2","resolution":{"observed_at":"2026-07-02T03:26:28.730179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-02T23:46:38.854124Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-10T14:47:14.590391Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:d372b6683ccd290de15fd3d1ac6c0adec589f8d8f3359e46c4a5b5cb983c96a5","observation_id":"7747edd6-a26e-4d2c-bc2f-f7bae1c63685","resolution":{"observed_at":"2026-07-02T03:26:28.770755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:3cfc5f9557933b739da323f6e9ab0486cd487f6c4d586c3ce474da0669b1bc75","observation_id":"fb18b22d-e0e1-4696-8d94-68b31877574e","resolution":{"observed_at":"2026-07-02T03:26:28.684199Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04776","last_updated":"2025-03-12T04:56:46Z","snapshot_observed_at":"2026-08-04T09:42:58.750228Z","submitted_at":"2024-05-08T02:48:28Z","title":"Chain of Thoughtlessness? An Analysis of CoT in Planning","version":3},"cited_work":{"arxiv_id":"2405.04776","doi":"10.48550/arxiv.2405.04776","metadata_source":"pith","pith_arxiv_id":"2405.04776","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Chain of Thoughtlessness? An Analysis of CoT in Planning","venue":"cs.AI","work_id":"dbeb9f66-ddd7-4033-9a1d-f424b591c9ec","year":2024},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2405.04776","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:dd68eb85cc1a366251a1a62c7a40d75fa607850e48b6700dc82895b47072fc73","observation_id":"1a668184-5526-4283-b467-d483156f3efb","resolution":{"observed_at":"2026-07-02T03:26:28.768340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-03T03:23:56.857266Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.16419","doi":"10.48550/arxiv.2503.16419","metadata_source":"pith","pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","venue":"cs.CL","work_id":"21afd80d-63a7-472b-800d-3b81161c39d3","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:4448e85dcdc5fb30de24fa86922630013388a1640c8a97ae36043158e39a967c","observation_id":"3f6dd0e9-963e-4cbf-8c38-76b256353d4f","resolution":{"observed_at":"2026-07-02T03:26:28.778357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-10T22:47:36.964713Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:5813a8922b393e32cedd8df9aeb3f5efaf225d4baa1a77ba741dda9a83a2df08","observation_id":"7972abe0-66d3-437d-abbe-99fa35460622","resolution":{"observed_at":"2026-07-02T03:26:28.747660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:8b423b96eca9e3a9fa3a8132571841836746d8314ff650c8e882d232c5a27e59","observation_id":"dee13020-45f3-4eb0-a6f7-6ecf490e045e","resolution":{"observed_at":"2026-07-02T03:26:28.762668Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:c4810a4450198f1db8110f1cdacd34d631e34e60d3c0a81b409467b768887b51","observation_id":"d572c47d-b0fd-4fb3-84d6-b4530c9b83af","resolution":{"observed_at":"2026-07-02T03:26:28.765345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:9ab4a6aa625c6736368ea62a8c50ceb395f536e7fe35c5300c675cffed1521cf","observation_id":"39722990-0ca4-4561-97f6-690734e12278","resolution":{"observed_at":"2026-07-02T03:26:28.747394Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.3916","last_updated":"2015-11-29T07:00:41Z","snapshot_observed_at":"2026-07-06T03:57:23.878683Z","submitted_at":"2014-10-15T03:13:18Z","title":"Memory Networks","version":11},"cited_work":{"arxiv_id":"1410.3916","doi":null,"metadata_source":"pith","pith_arxiv_id":"1410.3916","snapshot_observed_at":"2026-07-04T01:09:18.555961Z","title":"Memory Networks","venue":"cs.AI","work_id":"a1b36ec8-6f26-40c2-92cc-790c4e8f63bd","year":2014},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/1410.3916","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:36bda0ebf14d5f80d616dd2549405a59598cbbb39d54aef335d589f578534999","observation_id":"ae4513e5-c3c9-4c0e-aed9-990bd0152ffa","resolution":{"observed_at":"2026-07-02T03:26:28.785354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.09686","doi":"10.48550/arxiv.2501.09686","metadata_source":"pith","pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","venue":"cs.AI","work_id":"9b0d5273-2b7c-477e-b49b-2e0edab55456","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:e45e6d71e2f02d3163347c9718da3eeffb4a6c84cbc110ae19463b1e3b019a6a","observation_id":"6535bcd3-7f99-4609-b5a4-28c92b11fa9e","resolution":{"observed_at":"2026-07-02T03:26:28.703870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:4fba2cab4e6eb9f038e9ae6d417c2f6fb583c332a1ddbe2eedc89a40bbd13207","observation_id":"3c4100a4-29da-44cd-b19e-b60ca32712d6","resolution":{"observed_at":"2026-07-02T03:26:28.739598Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06023","last_updated":"2024-07-24T18:40:36Z","snapshot_observed_at":"2026-07-31T10:52:02.949801Z","submitted_at":"2024-07-08T15:17:46Z","title":"Distilling System 2 into System 1","version":3},"cited_work":{"arxiv_id":"2407.06023","doi":"10.48550/arxiv.2407.06023","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06023","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Distilling system 2 into system 1","venue":null,"work_id":"4f8d3ad5-1b0a-45d2-83fa-622fcc28e3a9","year":2024},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2407.06023","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:2087410cdf594e791830b925d22a4577906377cf9d29b09a6c3f58be611a2c09","observation_id":"465725f1-26d7-4222-91bd-8585078bb725","resolution":{"observed_at":"2026-07-02T03:26:28.717125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:39d1136e4d273ca7dc65791e092ac72d718603d11c09fefd246fe3d8c13a7d20","observation_id":"023cf850-694b-4f31-97dc-469375cd5844","resolution":{"observed_at":"2026-07-02T03:26:28.733463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:07:16.700499Z","title":"Efficient rl training for reasoning models via length-aware optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:ecaef774347a5d3423878cfdac4a5146fc71acc25e52127e0d69b344fe2c4fbe","observation_id":"277f1f2b-2cac-4fcd-95de-d094d35fc5de","resolution":{"observed_at":"2026-06-28T10:07:16.700499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10293","last_updated":"2025-08-16T13:14:36Z","snapshot_observed_at":"2026-07-06T22:12:40.767573Z","submitted_at":"2025-08-14T02:43:53Z","title":"Promoting Efficient Reasoning with Verifiable Stepwise Reward","version":2},"cited_work":{"arxiv_id":"2508.10293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10293","snapshot_observed_at":"2026-07-04T08:09:40.654394Z","title":"Promoting efficient reasoning with verifiable stepwise reward","venue":null,"work_id":"3e87aefb-889f-4f33-a301-5a4e7c68f5c9","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2508.10293","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:1c3dd7614e2b0b81fb26d27f395074ede141d732191c8af1b063833b88cb47f9","observation_id":"bdade60b-217c-4cc8-8d78-7d16e40bf6c8","resolution":{"observed_at":"2026-07-02T03:26:28.773789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-02T23:43:53.902850Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":"2203.14465","doi":"10.48550/arxiv.2203.14465","metadata_source":"pith","pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Wu, andN.D.Goodman","venue":"cs.LG","work_id":"3339dfe0-b229-41ec-a6e0-8f601080eb97","year":2022},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:95a5cbda493ea81b0376183757b2253fac8a3338c64976be23b3498414780abf","observation_id":"62a23dee-e4dd-4c7c-8039-48fe40462f59","resolution":{"observed_at":"2026-07-02T03:26:28.783144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:15.019726+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:15.019726+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25040","doi":"10.48550/arxiv.2603.25040","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Intern-s1-pro: Scientific multimodal foundation model at trillion scale","venue":null,"work_id":"5328cad1-083e-4346-916e-8d865c99f0ac","year":2026},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:a3c4ec3ce946e052e869239c3fb8b17b88982adc0da4e22894801e777677444c","observation_id":"d9e616b2-281e-4a7c-bae7-49caaba5bf14","resolution":{"observed_at":"2026-07-02T03:26:28.770707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:07:16.700499Z","title":"Quantile radius analysis We characterize the resulting representation distributions using the Effective Radius","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:c3c8c900109bcc6b4294d485bcc26761af05c68f195f38e23facaf81aecbfe9b","observation_id":"33041e62-0011-49dc-bacd-603141ca1b7e","resolution":{"observed_at":"2026-06-28T10:07:16.700499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:07:16.700499Z","title":"Recent works further improve PRM data construction or stepwise correction for mathematical reasoning (Sun et al., 2025; Wu et al., 2025b)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:0a77b2eb8199a88f4b347e2d4207fbda4589c9ca240111e0d6958fa862b89d14","observation_id":"c42a5d70-495e-4e28-b384-9015b1553330","resolution":{"observed_at":"2026-06-28T10:07:16.700499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:07:16.700499Z","title":"Beyond these applications, RL has been widely applied to practical optimization scenarios, such as chip design (Geng et al., 2024; 2025; Wang et al., 2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:8e4a3abf914ab9b3a971d3cbf90ebd84685386aa4e2c50daadd9caa1f1cbe22d","observation_id":"33e5e486-5ea0-4d3b-8911-aefbb7f4716e","resolution":{"observed_at":"2026-06-28T10:07:16.700499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7279.0078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:26:28.721911Z","title":"These findings support the use of answer-to-reasoning attention as a practical proxy for identifying low-contribution reasoning steps","venue":null,"work_id":"bf92ea0c-4fdd-4573-8394-88ad23fa9052","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:47f3f5c19185492c812a6225f9aff0139fd71c81d60148dcc53806fad859d700","observation_id":"d192b59f-c233-435f-b6d1-5eb2de62510b","resolution":{"observed_at":"2026-07-02T03:26:28.723579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":19,"parse_uncertain":0,"unresolved":4,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2606.03503."}