{"as_of":"2026-08-14T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e43935a6cbbd125027e0e07bb647e311513273c3f62951bbf495de1729eecc24","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T23:58:29.040819Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:20:13.925085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-12T15:20:41.947055Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:5902776ea50272e712113df56d40f4f243fe34332c5fda357fa55466eed7a33f","observation_id":"fa4bf688-ed37-43a3-8817-050c10a3402a","resolution":{"observed_at":"2026-05-20T09:42:04.287817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:1758fdf4e20bf6294bb165f0db028337287aec09b463a7777889e8c6c86a4a26","observation_id":"5b0a0db2-e7bf-4f99-b7c4-43cfa6aff57d","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T18:20:13.925085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-13T17:30:19.116761Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.925085Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:98aa7a687c3b4ebb2a841c8d54720f0b54fe721913d25805899af343364647ea","observation_id":"bf05dcc1-26d7-43c1-8876-d01f3cb28f33","resolution":{"observed_at":"2026-08-12T18:20:13.925085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T13:21:05.606869Z","title":"Step-dpo: Step- wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16345","last_updated":"2025-02-14T09:32:11Z","snapshot_observed_at":"2026-08-12T21:31:53.512967Z","submitted_at":"2024-11-25T12:44:02Z","title":"Preference Optimization for Reasoning with Pseudo Feedback","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:21:05.606869Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.16345"},"observation_digest":"sha256:0404156d89f0a76a50946003ed01b676a95bb315646cace01b2fa8e3f89535f8","observation_id":"c6ee085e-1b7d-49ac-a12d-16e73d18f24b","resolution":{"observed_at":"2026-08-12T13:21:05.606869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T10:39:36.883872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19039","last_updated":"2024-11-28T10:35:16Z","snapshot_observed_at":"2026-08-13T16:36:49.167890Z","submitted_at":"2024-11-28T10:35:16Z","title":"Mars-PO: Multi-Agent Reasoning System Preference Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T10:39:36.883872Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.19039"},"observation_digest":"sha256:f043bafb283853dfb96854d1957a51620bda1226acda7f8b702598244274ebb8","observation_id":"90bd06fd-699c-4981-a096-0ddeb21a5be2","resolution":{"observed_at":"2026-08-12T10:39:36.883872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T05:43:31.521431Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-12T05:37:08.249486Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:43:31.521431Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.19943"},"observation_digest":"sha256:d12bb1ab23896a3ab0719ba1ff0d18f4e39710e0041284151c7dbdb93620b751","observation_id":"232c31f4-a495-4526-85c3-39f190e2e66e","resolution":{"observed_at":"2026-08-12T05:43:31.521431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-11T12:41:20.695300Z","title":"https://doi.org/10.18653/v1/2024.findings-naacl.108","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15282","last_updated":"2024-12-18T15:38:39Z","snapshot_observed_at":"2026-08-11T12:35:09.122376Z","submitted_at":"2024-12-18T15:38:39Z","title":"A Systematic Examination of Preference Learning through the Lens of Instruction-Following","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:41:20.695300Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2412.15282"},"observation_digest":"sha256:9dfd1be086e5987d67203a1dd082c7624c51101dfc7096c28d6802cd05013c54","observation_id":"37ad7b07-5d02-43ae-a588-8ce714176bf7","resolution":{"observed_at":"2026-08-11T12:41:20.695300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-11T12:41:20.698420Z","title":"https://doi.org/10.48550/arXiv.2406.18629","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15282","last_updated":"2024-12-18T15:38:39Z","snapshot_observed_at":"2026-08-11T12:35:09.122376Z","submitted_at":"2024-12-18T15:38:39Z","title":"A Systematic Examination of Preference Learning through the Lens of Instruction-Following","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:41:20.698420Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2412.15282"},"observation_digest":"sha256:891a21da10365c42fdd75e211e19391b3a1281eb11109957e2b40a10cdde5860","observation_id":"d6784637-1a2b-4c90-840f-60079620f06e","resolution":{"observed_at":"2026-08-11T12:41:20.698420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-11T04:56:22.417074Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv:2406.18629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18279","last_updated":"2024-12-24T08:39:35Z","snapshot_observed_at":"2026-08-11T16:10:13.484790Z","submitted_at":"2024-12-24T08:39:35Z","title":"Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:56:22.417074Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2412.18279"},"observation_digest":"sha256:856c16db43da50e17639056c5a53c372e5ce9336640ea0178ccd3bb245671e57","observation_id":"076dad93-3150-45f2-97f7-fa92d32b0265","resolution":{"observed_at":"2026-08-11T04:56:22.417074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T23:21:34.108960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20996","last_updated":"2024-12-30T15:01:48Z","snapshot_observed_at":"2026-08-12T06:48:03.389508Z","submitted_at":"2024-12-30T15:01:48Z","title":"Plug-and-Play Training Framework for Preference Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.108960Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2412.20996"},"observation_digest":"sha256:38066dbd99476c4b5ebb8cf2736a5aacffa7e687acfb0c0f1714839cd0ae7446","observation_id":"ca2d97d6-65c3-449a-a8e3-ee73b60c5396","resolution":{"observed_at":"2026-08-10T23:21:34.108960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T22:37:07.176830Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01478","last_updated":"2025-01-02T12:09:17Z","snapshot_observed_at":"2026-08-12T14:04:36.613530Z","submitted_at":"2025-01-02T12:09:17Z","title":"Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:37:07.176830Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.01478"},"observation_digest":"sha256:2068b9956ec5a451731b76925872bcd67b83be60c1b862bf912eed7bef59699d","observation_id":"93ce969c-ecec-4fb8-aeb2-2c5092d15dd2","resolution":{"observed_at":"2026-08-10T22:37:07.176830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T22:28:56.735753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01821","last_updated":"2025-02-27T05:42:17Z","snapshot_observed_at":"2026-08-13T04:57:51.844894Z","submitted_at":"2025-01-03T14:09:46Z","title":"SDPO: Segment-Level Direct Preference Optimization for Social Agents","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:28:56.735753Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.01821"},"observation_digest":"sha256:e955a266dca8d512d29da8cad23662e70cb9d677d6925a10f10da734b4c21d80","observation_id":"c88df6c2-b598-4e56-bd5f-faeed1545a19","resolution":{"observed_at":"2026-08-10T22:28:56.735753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T20:54:13.255347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06761","last_updated":"2025-01-12T10:08:26Z","snapshot_observed_at":"2026-08-13T13:11:02.853917Z","submitted_at":"2025-01-12T10:08:26Z","title":"VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:54:13.255347Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.06761"},"observation_digest":"sha256:8bde207ed5aefae586a42aee803b582ded7def5c721410c643ed62893f238a4e","observation_id":"1ae5de45-65db-4af0-9cce-29c3e93d268a","resolution":{"observed_at":"2026-08-10T20:54:13.255347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T15:32:46.315309Z","title":"arXiv preprint arXiv:2406.18629 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:46.315309Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.13926"},"observation_digest":"sha256:e8b88d99c4edc59c6c1f57d6eb801a3c5fbeb28f815c61dcc2cb247ad2deed5c","observation_id":"be8edc1b-2d84-466a-aeca-f54a9f5890cb","resolution":{"observed_at":"2026-08-10T15:32:46.315309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T15:49:27.751399Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14002","last_updated":"2025-03-24T02:20:01Z","snapshot_observed_at":"2026-08-13T04:39:25.907164Z","submitted_at":"2025-01-23T12:14:57Z","title":"Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:49:27.751399Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.14002"},"observation_digest":"sha256:25c567d6d42de9e2f256054429a7b7cbb05097e7ae5a9e2b0ceaac34316837bb","observation_id":"e7fa5bfa-b430-4b78-a825-3df5b72de4c3","resolution":{"observed_at":"2026-08-10T15:49:27.751399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-10T18:04:34.721346Z","title":"Step-DPO: Step-wise pref- erence optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.721346Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:c776a37c1aa3531bead63648a279510cb479e21aca9b78f84b62e33d0d6ef12e","observation_id":"30af0243-2239-4962-b88d-f4ad59925137","resolution":{"observed_at":"2026-08-10T18:04:34.721346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-09T13:25:52.021917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02095","last_updated":"2025-05-20T12:35:46Z","snapshot_observed_at":"2026-08-13T14:08:47.184627Z","submitted_at":"2025-02-04T08:25:17Z","title":"LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T13:25:52.021917Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.02095"},"observation_digest":"sha256:c69ad905c901195467432201b010a75a58a569c65bed6de0435353210f01001e","observation_id":"91d6dd8e-0e46-4c22-ad3b-e4a5371bbc10","resolution":{"observed_at":"2026-08-09T13:25:52.021917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:a81de1d2d5ca0ed86cd995236204a9e3bbd0c6f880d595cf39f8a971d8640a3f","observation_id":"1bce7f0a-c59f-4953-aeb5-9971afb79efa","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-08T18:10:53.393381Z","title":"Step-dpo: Step-wise preference optimiza- tion for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.393381Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:999bd9f821407341d15f239f6b69df4fa0c1c68fdaebfe8649d0c79a2953266c","observation_id":"4f4307c2-cea9-4983-a12e-5a00a1d79f35","resolution":{"observed_at":"2026-08-08T18:10:53.393381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-09T11:26:17.321272Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-14T00:38:26.175319Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.321272Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:c4cb2e7b1611cf71f111de3163b71f4521f86b610c7361b746d218ce55163491","observation_id":"290e26b9-8ff6-43c0-ada4-d2130980bf9c","resolution":{"observed_at":"2026-08-09T11:26:17.321272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:fbf27b8405344320506a0b48f94aa10af0232c59aa5f147f688f749fe78cffe1","observation_id":"48c1bd92-9ef3-44f5-81fb-ac6f08efd1f9","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T18:42:39.023650Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2504.11536"},"observation_digest":"sha256:4ec9b1fb613fb2e6b39e18193db240a4b2d9826945fd6e20fe232dd3b127e57e","observation_id":"794dfe46-4d9f-44d7-bc45-92f56829af41","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T14:22:59.458706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19100","last_updated":"2025-05-25T11:33:08Z","snapshot_observed_at":"2026-08-09T04:49:33.633639Z","submitted_at":"2025-05-25T11:33:08Z","title":"ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:22:59.458706Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.19100"},"observation_digest":"sha256:adc95ac464a49036febda535369a104bcb7456cd4b9706eb06940a48a2df3889","observation_id":"c5476062-0026-4499-be03-a071d6d1d788","resolution":{"observed_at":"2026-08-07T14:22:59.458706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T14:11:58.907511Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-13T22:06:58.555085Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:58.907511Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:24d1529683f6c2775dc01e9b7859a8bd4b24d91c2a8683c574ca14ef388fc050","observation_id":"6883d3c8-a050-40a8-8301-f9d80190edc0","resolution":{"observed_at":"2026-08-07T14:11:58.907511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T13:59:54.505939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20451","last_updated":"2025-05-26T18:46:38Z","snapshot_observed_at":"2026-08-12T13:35:31.068579Z","submitted_at":"2025-05-26T18:46:38Z","title":"Amulet: Putting Complex Multi-Turn Conversations on the Stand with LLM Juries","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:59:54.505939Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.20451"},"observation_digest":"sha256:a6da9355c0bfa27526435c93e285052fe376a81e2844587445ef803fa0abdf9a","observation_id":"93167904-f699-4575-8d5c-3297e29e1fcb","resolution":{"observed_at":"2026-08-07T13:59:54.505939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T13:46:40.944799Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-13T19:28:42.965045Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.944799Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:dcd2a535a6d4d85b6499a60e0e03b828f5fdd116a7ea3487debfb1034b4c89f3","observation_id":"1122bdd9-2470-4da0-a66b-0cc656f55190","resolution":{"observed_at":"2026-08-07T13:46:40.944799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T12:59:19.624700Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23091","last_updated":"2025-06-23T08:47:25Z","snapshot_observed_at":"2026-08-08T00:05:53.204971Z","submitted_at":"2025-05-29T04:51:56Z","title":"Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:19.624700Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2505.23091"},"observation_digest":"sha256:7a45a36df2c8c85fb7cc545f412a512e9a8ebd4314f6cffddd1c2b968b6f8d36","observation_id":"c01072d5-3cee-4766-bfb9-26bbf4b826a7","resolution":{"observed_at":"2026-08-07T12:59:19.624700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T11:07:11.100055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03483","last_updated":"2025-06-04T01:46:38Z","snapshot_observed_at":"2026-08-13T17:34:20.395381Z","submitted_at":"2025-06-04T01:46:38Z","title":"APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:07:11.100055Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.03483"},"observation_digest":"sha256:29164b5548251e8931c4946ebf5f514664a7bd7305da04db4a55aa039fb3ac2d","observation_id":"da8f3bc5-b4f0-4027-9da9-3c0cee68f900","resolution":{"observed_at":"2026-08-07T11:07:11.100055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T05:14:47.300557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.300557Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:4d06c53fda02bf1c3a3234ab7882d0abf5d23c965b1739622500300ac69ec909","observation_id":"96a52f76-7061-4763-814e-a502ca788c4c","resolution":{"observed_at":"2026-08-07T05:14:47.300557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T05:14:43.248348Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-10T09:42:07.662891Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.248348Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:a4be2fae1aae8c44f7c35cc314894d1a9b921ada171321cf36c4f5c0ac5ef91a","observation_id":"d19fd706-3403-47a2-ad12-cb865ce56a1b","resolution":{"observed_at":"2026-08-07T05:14:43.248348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T12:29:34.795071Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15706","last_updated":"2025-05-30T08:42:14Z","snapshot_observed_at":"2026-08-13T02:45:55.931672Z","submitted_at":"2025-05-30T08:42:14Z","title":"MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:34.795071Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.15706"},"observation_digest":"sha256:7ab64c4033acb83167e512f7dd5b1ddf7166565b198d1f1eefc356f41d2ff78a","observation_id":"b40b769e-4c06-48e5-9d9d-e10fc34fc93c","resolution":{"observed_at":"2026-08-07T12:29:34.795071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-06T21:53:00.558586Z","title":"Step-dpo: Step-wise preference op- timization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-11T01:19:42.067209Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.558586Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:16b9bd2d1250e352744ce78c2a8d47de532a6b0b6927defa71f59a694033461e","observation_id":"d9653dec-3380-4c78-8316-8b21d5210f57","resolution":{"observed_at":"2026-08-06T21:53:00.558586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2507.05179","last_updated":"2026-05-31T04:19:46Z","snapshot_observed_at":"2026-08-06T19:27:53.110737Z","submitted_at":"2025-07-07T16:34:28Z","title":"From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-19T06:09:26.269452Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2507.05179"},"observation_digest":"sha256:d0615d1fdcee109831a89826eae6679577e24528501ca22dc3863db9be69bba0","observation_id":"5a898ff4-7998-4ad4-9dd9-40d056379cdf","resolution":{"observed_at":"2026-05-19T06:12:07.162976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-06T18:38:09.880112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07725","last_updated":"2025-07-10T12:58:45Z","snapshot_observed_at":"2026-08-12T23:02:32.855937Z","submitted_at":"2025-07-10T12:58:45Z","title":"Not All Preferences are What You Need for Post-Training: Selective Alignment Strategy for Preference Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:38:09.880112Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2507.07725"},"observation_digest":"sha256:7357e6c0165a42ce25162d27fa838d0751de2e99c9e6047df4a12c193bdfd44f","observation_id":"edf792c8-05a7-415b-8318-369e1b8a0856","resolution":{"observed_at":"2026-08-06T18:38:09.880112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2507.12455","last_updated":"2026-05-22T04:17:50Z","snapshot_observed_at":"2026-08-12T17:31:54.836477Z","submitted_at":"2025-07-16T17:55:43Z","title":"Mitigating Object Hallucinations via Sentence-Level Early Intervention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T08:31:24.173135Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2507.12455"},"observation_digest":"sha256:69dded392984ab95993476a7ac039b99d99217574b60c50d729f7d6835309b29","observation_id":"00092c23-b383-49c4-b201-bfa48500b59f","resolution":{"observed_at":"2026-05-25T08:35:32.638911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T23:10:24.477083Z","title":"Step-dpo: Step- wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-13T20:01:20.217289Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.477083Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:cccf60975dd2fc9b29d2e0ca764f5a7e5f4f42cf6818fa8b007ee49b5f989b28","observation_id":"c3f08595-d6ec-47d1-b174-aa944314cf68","resolution":{"observed_at":"2026-08-05T23:10:24.477083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2508.06412","last_updated":"2026-05-07T07:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T15:56:49Z","title":"Sample-efficient LLM Optimization with Reset Replay","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T23:38:08.044450Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2508.06412"},"observation_digest":"sha256:710613169ae794a458355e61ba2bfb63b3598e20b11854748b47370046f6f3a4","observation_id":"1e3cd6c3-9c29-4b23-8a4a-9af3c335d1af","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2508.07407","last_updated":"2025-08-31T14:55:05Z","snapshot_observed_at":"2026-08-10T13:27:07.744131Z","submitted_at":"2025-08-10T16:07:32Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T23:21:42.029285Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2508.07407"},"observation_digest":"sha256:bead2d34c5113068c630f47414594ca50a48712bb5fb34d38bf86cc04972dc71","observation_id":"564cad11-567b-4dad-a399-c7f3cfefca93","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:25554ef38efcc6bc1cc1373b1a0736fb4a2c5c130d7983ce97e1615a82bd232b","observation_id":"808fbd4d-c3e0-4f1f-88bc-b8bff91c6cc2","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2509.19893","last_updated":"2026-04-03T01:16:52Z","snapshot_observed_at":"2026-08-13T03:38:46.536112Z","submitted_at":"2025-09-24T08:44:12Z","title":"Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T14:41:24.891052Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2509.19893"},"observation_digest":"sha256:14f8ec08ae55b371df60ef958748999b0094e9cf91575823ff70d8b200e052ee","observation_id":"49446334-2c1d-4385-a9e1-a519bf67dd97","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2510.07972","last_updated":"2026-04-13T14:08:13Z","snapshot_observed_at":"2026-08-06T02:37:16.242841Z","submitted_at":"2025-10-09T09:03:15Z","title":"SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T09:33:57.037949Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2510.07972"},"observation_digest":"sha256:ad5012f81426cc095c6f5e40830d264118f5ade771733f975f614d9c9bbd8b42","observation_id":"eec23df6-7e9f-4b05-95c8-180768cf78a1","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-04T10:53:08.480368Z","title":"arXiv:2406.18629 [cs.LG] https://arxiv.org/abs/2406.18629","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.480368Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:f053de0ff608a4fe011cbc31ff497f58bfac4b54a57121866d1d1ebdf45f2d92","observation_id":"c015ebd5-0bb5-4d99-86fc-21eb80bd959a","resolution":{"observed_at":"2026-08-04T10:53:08.480368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-11T05:20:44.938077Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:af31502fe761a3c31e1736fe7b9ab656c9a09acb94ccdb99274337f23ef57130","observation_id":"1c37e923-e5d4-4838-b5d0-fba9af9e4bdc","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2512.19728","last_updated":"2026-04-14T04:23:52Z","snapshot_observed_at":"2026-08-13T20:30:19.092758Z","submitted_at":"2025-12-17T06:15:52Z","title":"Hard Negative Sample-Augmented DPO Post-Training for Small Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T21:57:16.279587Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2512.19728"},"observation_digest":"sha256:e0ed099b0a0096135e4546278c215ab544872d5c18c186ff1f98c1ee0bf4eee1","observation_id":"fb12e888-3d24-44dd-b835-dc5ce12a995f","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T19:56:29.025781Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:29.025781Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:a5f55e24dcb65278d70c3170189f27564b2672aec151ab353d5efa51ee97ef2f","observation_id":"3aee8528-579a-4fed-8205-11dc1dea540c","resolution":{"observed_at":"2026-08-02T19:56:29.025781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2604.05341","last_updated":"2026-04-07T02:25:36Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T02:25:36Z","title":"Curr-RLCER:Curriculum Reinforcement Learning For Coherence Explainable Recommendation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:43:11.384787Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2604.05341"},"observation_digest":"sha256:3b5b01408fb1028dc5ddf9b48812af0397eec368eb8e621857ff5c190b43c256","observation_id":"a7b9b8bd-b4c5-4748-82ce-a4918d724865","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2604.08723","last_updated":"2026-04-09T19:28:17Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T19:28:17Z","title":"Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:22:00.563479Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2604.08723"},"observation_digest":"sha256:15c59fabba89a373b51021375b0bc27cdea5a3c0877ca84bc0d71c7cf703656b","observation_id":"cddd1db6-ec81-4b3c-a7e5-c64dcf347b56","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.02141","last_updated":"2026-05-04T01:46:35Z","snapshot_observed_at":"2026-08-11T01:20:14.028287Z","submitted_at":"2026-05-04T01:46:35Z","title":"On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T19:35:59.832868Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.02141"},"observation_digest":"sha256:5fd694596939a3f4fa2c716c026f5d9a4f01d9deaf8be0a935ab2a99756c11f9","observation_id":"f443fea7-b8cd-4791-b487-5ca6d634b5ac","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-10T20:20:22.759976Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:3c6588ecf06d443e04bc2928e590472bc7f1bfda0c6e0add23dfb01f18fa8028","observation_id":"6c56e097-7310-4955-acda-b5063cb3d4bd","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.08094","last_updated":"2026-04-09T18:00:47Z","snapshot_observed_at":"2026-08-11T16:18:51.927789Z","submitted_at":"2026-04-09T18:00:47Z","title":"MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:22:15.608348Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.08094"},"observation_digest":"sha256:216e4c1d77c21c29504e454247006f5b6d6b400c9850be7376807a9a593c2cfe","observation_id":"4cdde1c5-a6fa-4195-bf6e-12b1b00d862e","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:455fab4b690a5b36bad2a7139bda5fbb5868f8cba606bc670a2d0df48f029589","observation_id":"e145583c-698b-40c5-8677-aaac3491cc14","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.10805","last_updated":"2026-05-11T16:30:20Z","snapshot_observed_at":"2026-08-12T22:29:45.001721Z","submitted_at":"2026-05-11T16:30:20Z","title":"Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:00.238602Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.10805"},"observation_digest":"sha256:b18af74a67d1251cbfc8618699a8aa82a65e9165b87660c3f2ccce59f43c3dd5","observation_id":"8970bf92-f524-4ea3-b4d6-39a3f68b7ccf","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.11906","last_updated":"2026-05-12T10:18:49Z","snapshot_observed_at":"2026-08-13T22:35:54.513448Z","submitted_at":"2026-05-12T10:18:49Z","title":"YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T05:29:42.381280Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.11906"},"observation_digest":"sha256:dc51c1ba8292ab051fc24c337c13387fb25947efdb434c578bd2a95a12696e9f","observation_id":"f459a32c-788c-4e36-b98d-4479abf8e8f0","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.00869","last_updated":"2026-05-30T19:53:19Z","snapshot_observed_at":"2026-08-13T00:36:06.236099Z","submitted_at":"2026-05-30T19:53:19Z","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T19:01:18.153145Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.00869"},"observation_digest":"sha256:84f18a939446ee8f8b3a05982e3a0871b42fa7f4480a9e66512cbfd6cccb4c2e","observation_id":"d0349acd-d333-4845-8385-e9e4ec6bbcf1","resolution":{"observed_at":"2026-06-28T19:02:33.922491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.07108","last_updated":"2026-06-08T06:45:26Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T10:02:19Z","title":"DyCon: Dynamic Reasoning Control via Evolving Difficulty Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T22:16:01.457276Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.07108"},"observation_digest":"sha256:25ff372cb6a422df464d5a4a0e2a62dc59b3c16f2bb9ca84c80e7d3e89afc4ef","observation_id":"b7776c39-e0cf-4b81-9ecd-8433735cd0b0","resolution":{"observed_at":"2026-07-02T16:57:10.030422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:8af191b6df5fda43e2e8654f1d32c2cad20b4b4afc8e217456d590e472df30a4","observation_id":"d6322ad5-456d-46c5-b859-1e7907ebcf31","resolution":{"observed_at":"2026-07-02T22:47:25.924065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T12:05:18.089147Z","title":"Step-DPO: Step-wise preference optimization for long-chain reasoning of LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":4},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-08-02T12:05:18.089147Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:d2575fec3d0bf8c4cfffaf219d24350ac76084ad68c9248dfd492f88a35efab5","observation_id":"2ff953ea-7321-44d2-9486-31e62b458d5e","resolution":{"observed_at":"2026-08-02T12:05:18.089147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T13:55:35.363377Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.11119"},"observation_digest":"sha256:c212b137b3d750e3b01c1f86bd30e6b61fde70949d50afa6f49018b74116cb6e","observation_id":"765c1947-6e7a-40f9-a237-21b4d3aeec03","resolution":{"observed_at":"2026-07-03T04:27:36.668377Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:ef9eed077e8b5ddfc42eb8b03b4fc9af0391ced39c1854c6b9ca4af5b76ebd09","observation_id":"0138b81b-b3bd-49ee-90ad-45c393ff9032","resolution":{"observed_at":"2026-07-03T09:37:49.416543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-03T02:12:27.879246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:27.879246Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:256f3af4502b207ac2d29b325a111db0e29578883fdf63bfc9a35cb60913c30f","observation_id":"d88db0e8-6e3c-4970-8b32-4f9170e4df84","resolution":{"observed_at":"2026-08-03T02:12:27.879246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:47059cc8a474c6083152af5e6f472fb971fbc8b2dced9e8b5cb562bdd383ef83","observation_id":"165fabcd-4440-4baf-a1cd-42f140a0680d","resolution":{"observed_at":"2026-07-03T15:08:33.402998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-03T02:12:19.127147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:19.127147Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:6319631e8218f7a5f259c2ff3fb8a60b678cbdd7d6c864b0e191f873a93ad5d0","observation_id":"1a30c586-887c-4550-8011-78f8f7c1b6de","resolution":{"observed_at":"2026-08-03T02:12:19.127147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T03:57:19.028507Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.15932"},"observation_digest":"sha256:79d1b90f19fb2855c62dc58d43af27bc7ace0d7cf7693d1e44b7c965e125a9dc","observation_id":"fa580899-0bc5-4646-a750-1e0487fdcf0a","resolution":{"observed_at":"2026-07-03T17:38:44.174836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.26080","last_updated":"2026-06-24T17:54:08Z","snapshot_observed_at":"2026-08-02T15:38:18.729836Z","submitted_at":"2026-06-24T17:54:08Z","title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-06-25T19:55:51.114244Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.26080"},"observation_digest":"sha256:8dcecca7009be76b4516ecbba2faa50d611f5d16bed19de88a429446491c79eb","observation_id":"6d9ae9eb-77f8-48ae-80d4-99f0a7491913","resolution":{"observed_at":"2026-07-04T20:40:07.843363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.26120","last_updated":"2026-05-27T02:47:50Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T02:47:50Z","title":"Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:27:45.796650Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.26120"},"observation_digest":"sha256:fbaad4e72da6a33b4f3c6a0efcca800e3867b87e4e74f71ba65cb858ec83916c","observation_id":"d4408eb1-6fd1-4e65-a041-39d1f3336854","resolution":{"observed_at":"2026-06-29T13:33:28.303470Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.26530","last_updated":"2026-06-26T03:52:11Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T02:10:29Z","title":"DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T05:32:59.640335Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.26530"},"observation_digest":"sha256:7c6eef71034226651d75e5d00e637a1e8b9cb5a1f20dcd0ddada3d54a7d751a2","observation_id":"dbbdc301-8aa1-432d-8792-d5fdf14ce555","resolution":{"observed_at":"2026-07-04T13:09:50.060500Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.26530","last_updated":"2026-06-26T03:52:11Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T02:10:29Z","title":"DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T05:19:07.877346Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.26530"},"observation_digest":"sha256:85da7eec9f59f8e45f8d2c016ba5160cec0cdf9de823f8d171bd6f72b4cc63f8","observation_id":"1187e579-c9d9-4db7-bdca-02c9bfc88a57","resolution":{"observed_at":"2026-06-29T17:23:45.531776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.29150","last_updated":"2026-06-28T02:10:36Z","snapshot_observed_at":"2026-08-13T12:16:45.895937Z","submitted_at":"2026-06-28T02:10:36Z","title":"Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T07:55:28.254309Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.29150"},"observation_digest":"sha256:5aed9ee801bc3b2e6b67a4597451ff8736049969fd133afd35005834facaf7fb","observation_id":"bcd9bee0-47a9-4340-8155-476652639379","resolution":{"observed_at":"2026-06-30T08:04:28.377800Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2606.29905","last_updated":"2026-06-29T07:41:39Z","snapshot_observed_at":"2026-08-02T15:11:59.921772Z","submitted_at":"2026-06-29T07:41:39Z","title":"StrucTab: A Structured Optimization Framework for Table Parsing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:22:21.694355Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2606.29905"},"observation_digest":"sha256:bc208c5da0321bf10fff990e5cac750397c32dc0fd8c0b2e7c07039259dfff67","observation_id":"cfa2c755-5b1e-4f8a-9995-6e32ecd56d6b","resolution":{"observed_at":"2026-06-30T06:24:18.922918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:d2c6ed802e5763c4dddd37a4187374800251d59058e24056ab60375d06d3084d","observation_id":"08ae0c01-cea2-4452-afda-ac733a5a2c7d","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2406.18629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:75547f133ccb0b30f24b1213153d5ff38dd7528107474b9e9284b91b0d09aa60","observation_id":"52443909-5f8f-4eee-b2b7-9b01f26e98cb","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T08:40:42.479453Z","title":"arXiv preprint arXiv:2406.18629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.479453Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:df0dce87abb8661794b12c1a7640f38500dc3f3e0e418995ded29d6a690517d7","observation_id":"85614d0d-d12e-484e-976e-8ffddea0d4f4","resolution":{"observed_at":"2026-08-02T08:40:42.479453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-06T23:48:50.589215Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:0cc3f7f4e5f9438c23f9664f03fc04edaa8b86c68fca57b03c192997e571dc90","observation_id":"87b2b2cf-224f-4ae4-9ad6-dde87fe12866","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T13:42:24.987811Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20467","last_updated":"2026-05-19T06:27:58Z","snapshot_observed_at":"2026-08-10T15:36:56.356504Z","submitted_at":"2026-05-19T06:27:58Z","title":"DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T13:42:24.987811Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.20467"},"observation_digest":"sha256:69260ceaf4528aeb4db7fb5e4e218cd1203f5b3f8f22f5ebb5ff76e16186d046","observation_id":"6ad3e2a1-1796-4da4-ae1e-a62d7563a082","resolution":{"observed_at":"2026-08-02T13:42:24.987811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-11T14:59:12.114561Z","title":"Step- dpo: Step-wise preference optimization for long-chain reasoning of llms.arXiv preprint arXiv:2406.18629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-13T23:45:11.333093Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.114561Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:2c115cd429174526eea8f0acbb2dedfc52e2a80cea8303aad01c0b644004902a","observation_id":"e050620a-34d5-46d5-b4d6-852f9bc765c1","resolution":{"observed_at":"2026-08-11T14:59:12.114561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.18629/citation-record","integrity":"/paper/2406.18629/integrity","json":"/paper/2406.18629/citation-record.json","paper":"/paper/2406.18629"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:2d73088c4c8a4a4b3060d35e85e2e27582a5b35d157ea65907a01be407372d29","observation_id":"6cc6da4a-7f20-472c-93af-ce641a20af4b","resolution":{"observed_at":"2026-05-18T23:58:29.068590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":"2310.10631","doi":"10.48550/arxiv.2310.10631","metadata_source":"pith","pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llemma: An Open Language Model For Mathematics","venue":"cs.CL","work_id":"c0820dec-60a1-4f0c-beda-4516eb8e89c9","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:38b25c04beea26a1408d02fe0d6943aaf192c55ffc6ca4d582d62a409d09656e","observation_id":"5f81d01a-12e0-41f1-9710-d4a4fd8518b2","resolution":{"observed_at":"2026-05-19T08:17:47.048289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:aa36ce5fde2439b99b048c0d1c4b4cc0322c24c1a64b0caeb7514e302cfc3ae7","observation_id":"8911546b-1d35-42c6-abb5-1068da101f26","resolution":{"observed_at":"2026-05-18T23:58:29.085943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-13T05:12:36.538689Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":"2405.03553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-07-04T06:59:38.178795Z","title":"Alphamath almost zero: process supervision without process","venue":null,"work_id":"142e2ffe-057a-4f74-9691-31fc3b21fb03","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:b08361d010b5c629aca3ff8ef771727dacca22012d962ed3a510f5331873d4a7","observation_id":"95df9dbc-b51e-4716-84d4-a1ff874671d7","resolution":{"observed_at":"2026-05-18T23:58:29.092722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:b44ac16a86237444b5ad8585d039f2906215fff8b6bdd4309330fd5c71909545","observation_id":"036242d0-3f62-4f0a-9799-50689a486566","resolution":{"observed_at":"2026-05-18T23:58:29.098112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-08-13T21:12:04.800343Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":"2309.17452","doi":"10.48550/arxiv.2309.17452","metadata_source":"pith","pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","venue":"cs.CL","work_id":"8534cb5e-3749-4533-bc6f-1d85f32f41c8","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:8928af2db64d758c660d1a0131bf80c1d0157035371bd00e6fd22537d8ad243b","observation_id":"0d4146c7-3b79-4bed-a7f4-c373ae647493","resolution":{"observed_at":"2026-05-19T09:19:36.299641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:73b7a2ec54905d454c42bf9df368fc624b68fdf5d039859da39ad3b193c2d225","observation_id":"4fdd0d13-c785-45f0-b0d0-cd0d1c5cbc16","resolution":{"observed_at":"2026-05-18T23:58:29.109676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-13T04:59:53.332269Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":"2403.07691","doi":"10.48550/arxiv.2403.07691","metadata_source":"pith","pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":"cs.CL","work_id":"93ad9e7b-6db2-4249-a0fa-8a96ef124d53","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:660b383cfa9832f4ba98acb3c6a1ec7941f77df2760d5a2c5c2a821c097bfdd4","observation_id":"e81133a8-39b6-4626-b85e-6c14d1e98abd","resolution":{"observed_at":"2026-05-18T23:58:29.115187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04706","last_updated":"2024-03-07T18:00:40Z","snapshot_observed_at":"2026-08-13T00:59:53.557863Z","submitted_at":"2024-03-07T18:00:40Z","title":"Common 7B Language Models Already Possess Strong Math Capabilities","version":1},"cited_work":{"arxiv_id":"2403.04706","doi":"10.48550/arxiv.2403.04706","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Common 7b language models already possess strong math capabilities","venue":"arXiv (Cornell University)","work_id":"1fa5eff0-85a8-43ed-a52d-877fbdde5dab","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2403.04706","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:123d947cbdd3f9166b2beb512ef7a4bfb31fab54674571ff0e8fc0eefbeffb49","observation_id":"aa8c5b32-a312-4b29-ac0b-f19dd3af5479","resolution":{"observed_at":"2026-05-18T23:58:29.120167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-08-13T04:42:13.982761Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":"2401.08190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline","venue":null,"work_id":"6682ba0d-f9f8-48e9-9ffc-8bbe6fe6af5a","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:e63d97b19346c421f68ba11fe9534a4fd69f12ad3d50f3318606001244c50428","observation_id":"489efe0a-d477-4c8b-94b2-47078a1d17a9","resolution":{"observed_at":"2026-05-18T23:58:29.125069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:b8c8a00ff4b3a50b0edee6f35679cd9a58ce220d738cc86a5b691bfc1a713a30","observation_id":"c0eaa2a6-8da8-4363-8916-3cc0dc939799","resolution":{"observed_at":"2026-05-18T23:58:29.129806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-13T06:47:51.509741Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":"2404.07965","doi":"10.48550/arxiv.2404.07965","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rho-1: Not all tokens are what you need","venue":"arXiv (Cornell University)","work_id":"74e3da93-f1b3-41df-bc52-f8092041fb58","year":2025},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:51897bd22da77515ad3fabd01d627cd94b07ec8050e31eaa285cfcecd885d1a7","observation_id":"4b075053-92a5-4a37-8f89-3f69aefd8a91","resolution":{"observed_at":"2026-05-18T23:58:29.135044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04146","last_updated":"2017-10-23T16:45:03Z","snapshot_observed_at":"2026-08-13T10:15:11.378091Z","submitted_at":"2017-05-11T13:04:47Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","version":3},"cited_work":{"arxiv_id":"1705.04146","doi":"10.48550/arxiv.1705.04146","metadata_source":"pith","pith_arxiv_id":"1705.04146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Program Induction by Rationale Generation : Learning to Solve and Explain Algebraic Word Problems","venue":"cs.AI","work_id":"719ded21-2bd8-46b6-8270-4cfca53de17f","year":2017},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/1705.04146","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:2ece3b7cb6bbb6820176d37e7623080338b9ed69472e0dd42c24cc56a142c6f8","observation_id":"bb851368-450b-43be-a9a0-49a5e3f9781d","resolution":{"observed_at":"2026-05-18T23:58:29.139816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09003","last_updated":"2024-12-16T06:13:03Z","snapshot_observed_at":"2026-08-13T04:40:52.071227Z","submitted_at":"2024-01-17T06:48:16Z","title":"Augmenting Math Word Problems via Iterative Question Composing","version":5},"cited_work":{"arxiv_id":"2401.09003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2401.09003 , year=","venue":null,"work_id":"2c5a2044-9541-4ba8-b905-94fd6c8b0c6a","year":null},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2401.09003","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:5574980466908cef1a0431f2d17064839161511ca214099727cf17676bfcc4f4","observation_id":"fb61548a-ef33-449e-a772-18361de229fc","resolution":{"observed_at":"2026-05-18T23:58:29.144173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-08-13T05:48:51.271185Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":"2310.10047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving large language model fine-tuning for solving math problems","venue":null,"work_id":"168cd793-3b14-455e-b7e0-e39d3f532987","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:afdc5aae1f347846ff198bb7b89cdcb7b2ddd534a4d8dea26240a40e050a9202","observation_id":"9707572d-5283-4e31-93c5-8370a9918894","resolution":{"observed_at":"2026-05-18T23:58:29.148772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16352","last_updated":"2024-09-11T08:23:58Z","snapshot_observed_at":"2026-08-13T04:10:19.092794Z","submitted_at":"2024-02-26T07:17:25Z","title":"MathGenie: Generating Synthetic Data with Question Back-translation for Enhancing Mathematical Reasoning of LLMs","version":2},"cited_work":{"arxiv_id":"2402.16352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16352","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathgenie: Generating synthetic data with question back-translation for enhancing mathematical reasoning of llms","venue":null,"work_id":"f8e3aec6-e33d-40cf-9f14-50f364ab7463","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2402.16352","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:0868dacbfffe118eb5af491a11188e26682237ba4f67432045df2e30d94f1e67","observation_id":"7ca1941d-7477-4e79-a4dd-3ff3a5abb369","resolution":{"observed_at":"2026-05-18T23:58:29.153407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":"2308.09583","doi":"10.48550/arxiv.2308.09583","metadata_source":"pith","pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","venue":"cs.CL","work_id":"4fc3ba2f-b615-4eef-86e5-131dc8b98389","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:2335a503bf07456973e735762b809af5baf82ab8056c5391c0187a03c70116da","observation_id":"b50c459f-c26c-4ef3-86ac-73c93556487d","resolution":{"observed_at":"2026-05-18T23:58:29.158159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-13T23:44:54.604004Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":"2402.14830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-07-02T21:17:24.055449Z","title":"Orca-math: Unlocking the potential of SLMs in grade school math.arXiv preprint","venue":null,"work_id":"f616c17b-34df-49f7-aafc-f05274aa8ac7","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:6690b7eb502055f6494bde64c3cbafe2966a789c6f965ac357cfd84011b11e63","observation_id":"bd279192-e885-45f5-9df8-41ea13196fb9","resolution":{"observed_at":"2026-05-18T23:58:29.162986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:4d0ea308a42121fcc1690fb3571ffed721c39db78472929cc96dcb9a9b6e42d7","observation_id":"0d86d06d-2721-4ab5-af11-1b427c1e8f62","resolution":{"observed_at":"2026-05-18T23:58:29.167115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:5ddde613bb32e565e609f81c12aa0cfba3676aad359f6ada3123c10b89abb73b","observation_id":"2b98df74-23c5-4bb5-8021-7ac74090b29d","resolution":{"observed_at":"2026-05-18T23:58:29.171477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:80545cbc443e5ad35391e4f8fdb9114d95772a3538f77f2323a4426c650f1475","observation_id":"e8ed9e34-afb2-4b82-8dd0-7d5de9925bf6","resolution":{"observed_at":"2026-05-18T23:58:29.175855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02884","last_updated":"2024-03-05T11:42:59Z","snapshot_observed_at":"2026-08-13T04:03:09.278630Z","submitted_at":"2024-03-05T11:42:59Z","title":"MathScale: Scaling Instruction Tuning for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2403.02884","doi":"10.48550/arxiv.2403.02884","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02884","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":"arXiv (Cornell University)","work_id":"450d5342-49ed-44d9-85e1-41826683418c","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2403.02884","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:c86e01e9ca1ff3abf52b555240193f8a64b3411828a57d2e25dd0a236d8c5cd3","observation_id":"6de8ae2e-03b9-44ec-a1c8-60d64d7d8cbd","resolution":{"observed_at":"2026-05-18T23:58:29.180880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20046","last_updated":"2024-06-07T06:27:50Z","snapshot_observed_at":"2026-08-13T18:52:47.212315Z","submitted_at":"2024-03-29T08:30:34Z","title":"Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning","version":2},"cited_work":{"arxiv_id":"2403.20046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20046","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can llms learn from previous mistakes? investigating llms’ errors to boost for reasoning","venue":null,"work_id":"a8c74822-02c5-4e19-a13f-653456cd61f7","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2403.20046","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:326244bd478822b05e75cab65668195b9c88ec7b2d984e08f1360e444c8951a2","observation_id":"889dc090-5a34-4059-9d08-6d37ed4e0238","resolution":{"observed_at":"2026-05-18T23:58:29.185916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10176","last_updated":"2024-11-03T03:48:02Z","snapshot_observed_at":"2026-08-13T04:18:05.653638Z","submitted_at":"2024-02-15T18:26:11Z","title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","version":2},"cited_work":{"arxiv_id":"2402.10176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10176","snapshot_observed_at":"2026-07-10T18:17:33.884574Z","title":"Openmathinstruct-1: A 1.8 million math instruction tuning dataset.arXiv preprint arXiv: Arxiv-2402.10176","venue":"cs.CL","work_id":"9000f710-e68c-43ea-854e-4e984f57f380","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2402.10176","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:f9399f98f4df92ef4ca2ca872782be451221589eb7e729475a07c2d8277f616c","observation_id":"d17fe6da-b6cc-4608-972f-a4cf8b53a4e7","resolution":{"observed_at":"2026-05-18T23:58:29.190696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:b113ca49cce4d3864516c5a5af4f9afbb612f372baca281b3d26ba7b119e3825","observation_id":"1a383ce5-5ad3-408e-8c76-85838ec2650c","resolution":{"observed_at":"2026-05-18T23:58:29.195217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":"2310.16944","doi":"10.48550/arxiv.2310.16944","metadata_source":"pith","pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zephyr: Direct Distillation of LM Alignment","venue":"cs.LG","work_id":"ac74d5bf-9895-4253-9324-f50a8a6d9f20","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:0b971d01f56941c2bed49a148667e9db97370976a2725d3caed32edb61ad1f10","observation_id":"ec1fd29b-da13-44ce-961b-f320537be3cc","resolution":{"observed_at":"2026-05-18T23:58:29.200511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-08-13T05:55:59.432178Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2310.03731","doi":"10.48550/arxiv.2310.03731","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning","venue":"arXiv (Cornell University)","work_id":"36308722-f027-40ce-b4e0-8d2c26bb0f9e","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:46353e65342efa6bd619832fd7f9f50849dae99926d0b33f2537cccc44b30367","observation_id":"d0abb843-beab-40b5-a7d1-4f466f8d5266","resolution":{"observed_at":"2026-05-18T23:58:29.205867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-08-13T00:00:48.229211Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":"2405.14333","doi":"10.48550/arxiv.2405.14333","metadata_source":"pith","pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data.https: //arxiv.org/abs/2405.14333","venue":"cs.AI","work_id":"dbc70c01-dc01-42b7-8edc-25b7f061d5d6","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:63a9fbfc3c163710aeb66d5eab0ac6a60d737456908a99fa7c46390d95dbe595","observation_id":"b9903deb-c0fe-4bc6-b8b1-85f6d9478e51","resolution":{"observed_at":"2026-05-18T23:58:29.210896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02893","last_updated":"2024-04-03T17:51:18Z","snapshot_observed_at":"2026-08-13T00:38:17.242638Z","submitted_at":"2024-04-03T17:51:18Z","title":"ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline","version":1},"cited_work":{"arxiv_id":"2404.02893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02893","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm-math: Improving math problem-solving in large language models with a self-critique pipeline","venue":null,"work_id":"379097c7-4ef1-4610-953d-3d31665252c0","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2404.02893","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:ecdcf410d849714b03da3d669685795c1f693547d78a97519d580162a27edf2a","observation_id":"b0635685-0424-427f-954b-7dae3584314e","resolution":{"observed_at":"2026-05-18T23:58:29.215547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-13T04:22:39.632135Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":"2402.06332","doi":"10.48550/arxiv.2402.06332","metadata_source":"pith","pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Internlm-math: Open math large language models toward verifiable reasoning","venue":"cs.CL","work_id":"da7fe877-735e-4436-9e53-837121a0b2d0","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:298a12fe632712ec26aad5e5d67a57f3730fcb0fb9593d39146fb72c960b5db3","observation_id":"26791200-3458-4d05-8142-c370e8dc9306","resolution":{"observed_at":"2026-05-18T23:58:29.220895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13007","last_updated":"2024-08-02T14:18:51Z","snapshot_observed_at":"2026-08-13T11:55:17.225242Z","submitted_at":"2023-04-25T17:27:37Z","title":"Answering Questions by Meta-Reasoning over Multiple Chains of Thought","version":4},"cited_work":{"arxiv_id":"2304.13007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13007","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yoran, T","venue":null,"work_id":"adc7a11e-f57e-4fb2-afd3-0fb22171adf8","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2304.13007","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:61fcb5a9606c06303d003428184c2cfc15b0e74560a9ac37f6c9c005ed8c6095","observation_id":"9e3522f4-4a64-419a-8bb9-b4f87a7d88a2","resolution":{"observed_at":"2026-05-18T23:58:29.225691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-13T10:57:13.012119Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":"2309.12284","doi":"10.48550/arxiv.2309.12284","metadata_source":"pith","pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","venue":"cs.CL","work_id":"e791a2f0-3b75-4c5b-84e1-d297d96e42f0","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:6bafdf6de5d942a00c8f4cd6f6412b621da12284f29f6be800c69126811a8a32","observation_id":"859f9129-73d9-43d8-84d4-4772f4109909","resolution":{"observed_at":"2026-05-18T23:58:29.230072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.01825","doi":"10.48550/arxiv.2308.01825","metadata_source":"pith","pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","venue":"cs.CL","work_id":"15eea2e2-dff3-42a7-842a-b663d50f64cb","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:f85d12105480acd1359808d0bb3515f8aec60b215aedb78ebb16a23dca39a572","observation_id":"48280907-40fd-4801-94bb-c33f2fdc1998","resolution":{"observed_at":"2026-05-18T23:58:29.234743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2309.05653","doi":"10.48550/arxiv.2309.05653","metadata_source":"pith","pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","venue":"cs.CL","work_id":"e74feaec-ca8a-4bdb-945e-e747355406e7","year":2023},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:e2b160ac30d98c7a33af473ceec6ef7884d03b1634b1d9a1852465e805210f71","observation_id":"94c1f6e1-2a00-4a6c-9985-8f2832498306","resolution":{"observed_at":"2026-05-18T23:58:29.240596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03548","last_updated":"2024-05-23T16:34:35Z","snapshot_observed_at":"2026-08-13T00:13:54.072188Z","submitted_at":"2024-05-06T15:11:38Z","title":"MAmmoTH2: Scaling Instructions from the Web","version":4},"cited_work":{"arxiv_id":"2405.03548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03548","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mammoth2: Scaling instructions from the web","venue":null,"work_id":"94ee31c1-aec5-428f-8809-8cb5d9c313c9","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2405.03548","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:c65307ea97835f8d061ca7467a5348bfbb96c8dac5b3078d9d97462fc19680fe","observation_id":"923df388-c29d-4125-bfce-3ad63a44236e","resolution":{"observed_at":"2026-05-18T23:58:29.245776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":"2205.10625","doi":"10.48550/arxiv.2205.10625","metadata_source":"pith","pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":"cs.AI","work_id":"7e58c111-4666-4996-b5ad-1c8efd433083","year":2022},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:04f80ca754fc8ff32894d925d4af7e79164cb35fa7864e87c2d1c3c09690199f","observation_id":"17f98e61-12f4-4375-90f7-b28e009959fa","resolution":{"observed_at":"2026-05-18T23:58:29.251197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14365","last_updated":"2024-05-23T09:43:19Z","snapshot_observed_at":"2026-08-13T00:00:46.056902Z","submitted_at":"2024-05-23T09:43:19Z","title":"JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models","version":1},"cited_work":{"arxiv_id":"2405.14365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14365","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X., Sha, J., Sheng, Z., Wang, S., and Wen, J.-R","venue":null,"work_id":"69c8da0a-43bf-4a08-ad7b-3869abc66771","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2405.14365","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:3843dc13313ce18e391af4bf7d76a63ec0c9f7f2c014e0a57af421dc3bbd335a","observation_id":"80e66f49-39ce-4d1d-82d9-3d72e932817a","resolution":{"observed_at":"2026-05-18T23:58:29.256685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":"2406.11931","doi":"10.48550/arxiv.2406.11931","metadata_source":"pith","pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","venue":"cs.SE","work_id":"713a39be-8c4e-4ee3-8671-11cf9379262f","year":2024},"citing_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T23:58:29.040819Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2406.18629"},"observation_digest":"sha256:eb25d08592f5cc4895a49c5a3cb43cc09f5b0c028a760747a663c94056e529df","observation_id":"b76230c7-eec0-420b-a315-402e3895a086","resolution":{"observed_at":"2026-05-18T23:58:29.261388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 75 inbound Pith citation observations for arXiv:2406.18629."}