{"as_of":"2026-08-11T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba02b515cb79ee215c9705961150785b0343a5071ccd854e32b661a816ac699a","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:40:42.872339Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:30:01.059028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04763","snapshot_observed_at":"2026-08-03T15:30:01.059028Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29010","last_updated":"2026-07-31T04:24:16Z","snapshot_observed_at":"2026-08-08T06:41:11.996778Z","submitted_at":"2026-07-31T04:24:16Z","title":"EvoReason: Self-Evolving Reasoning Primitive-Guided On-Policy Distillation for Latent Reasoning in Generative Recommendation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T15:30:01.059028Z"},"links":{"cited_paper":"/paper/2607.04763","citing_paper":"/paper/2607.29010"},"observation_digest":"sha256:13282f9b4d2f0100882e1eff5679e3b08ca0c5e32d72a32bb67522b654d27e0e","observation_id":"09d3c1f3-c066-4967-a71c-eaaffacc1212","resolution":{"observed_at":"2026-08-03T15:30:01.059028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.04763/citation-record","integrity":"/paper/2607.04763/integrity","json":"/paper/2607.04763/citation-record.json","paper":"/paper/2607.04763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:30.224369Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.224369Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:576848ad5c5b7d2b061f715c5a1f7ddc2e0140cf46752ed0b3df682b92a59892","observation_id":"9f443ffd-8362-49eb-bfae-22b322c58694","resolution":{"observed_at":"2026-08-02T08:40:30.224369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-02T08:40:30.324022Z","title":"arXiv preprint arXiv:2212.03533 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.324022Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:40ae8c8e9dce7948f41fd231b6c255bb8947799635fead3b1be85d4e5868c164","observation_id":"f1336d3e-9266-4ac5-bbfc-97c85160e992","resolution":{"observed_at":"2026-08-02T08:40:30.324022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:30.457462Z","title":"Proceedings of the 2020 conference on empirical methods in natural language processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.457462Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e2d9c27d3a01ef5106cb942679b23fa4e3ab5f070e8d01314bc81fef278c2ce2","observation_id":"7fc72b79-7772-4889-8a16-0f2edb942c82","resolution":{"observed_at":"2026-08-02T08:40:30.457462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:30.574860Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.574860Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:8dbbb30cd87c7f528cd737b559f3dc030cf8983c8871d80a2fd44d113b658ab6","observation_id":"baed1806-3062-421c-8bc1-68798732de3c","resolution":{"observed_at":"2026-08-02T08:40:30.574860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:30.695664Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.695664Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:036068703fb240cc25fd79a7f822eac651afcf27107155b915e38e8fb3571d84","observation_id":"3ce64a91-a090-4428-a27f-b80b9bbbac3f","resolution":{"observed_at":"2026-08-02T08:40:30.695664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-02T08:40:30.860607Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.860607Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:05fcf5c6ee884e7c36f9ad11c438805bc02a76ecb10a7e7dd46672e1ff3da218","observation_id":"94141de7-8be5-4d4a-8104-c3f0c383da82","resolution":{"observed_at":"2026-08-02T08:40:30.860607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:30.987077Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:30.987077Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:abb63da77f760c739771db07b75632544db39f5ef0748750673ed56dee081fe0","observation_id":"b86297d8-c780-4a18-bb0c-ab0c0c567073","resolution":{"observed_at":"2026-08-02T08:40:30.987077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.063677Z","title":"Hugging Face repository , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.063677Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ac67a8679a82ec653ada9f12d8d3e13b4543a1932890daf781d5ea7e58f30915","observation_id":"1cc13f30-31aa-462b-8616-15789eef77d7","resolution":{"observed_at":"2026-08-02T08:40:31.063677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-02T08:40:31.207661Z","title":"arXiv preprint arXiv:2504.11536 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.207661Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c661287cc1529110d429856cc0cb451abff46b77b0403fdf10b4a5b29f206904","observation_id":"ef84c5aa-781c-4547-860d-5637c28636db","resolution":{"observed_at":"2026-08-02T08:40:31.207661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T08:40:31.270884Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.270884Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0f195dd1296d3071461d5cbf38bcc7aab1562cd5d5b1090594957dbe0921c1c0","observation_id":"24806139-c91e-4364-aebe-37f62c053b82","resolution":{"observed_at":"2026-08-02T08:40:31.270884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.392647Z","title":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (ACL) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.392647Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:fad88d4c3183dc1870826cbc38c722e52f37318a42a7e4de642d005c32efad10","observation_id":"3998160e-d330-41db-a29b-35ab63f05034","resolution":{"observed_at":"2026-08-02T08:40:31.392647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.522460Z","title":"Proceedings of the 28th International Conference on Computational Linguistics (COLING) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.522460Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6300393bf038ec8380db06bfd087b87c202b99fbd6cd83ede0f6330b55fed215","observation_id":"676fddcd-e256-4d32-8ec9-d2ae00ecc602","resolution":{"observed_at":"2026-08-02T08:40:31.522460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.670002Z","title":"Transactions of the Association for Computational Linguistics (TACL) , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.670002Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:717798d6c5dde7dd0a88cfc3d975a8eecd4bb9fb960610107529f43f7377e4ef","observation_id":"6c0f9ccf-b2c0-442c-b62e-d55546d7bef9","resolution":{"observed_at":"2026-08-02T08:40:31.670002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.816310Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.816310Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b53b85377b5e4359e5083d465ad8b02fb59000261ded9c329d2178536df42123","observation_id":"a404641d-57cb-4d5d-9a28-6cfaf69c11d0","resolution":{"observed_at":"2026-08-02T08:40:31.816310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:31.962421Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:31.962421Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:107f19f8e06cda5d5e3260ea196db96c414950ae18297a5d0245599405f0b7bc","observation_id":"c3391810-ad72-4917-9f6c-efdb4428422a","resolution":{"observed_at":"2026-08-02T08:40:31.962421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.146843Z","title":"Langley , title =","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.146843Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:18243ffd52be0dd76ac013ca78e8c05ff595a30c88f2bb3e1245c8661ca6d4fc","observation_id":"68de4c08-32ba-451a-a155-16fbfde9defe","resolution":{"observed_at":"2026-08-02T08:40:32.146843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.281887Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.281887Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3aecb9c0f278298216bb8f994ede6805ba2a538bfd40ef26381c5efb3f760b79","observation_id":"dde49871-d451-4f36-8bd2-8851a462c72f","resolution":{"observed_at":"2026-08-02T08:40:32.281887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.394207Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.394207Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6c48fe71bf5e7575e23eff1d6ead80b90fd5278e54fadf623c9b7f750ce53c8b","observation_id":"b3ecfb01-0095-44ce-ad21-fd3c930ee143","resolution":{"observed_at":"2026-08-02T08:40:32.394207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.510605Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.510605Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:a63d26dbf0f7cbd89ce76b5060ff446129fb835442c6131f768d7f29a9ecd637","observation_id":"aa145834-047c-4961-902a-9b90d23d035a","resolution":{"observed_at":"2026-08-02T08:40:32.510605Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.622142Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.622142Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f6de8398074ca04b3a6a78c85c17ebc3e3b1aecf05d82435a18ffd12f420c42e","observation_id":"a544614c-13b1-4c90-bd04-7d41bff4ffd3","resolution":{"observed_at":"2026-08-02T08:40:32.622142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.747711Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.747711Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:dd19c32bf6e7ab5faf2c0f592b43549e8f0c05a46c3cef557afab431512b795d","observation_id":"0ac50a24-4dd5-4fcb-97a7-15ba90179030","resolution":{"observed_at":"2026-08-02T08:40:32.747711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.889724Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.889724Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b04a0841a608c7af280a3b9025841800cfd1ef618b146d3c22d698f723e1a563","observation_id":"6ce12b81-7b75-45fc-b22a-aba9c048ca31","resolution":{"observed_at":"2026-08-02T08:40:32.889724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:32.978498Z","title":"Newell and P","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:32.978498Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e68bcb17d7b3b37aa062a10e566b4a9a51a3b1f5489ba288e5de1bee0ea9c6ac","observation_id":"17405cd1-3d3b-47b8-8f4a-1a2f7a51319b","resolution":{"observed_at":"2026-08-02T08:40:32.978498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-02T08:40:33.092361Z","title":"arXiv preprint arXiv:2501.07301 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.092361Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ccc26035019192ee5b41183c90c2f052d3ff577ac9cc90b478e181372befa16e","observation_id":"a5688e5f-6f64-4ba4-9d60-1984f0e11167","resolution":{"observed_at":"2026-08-02T08:40:33.092361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.219015Z","title":"GitHub repository , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.219015Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:665b13aabe3f1243005081d6d9b4a0cc68b41c8600f65162132cd0cc16b41e9e","observation_id":"fe31b435-ad89-4af7-8f3c-35f651116117","resolution":{"observed_at":"2026-08-02T08:40:33.219015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-11T19:29:14.663052Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-02T08:40:33.379008Z","title":"arXiv preprint arXiv:2412.06559 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.379008Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7d075013136ab0da1066837f8891b5b9af0b821a9eaab42cb88d1cea2d730340","observation_id":"1762d531-7f5d-4e71-beba-e3e37b041e23","resolution":{"observed_at":"2026-08-02T08:40:33.379008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.502772Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.502772Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b067a04c66177ebfb8f4f5daf0294edc23f9ae64e5fcd550adf3d766e6a5e149","observation_id":"67f1bd67-2b41-48bc-9aaa-25bbc030fc27","resolution":{"observed_at":"2026-08-02T08:40:33.502772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.598903Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.598903Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b5aa6b2b6feb8c2bf9a0ad2d8c7f531120db4de6476906d703d7867b4d62e27d","observation_id":"752cbdd9-4649-4b5e-82b5-18645ac4b389","resolution":{"observed_at":"2026-08-02T08:40:33.598903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.758155Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.758155Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:af3568b6d92cc0455a78259452852f3d890ee079395f41a4eb1f2efaaff0f532","observation_id":"9a6ea6c5-23bb-4b5c-bc83-bc02b64b8147","resolution":{"observed_at":"2026-08-02T08:40:33.758155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.857352Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.857352Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e2b59d9d5affd0779cc9941add01f31d8aebea550e885ab3884cfedc960231e0","observation_id":"2795fa85-3430-48d4-b071-b3f454479979","resolution":{"observed_at":"2026-08-02T08:40:33.857352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:33.969923Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:33.969923Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:955b871c8431eadb2a8bea8581eb3f75243c5fdbd7df42d664a4b538e7917487","observation_id":"b7fa51f1-e716-4864-af9b-10dd0af16192","resolution":{"observed_at":"2026-08-02T08:40:33.969923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:34.175817Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.175817Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:8392041bf11802d7c43c32949932d35636cc1e479c0579954b6ead9b152efc22","observation_id":"c9493bcf-bb4b-4c58-91b9-018ed6a6aabe","resolution":{"observed_at":"2026-08-02T08:40:34.175817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:34.285961Z","title":"Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.285961Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:23923f13e5d7083a4e5a037e74ede5043906eff6e467a3e41cf3c64aced6bb39","observation_id":"d2302034-396f-4799-9db9-60a4e84d5d7c","resolution":{"observed_at":"2026-08-02T08:40:34.285961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-02T08:40:34.391896Z","title":"arXiv preprint arXiv:2211.00053 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.391896Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3450380043b8332914f3a1f021f69d6d31874dcab545e7368596fc2facca13d8","observation_id":"24b67dc4-17e7-4270-8a97-7b57822cb507","resolution":{"observed_at":"2026-08-02T08:40:34.391896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-02T08:40:34.589724Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.589724Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e968b89245ff8e76d62f71c6a68ffda56e2694c63e9d7228f9fd64646a0f6807","observation_id":"49439340-2569-4632-95ad-47fb2e9ae9a0","resolution":{"observed_at":"2026-08-02T08:40:34.589724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-02T08:40:34.748668Z","title":"arXiv preprint arXiv:2407.18219 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.748668Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6c42a232ad125ba5430d98e22e29aef4af03298707cdc2ec830a9a268f92210a","observation_id":"c7b4aa52-d7cf-430f-bdad-2f7118defa76","resolution":{"observed_at":"2026-08-02T08:40:34.748668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-02T08:40:34.864629Z","title":"arXiv preprint arXiv:2409.13156 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:34.864629Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:5b05edc3ea55919affce2ae9fc83bcbca59316f6c0dc2487960b21e1cfc6c38f","observation_id":"3c81f251-c07b-4059-a2c3-79fcf80c5546","resolution":{"observed_at":"2026-08-02T08:40:34.864629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-02T08:40:35.009644Z","title":"arXiv preprint arXiv:2409.12917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.009644Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c7b0cdf73eeb02c00309a9fab418e7cba97c19d7aa95a8d2f616f25b3d60b25b","observation_id":"9e4255ad-0064-422d-bb92-ed138bd982b2","resolution":{"observed_at":"2026-08-02T08:40:35.009644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:35.127508Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.127508Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:95c6d53d924b119d8a4165c130268da3e8a7c1127fb8b5d31a15913dff8efbe8","observation_id":"b300545e-6bc3-4a35-b8d3-9a1585203b2e","resolution":{"observed_at":"2026-08-02T08:40:35.127508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-02T08:40:35.247088Z","title":"arXiv preprint arXiv:2310.01798 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.247088Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1283de158fd75b585f0dbf7bf1ebceb66e064def66f1eb2f111d11cfacd06a04","observation_id":"09af1700-6f18-4f2f-ad7e-09b2672d4da5","resolution":{"observed_at":"2026-08-02T08:40:35.247088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-02T08:40:35.403262Z","title":"arXiv preprint arXiv:2310.03708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.403262Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7cd8dc43abde4f8f9478c64f160b76b237b9518ae655d1ecec66e952dd8a60fc","observation_id":"9b049245-6f1f-4954-a740-096908245922","resolution":{"observed_at":"2026-08-02T08:40:35.403262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:35.548203Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.548203Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:753dd85c1c1c51cf1d76f2e6f02aca6a155d6832f540794bc6deff06a5c75dc5","observation_id":"337bc30f-ea88-46cc-851c-97563e60a527","resolution":{"observed_at":"2026-08-02T08:40:35.548203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-10T14:10:01.251470Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-02T08:40:35.672115Z","title":"arXiv preprint arXiv:2403.19159 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.672115Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:062b1a410e238bf827ea0dff3585461ee6be57f58d75319c32520e4be8fda765","observation_id":"e9477601-761a-464d-ba86-7f81ed5390dd","resolution":{"observed_at":"2026-08-02T08:40:35.672115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11817","last_updated":"2024-06-17T17:55:38Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:55:38Z","title":"Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11817","snapshot_observed_at":"2026-08-02T08:40:35.809095Z","title":"arXiv preprint arXiv:2406.11817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:35.809095Z"},"links":{"cited_paper":"/paper/2406.11817","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3765d75b1116bbe0fc782b38bb1c06b516f60abd4385aa31fd5af503eef8fcc7","observation_id":"45b25298-d644-4be9-a4e3-e3cd9ab28394","resolution":{"observed_at":"2026-08-02T08:40:35.809095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-10T12:58:47.242770Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T08:40:36.004785Z","title":"arXiv preprint arXiv:2403.04642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.004785Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:36f959abbfd89fca2ffc121775f86cb0c370caf576bb8d8f1dd3d4a1c8488500","observation_id":"15e17f8c-3d1d-4117-a752-b61ea7913795","resolution":{"observed_at":"2026-08-02T08:40:36.004785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:36.184768Z","title":"Hashimoto , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.184768Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b7b9243bd6015176dc45885707d6158efe2c8def439c916f44c480890e8a9354","observation_id":"d3636e34-c2e4-4ae9-88f7-2d8b3818795f","resolution":{"observed_at":"2026-08-02T08:40:36.184768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:36.356815Z","title":"2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.356815Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:19e9b00cd1a0c9012337477c4042b0e6154d18b2ee2a564c96c491a9a88aac15","observation_id":"43ad6cec-431b-48e7-a216-abfaa752c32c","resolution":{"observed_at":"2026-08-02T08:40:36.356815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-06T18:01:31.723021Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-02T08:40:36.488598Z","title":"arXiv preprint arXiv:2012.09816 , year=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.488598Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:062717fb5d55f3083391f5156ed220714084d67d3d88b782b9a3cdfd18636490","observation_id":"5a86c0ce-2077-42e8-9bfc-5fe801ea1dec","resolution":{"observed_at":"2026-08-02T08:40:36.488598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-10T03:45:00.871928Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-02T08:40:36.627944Z","title":"arXiv preprint arXiv:1806.03822 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.627944Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:85163d3bb4731611172492dca6a4d2d035059485ae6334f01296dda994bddf8c","observation_id":"4d4d236d-1d70-41a1-be45-83fe3dc9b27d","resolution":{"observed_at":"2026-08-02T08:40:36.627944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:36.784779Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.784779Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:bd04e0f5743db6fc25d5cae67df3919e8d8a55bbc25c5b718b3b16c81135da73","observation_id":"38ca4a2a-9194-4b5e-b5fd-21168d18833b","resolution":{"observed_at":"2026-08-02T08:40:36.784779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:36.911975Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.911975Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0f8f0f53aac695a90191046e6178264215a879281aedaed25da4db0f8871de6d","observation_id":"af13d23a-4ffe-4f47-aded-4a9c6e2c9efd","resolution":{"observed_at":"2026-08-02T08:40:36.911975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:37.091342Z","title":"2024 , publisher =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.091342Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:527cb4b516d856a95a5ecc088d0fbd97ad427ea16e3627125882fa1cfaeb26f4","observation_id":"ab1836fa-823a-4bf7-b867-5974bfa74b56","resolution":{"observed_at":"2026-08-02T08:40:37.091342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:37.204832Z","title":"ACM Transactions on Information Systems (TOIS) , volume=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.204832Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:82810d4a520caa7e155e81b1d6eebba0b99acdb8a74bb72f50fcddca0ae6a74b","observation_id":"5f3c4dd8-ab74-45ef-b9a4-2c089d436537","resolution":{"observed_at":"2026-08-02T08:40:37.204832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:37.285743Z","title":"doi:10.57967/hf/0513 , publisher =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.285743Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:eedb5dddfdb30078ff992ce1378039f3265cd30e5af93682f5f0501d3e85d203","observation_id":"5ea71156-63e4-4bb1-bd8a-be90a8fbe852","resolution":{"observed_at":"2026-08-02T08:40:37.285743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-10T18:32:18.501904Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-02T08:40:37.369447Z","title":"arXiv preprint arXiv:2408.15240 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.369447Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3e185f3ca63ccf2515b8c68cd6606622effafc25e3c1a4b9329e1ba0e7fa7d14","observation_id":"79dd8db8-7b58-4a8b-b936-fc16176c280b","resolution":{"observed_at":"2026-08-02T08:40:37.369447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-02T08:40:37.485022Z","title":"arXiv preprint arXiv:2410.12832 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.485022Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:a22ab618155cce915f172873706e95f81591c503d866f21fb85f565bb1deaab7","observation_id":"cde80cf6-ed03-41cb-a4c6-1dded28bf69c","resolution":{"observed_at":"2026-08-02T08:40:37.485022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-07-30T18:16:51.527587Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-02T08:40:37.580679Z","title":"arXiv preprint arXiv:2401.12187 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.580679Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:a2b9bc76df411a09f5d92ee667dc47211867bd583302ecca992cb5ca390abcb3","observation_id":"42f096b6-45c0-42cb-8ad9-9578d5e75310","resolution":{"observed_at":"2026-08-02T08:40:37.580679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:37.766104Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.766104Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7533093c138a3ba8f233242da4fd3ecd714708bff48769d297d9fa7f63103d7e","observation_id":"06d6db6a-3d7b-41b0-ab22-7d0822e031e6","resolution":{"observed_at":"2026-08-02T08:40:37.766104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13690","last_updated":"2024-12-23T17:32:21Z","snapshot_observed_at":"2026-08-05T19:05:54.552558Z","submitted_at":"2024-06-18T07:14:02Z","title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13690","snapshot_observed_at":"2026-08-02T08:40:37.931798Z","title":"arXiv preprint arXiv:2407.13690 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.931798Z"},"links":{"cited_paper":"/paper/2407.13690","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:14966f68cfc49db1a2358b82deb3bac5b5271a892b0b9a4eb56fc3dc3c5487ad","observation_id":"d1771369-4264-4d3c-9503-6f2f51d0efeb","resolution":{"observed_at":"2026-08-02T08:40:37.931798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-10T04:20:06.578723Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-02T08:40:38.041034Z","title":"arXiv preprint arXiv:2407.14622 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.041034Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c3c52cdd8790bac2ba43b850f8ca119390d5bb5034b49c10a7bd09ed75219e4c","observation_id":"d7d425d7-542b-4f87-8f9f-41bd278ad717","resolution":{"observed_at":"2026-08-02T08:40:38.041034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:38.173978Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.173978Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:aadf7dd36c27ea70ab474a19bc79ae3ea721fe84129018d66433e008a5c8e74d","observation_id":"ced94b72-b359-4ad9-b517-b3e03c37d5db","resolution":{"observed_at":"2026-08-02T08:40:38.173978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07319","last_updated":"2024-02-11T22:40:12Z","snapshot_observed_at":"2026-08-07T04:02:57.297390Z","submitted_at":"2024-02-11T22:40:12Z","title":"ODIN: Disentangled Reward Mitigates Hacking in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07319","snapshot_observed_at":"2026-08-02T08:40:38.315887Z","title":"arXiv preprint arXiv:2402.07319 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.315887Z"},"links":{"cited_paper":"/paper/2402.07319","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:2b14ac478b827d8f88f936ca11af40232b39c7497120197bf21abef555e5f736","observation_id":"768ec640-82d1-4148-9f71-238efeaac97c","resolution":{"observed_at":"2026-08-02T08:40:38.315887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T08:40:38.483807Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.483807Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:79c35ede00381b7ddee7782cda0f13fc96b2216965e67e1b36d75b99e38fb751","observation_id":"ed92659c-72d6-4e18-963b-ab19742f152e","resolution":{"observed_at":"2026-08-02T08:40:38.483807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:38.588624Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.588624Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:dcfd6587a689bcba21563d7bfaaab963c690ce482e9e1ab2a23b030e72b13380","observation_id":"bc1f96a0-d5b4-447c-bfa8-bc4840830c6a","resolution":{"observed_at":"2026-08-02T08:40:38.588624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:38.643258Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.643258Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0a774482c60bec339de778c61d6be041dda58342cbe910750569c52c76b22e8b","observation_id":"22d5c9f1-4e25-49d2-8275-3fb8638b6810","resolution":{"observed_at":"2026-08-02T08:40:38.643258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-08-08T19:18:06.171048Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-02T08:40:38.769023Z","title":"arXiv preprint arXiv:2305.11206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.769023Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:4b2a7dc43f67c28d88bd3ffa8f38c4cb07e8691fa0a7fe3e1c6f9613be63c2fd","observation_id":"3902999d-d6ef-4a8d-8d30-d40e98904309","resolution":{"observed_at":"2026-08-02T08:40:38.769023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-02T08:40:38.941759Z","title":"arXiv preprint arXiv:2309.17452 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:38.941759Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:9e4482f0b5f389fef8b1a2885ac0703268ff002ff089952cca6809c168872893","observation_id":"88a6371e-ac61-4295-bbac-8c2669572b83","resolution":{"observed_at":"2026-08-02T08:40:38.941759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-02T08:40:39.023948Z","title":"arXiv preprint arXiv:2404.02078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.023948Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:22fc84c796c3ca8f612fff945f15d12c6f3302a8406723b11cc9dd347e051f60","observation_id":"350e3b83-e95c-497e-96fa-f4c9f3db9a24","resolution":{"observed_at":"2026-08-02T08:40:39.023948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-02T08:40:39.153039Z","title":"arXiv preprint arXiv:2308.09583 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.153039Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e844e69150610b55c81f94e9b51e6aaa357b0147ac60a93ab2186f074cc1a76c","observation_id":"7ed1519e-8eb9-481f-995a-7df541fbaee7","resolution":{"observed_at":"2026-08-02T08:40:39.153039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-02T08:40:39.278322Z","title":"arXiv preprint arXiv:2404.19733 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.278322Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:af3c554e933429bfc6b7e38f520fa580ad8479a58c5af03699bab1cc0f4a35c8","observation_id":"511bdc20-4e3c-465d-951f-fbe531153738","resolution":{"observed_at":"2026-08-02T08:40:39.278322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-02T08:40:39.434503Z","title":"arXiv preprint arXiv:2305.20050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.434503Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:8a0fdc9656aae507023822ef856c093b462a6ad33811b931b8e7d5c1fc8ae2dc","observation_id":"b8458bb9-1226-4e19-842e-bb86044fa609","resolution":{"observed_at":"2026-08-02T08:40:39.434503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03548","last_updated":"2024-05-23T16:34:35Z","snapshot_observed_at":"2026-08-10T09:54:53.085558Z","submitted_at":"2024-05-06T15:11:38Z","title":"MAmmoTH2: Scaling Instructions from the Web","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03548","snapshot_observed_at":"2026-08-02T08:40:39.565899Z","title":"arXiv preprint arXiv:2405.03548 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.565899Z"},"links":{"cited_paper":"/paper/2405.03548","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f1c63389f8c989a114176e9aed0e82dff9c38d865363e5c1706743f4e6f3f35c","observation_id":"21481048-a15e-45ca-a546-1ff1ed5e919a","resolution":{"observed_at":"2026-08-02T08:40:39.565899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16767","last_updated":"2024-12-10T03:17:30Z","snapshot_observed_at":"2026-08-10T13:06:16.447408Z","submitted_at":"2024-04-25T17:20:45Z","title":"REBEL: Reinforcement Learning via Regressing Relative Rewards","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16767","snapshot_observed_at":"2026-08-02T08:40:39.691665Z","title":"arXiv preprint arXiv:2404.16767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.691665Z"},"links":{"cited_paper":"/paper/2404.16767","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7ea9fb639173a7f3b1c21e4b939c49d852ee5b790211b427243f324f6993fffe","observation_id":"053ca9e2-88b8-4a03-8e0f-f300343c83cb","resolution":{"observed_at":"2026-08-02T08:40:39.691665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-10T23:49:19.260833Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-02T08:40:39.787640Z","title":"arXiv preprint arXiv:2405.00451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.787640Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:4836b06c3d7c596695c67b5efd6cdea44f8d66cee8f765a7c3624771c33a40ec","observation_id":"611ae85f-0e67-41c6-b984-776c7bf72877","resolution":{"observed_at":"2026-08-02T08:40:39.787640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:39.909147Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.909147Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:951f2dd48377e27c15370d7e7517c0781f02f1a99224a948eec20e6907c5996f","observation_id":"7bec1b78-d10d-4bae-a9da-fd714f79ffbc","resolution":{"observed_at":"2026-08-02T08:40:39.909147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-02T08:40:39.974766Z","title":"arXiv preprint arXiv:2406.10858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.974766Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a14e8e1eb5a95e1b0c5e37f2f2528aa8a7b8f454d74ebd0a85bfcfcbaf924ca","observation_id":"a9acd4b2-4ebd-42bf-90a9-62837c84ed50","resolution":{"observed_at":"2026-08-02T08:40:39.974766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:40.055037Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.055037Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:cb6dcfdda13d7cb7259e68b23a5a9698bd084f9b538cc53a859829db8a09e5ce","observation_id":"ad0225b5-6ede-4c58-8fe0-b39213941d98","resolution":{"observed_at":"2026-08-02T08:40:40.055037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-02T08:40:40.132166Z","title":"arXiv preprint arXiv:1312.5602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.132166Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ee6798ea0b969ea21fe1a268048795b482f852d1795b88126c2372f056b817e3","observation_id":"1c34ea7d-e742-47ae-855b-9943f89da350","resolution":{"observed_at":"2026-08-02T08:40:40.132166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10003","last_updated":"2023-12-15T18:20:15Z","snapshot_observed_at":"2026-08-04T01:20:21.010579Z","submitted_at":"2023-12-15T18:20:15Z","title":"ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10003","snapshot_observed_at":"2026-08-02T08:40:40.326974Z","title":"arXiv preprint arXiv:2312.10003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.326974Z"},"links":{"cited_paper":"/paper/2312.10003","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1ba6741ded7fd1852efc1a7d4c387dd1a35b019a795ac7325100173e33da5aab","observation_id":"6f322826-12d6-45ff-ba02-ecde46fa59be","resolution":{"observed_at":"2026-08-02T08:40:40.326974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10176","last_updated":"2024-11-03T03:48:02Z","snapshot_observed_at":"2026-08-06T07:29:34.258050Z","submitted_at":"2024-02-15T18:26:11Z","title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10176","snapshot_observed_at":"2026-08-02T08:40:40.446065Z","title":"arXiv preprint arXiv:2402.10176 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.446065Z"},"links":{"cited_paper":"/paper/2402.10176","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c8688f4a0be35450d29b3e5cd5ae4867449aa0263659a605c521dd107eb96f3b","observation_id":"1e708e9c-c64e-4a44-9328-82b071028f5d","resolution":{"observed_at":"2026-08-02T08:40:40.446065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01560","last_updated":"2024-10-05T03:54:22Z","snapshot_observed_at":"2026-08-10T11:04:25.169116Z","submitted_at":"2024-10-02T14:00:09Z","title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01560","snapshot_observed_at":"2026-08-02T08:40:40.504438Z","title":"arXiv preprint arXiv:2410.01560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.504438Z"},"links":{"cited_paper":"/paper/2410.01560","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ddf54ac378b66401e3a04d7fe14cb3e669afaaea11659a09df0b9a2102865dee","observation_id":"57f4433b-5429-4247-b0f5-941d4c3dde53","resolution":{"observed_at":"2026-08-02T08:40:40.504438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-02T08:40:40.571083Z","title":"arXiv preprint arXiv:2405.21046 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.571083Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:028278d3df83008dc481cc0d2a470c7f1248f3c1746cb5f0cf0689408051bf1f","observation_id":"1b9b7728-032c-4f5a-808e-391398aebdce","resolution":{"observed_at":"2026-08-02T08:40:40.571083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:40.667991Z","title":"Connection Science , volume=","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.667991Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:63a03bc453024133cbf08b0a1413c2880a295f3083b2e9a51d87e97f5d0614e8","observation_id":"72982cdf-9a09-4958-a459-8667fbca858e","resolution":{"observed_at":"2026-08-02T08:40:40.667991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:40.706168Z","title":"2010 , publisher=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.706168Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:433db384b6cdf914c88c7021180ecebae7ce28c99788039504c025f80fc7f8c0","observation_id":"8286283c-0397-4dbe-83b8-de7a5c2c8f27","resolution":{"observed_at":"2026-08-02T08:40:40.706168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T08:40:40.786290Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.786290Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:d32eba04208e997b50ef0c9de22ff6e1c5fd5a099ca8661cac6265c112cabd32","observation_id":"973cf8ba-f9c7-4386-a43c-032f5b5074b8","resolution":{"observed_at":"2026-08-02T08:40:40.786290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:40.885199Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.885199Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c10620a9ee7d8771eb3f72b85b51ccbe2f4641b280d106da620c8304c0067641","observation_id":"4134c048-ba08-401b-99fa-8c8a51f261df","resolution":{"observed_at":"2026-08-02T08:40:40.885199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-02T08:40:40.977636Z","title":"arXiv preprint arXiv:2404.12358 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:40.977636Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e852ac480164f4fc3768f99299a5268f25f141313642120eb353c94e765e2062","observation_id":"febdbadf-647c-400e-bf99-eb058a8397f6","resolution":{"observed_at":"2026-08-02T08:40:40.977636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-02T08:40:41.047599Z","title":"arXiv preprint arXiv:2405.16436 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.047599Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:424564f03f419d2dfa577a2d8672d547e6e00ef7966f55054ac04cf248f763f3","observation_id":"779f7c7f-44bf-413e-bb64-6a5a6ac6338b","resolution":{"observed_at":"2026-08-02T08:40:41.047599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01878","last_updated":"2025-01-24T19:13:34Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:08:10Z","title":"LiPO: Listwise Preference Optimization through Learning-to-Rank","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01878","snapshot_observed_at":"2026-08-02T08:40:41.165786Z","title":"arXiv preprint arXiv:2402.01878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.165786Z"},"links":{"cited_paper":"/paper/2402.01878","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c1c1caaaa5d546a5c1aa142ce96c6078638c4909e5131e7bcc6aea15d850fa94","observation_id":"910aa229-e412-462f-b930-696349ee7d06","resolution":{"observed_at":"2026-08-02T08:40:41.165786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-02T08:40:41.352028Z","title":"arXiv preprint arXiv:2404.10719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.352028Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:9947adb74baacb449000e079165fe29ab3d39e92cff1d56676fc04f7846d99f7","observation_id":"ab88c21d-49a8-4d9f-a7dc-eb3da9c9903d","resolution":{"observed_at":"2026-08-02T08:40:41.352028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-02T08:40:41.531173Z","title":"arXiv preprint arXiv:2308.01825 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.531173Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:d78bedcaf8d0b92952386c5550058674fd706f957257ae0e239e7b5b7a440d8a","observation_id":"942f357b-7f09-40e8-a06f-eb05d914a8f9","resolution":{"observed_at":"2026-08-02T08:40:41.531173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-02T08:40:41.705346Z","title":"CoRR, abs/2312.08935 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.705346Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:2a75e0825db3cf362a1c9b52c6c12f50624a6022ad2d28af7c4256e1ab86ad01","observation_id":"fcfab427-7345-4fdc-88e9-a53c74b1df81","resolution":{"observed_at":"2026-08-02T08:40:41.705346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00658","last_updated":"2024-10-15T09:16:38Z","snapshot_observed_at":"2026-08-09T17:46:02.167914Z","submitted_at":"2024-02-01T15:18:33Z","title":"Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00658","snapshot_observed_at":"2026-08-02T08:40:41.861888Z","title":"arXiv preprint arXiv:2402.00658 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:41.861888Z"},"links":{"cited_paper":"/paper/2402.00658","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:00b6aa3ad3925c576b74d542e75e152dbc5826c2ca3875063ad81689098ec540","observation_id":"594a8fd3-7461-4573-91c8-b2fdff369f9e","resolution":{"observed_at":"2026-08-02T08:40:41.861888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:42.030702Z","title":"European conference on machine learning , pages=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.030702Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:e693e5ea52eac1560376d957c5d7eae96b62fa306f6a3b6424f745e4cb07a1ff","observation_id":"a0191aac-f91f-4460-b458-110a9358eb47","resolution":{"observed_at":"2026-08-02T08:40:42.030702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04109","last_updated":"2025-07-06T18:16:47Z","snapshot_observed_at":"2026-07-06T19:46:15.364468Z","submitted_at":"2024-11-06T18:36:22Z","title":"Self-Consistency Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04109","snapshot_observed_at":"2026-08-02T08:40:42.168233Z","title":"arXiv preprint arXiv:2411.04109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.168233Z"},"links":{"cited_paper":"/paper/2411.04109","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:32bfb0161f953f9c788f35439af9d07a904ad4d460a2110ad84bf23ac91ae0f9","observation_id":"c55cb8ae-dc47-45c7-9e27-fe2c1bb069fc","resolution":{"observed_at":"2026-08-02T08:40:42.168233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:42.312787Z","title":"2019 , publisher=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.312787Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a6d03337fb0947c884c8344d28c5fb35f35068d311dd9e7fd146d148ce176b0","observation_id":"52949c34-af80-4431-a8f7-2a010ee7a163","resolution":{"observed_at":"2026-08-02T08:40:42.312787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-02T08:40:42.479453Z","title":"arXiv preprint arXiv:2406.18629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.479453Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:df0dce87abb8661794b12c1a7640f38500dc3f3e0e418995ded29d6a690517d7","observation_id":"85614d0d-d12e-484e-976e-8ffddea0d4f4","resolution":{"observed_at":"2026-08-02T08:40:42.479453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:42.599605Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.599605Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:5cb0e4ddfc58df78a71896ac7d3c5763364c91ae1034ad868a6bed77630ffb76","observation_id":"6b851126-94ad-4101-a683-bfb82f6e21df","resolution":{"observed_at":"2026-08-02T08:40:42.599605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:40:42.741707Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.741707Z"},"links":{"citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:852a6116c066ba27c2fd26b4ea4588afae25f39695a329fdc23a6b2f6f891181","observation_id":"e66fc51d-fff0-4293-9736-cf39e2ae36c2","resolution":{"observed_at":"2026-08-02T08:40:42.741707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-01T01:16:04.260529Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-02T08:40:42.872339Z","title":"arXiv preprint arXiv:2402.14830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:42.872339Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:96a4c47faa1e831f8239a8769197b0f56265f9f65355d9a8248ca4aaa7e29d43","observation_id":"06ae92ae-f1ae-40d8-b836-5f97188dcad0","resolution":{"observed_at":"2026-08-02T08:40:42.872339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 1 inbound Pith citation observation for arXiv:2607.04763."}