{"as_of":"2026-08-09T16:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a8f549e33c3f98f3cd61b968d05afd9aa04ada11e17cbec84a4cc06826973d6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:54:29.266882Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.414065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2406.11290","last_updated":"2026-04-11T06:17:39Z","snapshot_observed_at":"2026-07-06T18:32:02.206165Z","submitted_at":"2024-06-17T07:52:42Z","title":"An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T00:14:42.779546Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2406.11290"},"observation_digest":"sha256:f0d58b07129a23e54c507413dc8b7771b70a9a9e1cede1ca270501a040da11f4","observation_id":"ab4126f8-e276-4acd-b497-4213e1f02631","resolution":{"observed_at":"2026-05-24T00:15:52.765918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:82645c2997342a0f8fcf3f08535e282ab724c86a74c5c449b1d7d6eb30d9db96","observation_id":"84baa3d2-b09e-4f5a-8843-044468b627a2","resolution":{"observed_at":"2026-05-17T12:04:10.514436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:ba9445bcca6eb8c531d00979e45c6226b1e3ce35e1b2be69bf687c1d9369d6f4","observation_id":"eb350d8c-a9ab-4afd-9829-fd1f3060fba9","resolution":{"observed_at":"2026-05-21T01:42:19.127139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:7fe7d8a21ce896bab7b266678c40ebb1c4471d45a825877b9e052c71b1b5c929","observation_id":"36080728-174d-4ffb-b838-7c44684f950c","resolution":{"observed_at":"2026-05-11T23:08:34.726256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T14:54:29.266882Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01612","last_updated":"2025-02-13T05:32:54Z","snapshot_observed_at":"2026-08-09T14:47:41.525137Z","submitted_at":"2025-02-03T18:45:22Z","title":"Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T14:54:29.266882Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.01612"},"observation_digest":"sha256:547ae43237d279ed38ff3748a0e36c664fc3da7babaa99b8e325c322d232e27a","observation_id":"ac222a59-b313-4bcc-bae0-bc83508d9445","resolution":{"observed_at":"2026-08-09T14:54:29.266882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T11:47:31.305500Z","title":"D., Agarwal, R., Anand, A., Patil, P., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-09T11:38:31.414567Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:31.305500Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.02584"},"observation_digest":"sha256:b587e07d2df6d33e5ccf64a304a54f8472e5fe7d05cdf15f7f427f98a7822e01","observation_id":"9d71f355-0c72-46e5-90a0-db7e7604bc31","resolution":{"observed_at":"2026-08-09T11:47:31.305500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T01:29:59.353698Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.03373"},"observation_digest":"sha256:c2f7a914dd6c576287f695067755509f6e784195820b047dd2f646160902b076","observation_id":"b96d62a6-a0d1-4148-bbf0-1a7fce3401f7","resolution":{"observed_at":"2026-05-19T01:29:59.416718Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T10:50:12.483673Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04362","last_updated":"2025-02-05T04:52:57Z","snapshot_observed_at":"2026-08-09T10:43:55.438000Z","submitted_at":"2025-02-05T04:52:57Z","title":"LLMs can be easily Confused by Instructional Distractions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T10:50:12.483673Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.04362"},"observation_digest":"sha256:5529aacbbb63e8124ac8646753007df16972d2d871aba1d65fa19e0af0793a12","observation_id":"2957bce5-2342-4b0d-b755-bf63fd216b50","resolution":{"observed_at":"2026-08-09T10:50:12.483673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-08T14:27:51.152051Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-08T14:18:42.353169Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.152051Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:34c24bf5e1e1f7672f9a5c740603f0765bdc2a236a878c9e5f127c8c728901ee","observation_id":"2c04f306-b46e-4265-ba4b-088a53fde1bc","resolution":{"observed_at":"2026-08-08T14:27:51.152051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-09T11:20:31.874537Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06813","last_updated":"2025-02-04T22:08:20Z","snapshot_observed_at":"2026-08-09T12:19:32.223241Z","submitted_at":"2025-02-04T22:08:20Z","title":"Policy Guided Tree Search for Enhanced LLM Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T11:20:31.874537Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.06813"},"observation_digest":"sha256:7b6d36a8aac9050a9bc01f8838c980556e8f170d221cbf523256403f4e590367","observation_id":"984f8bfb-1d13-4390-9e06-041949791329","resolution":{"observed_at":"2026-08-09T11:20:31.874537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:18324d6fa7318b0379b9e3ca7ac87822f1a535a22ab2ab745c126404da565327","observation_id":"f91fb950-3512-4d62-9f44-2f9d72aaa330","resolution":{"observed_at":"2026-05-13T01:36:24.273524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:9ef3f7a723b24b61a1973acfacfaf4611b6faa7550f2c761fec40cf539683a34","observation_id":"e247596f-c4d8-45a6-9b26-2b9f341b0783","resolution":{"observed_at":"2026-05-19T06:59:03.257668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:f9117eda05fe4fde743be81b0820f66f54ca9f33cdb7c845f84934049685823e","observation_id":"2bcb275e-3172-40ef-9dad-2bf894550a60","resolution":{"observed_at":"2026-05-22T21:42:10.791523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T14:50:05.227428Z","title":"arXiv preprint arXiv:2312.06585 (2023) 12 J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17470","last_updated":"2025-05-23T04:50:54Z","snapshot_observed_at":"2026-08-09T14:35:59.194318Z","submitted_at":"2025-05-23T04:50:54Z","title":"SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:50:05.227428Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.17470"},"observation_digest":"sha256:60ed46977462a90953772a25cd2f5ca4cf9e8f711cae0166546b8f6be0bf886d","observation_id":"d1f3863e-7606-483e-a643-b3fc8dfbc7fe","resolution":{"observed_at":"2026-08-07T14:50:05.227428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T14:12:05.364648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:05.364648Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:fe98cd68c0aaabf5bd610d9d6cba066c67862aa2d1a5ae0db60c2585b4eaa931","observation_id":"2b550a2a-2d34-4a83-a7ac-7634953fc29d","resolution":{"observed_at":"2026-08-07T14:12:05.364648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T13:07:50.094799Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-09T07:55:48.130608Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:50.094799Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.22660"},"observation_digest":"sha256:1d42a340e0cc09c4391c806e097cbd094a1060452e4df00ffd9b7f43896fd2ea","observation_id":"e6128fac-ad80-4c3e-8161-404773e5b32b","resolution":{"observed_at":"2026-08-07T13:07:50.094799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T12:39:57.636759Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-08T22:31:37.525251Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.636759Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:e17d7b67dcf10188f4d942de8cb0d2e5cda21fbd20b4bd2d79e8ba4a718ad07d","observation_id":"0d04703e-ce4e-42be-a82d-05ff6f566335","resolution":{"observed_at":"2026-08-07T12:39:57.636759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T05:59:04.390203Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06499","last_updated":"2025-06-17T12:55:30Z","snapshot_observed_at":"2026-08-09T10:48:19.902385Z","submitted_at":"2025-06-06T19:49:42Z","title":"SPARQ: Synthetic Problem Generation for Reasoning via Quality-Diversity Algorithms","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:04.390203Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.06499"},"observation_digest":"sha256:cdd7786c5e8e04c970b7e3fefb0ae10f57f6c5b1ac4017c074a6ae5790a715fa","observation_id":"e5e4dfcb-47a4-4f45-a5dd-578774dff898","resolution":{"observed_at":"2026-08-07T05:59:04.390203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T04:21:18.850888Z","title":"arXiv:2312.06585 [cs.LG] https://arxiv.org/abs/2312.06585","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10844","last_updated":"2025-06-12T16:02:29Z","snapshot_observed_at":"2026-08-09T09:30:31.698254Z","submitted_at":"2025-06-12T16:02:29Z","title":"CIIR@LiveRAG 2025: Optimizing Multi-Agent Retrieval Augmented Generation through Self-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.850888Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.10844"},"observation_digest":"sha256:dd41d7aaba4bc7b546ed17ac2f3fa5a81bbab80d4d7857961c30c365727c60f0","observation_id":"607c30cf-eaaf-4c8f-8c72-1a6015fcdd00","resolution":{"observed_at":"2026-08-07T04:21:18.850888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-06T21:58:35.473834Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23025","last_updated":"2025-06-28T22:13:43Z","snapshot_observed_at":"2026-08-09T01:19:06.931322Z","submitted_at":"2025-06-28T22:13:43Z","title":"Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:58:35.473834Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2506.23025"},"observation_digest":"sha256:3f9f91f09f96362798128801f4060afe078fb15ad66a3354e681b1cbff87fe67","observation_id":"500a8237-3561-48aa-9da6-c5369e86188f","resolution":{"observed_at":"2026-08-06T21:58:35.473834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-06T15:12:01.966932Z","title":"arXiv preprint arXiv:2312.06585 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16518","last_updated":"2026-06-24T02:00:50Z","snapshot_observed_at":"2026-08-08T12:45:29.488887Z","submitted_at":"2025-07-22T12:27:08Z","title":"SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:12:01.966932Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2507.16518"},"observation_digest":"sha256:8b6326a680e4ad98df75fda93dba1a7007fea87eea126a47e16bab353355f684","observation_id":"60399d37-3763-4d34-9780-b5231395c56f","resolution":{"observed_at":"2026-08-06T15:12:01.966932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T16:22:50.862355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18676","last_updated":"2025-08-26T04:46:54Z","snapshot_observed_at":"2026-08-09T04:51:02.516154Z","submitted_at":"2025-08-26T04:46:54Z","title":"Utilizing Training Data to Improve LLM Reasoning for Tabular Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T16:22:50.862355Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.18676"},"observation_digest":"sha256:40c06757584a93b5c839bdf838584dbb8de2b12c710a63c446c011eb9d9b2a61","observation_id":"71059b91-6525-46b3-98d2-7379c09ed54a","resolution":{"observed_at":"2026-08-05T16:22:50.862355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T15:45:24.746306Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-08T15:57:17.447279Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.746306Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:9844d2e9030833ea1641a57e6e5bd71752738d0f4aaebb53e15bcfce2e561ebb","observation_id":"87b836da-7df4-457d-a007-3dbb733fc341","resolution":{"observed_at":"2026-08-05T15:45:24.746306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T13:52:52.128802Z","title":"Singh, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00271","last_updated":"2026-06-17T20:45:44Z","snapshot_observed_at":"2026-08-08T09:36:37.528608Z","submitted_at":"2025-08-29T22:56:32Z","title":"Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:52:52.128802Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2509.00271"},"observation_digest":"sha256:3e28adcbd0f5976cf1bb163abcea12a48b954db11fbf019e2e37b55b4adcfa4a","observation_id":"804b351d-d527-4650-a4b3-d6ec3000e6d0","resolution":{"observed_at":"2026-08-05T13:52:52.128802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-04T18:50:10.554445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09629","last_updated":"2025-09-11T17:15:45Z","snapshot_observed_at":"2026-08-08T13:47:15.540980Z","submitted_at":"2025-09-11T17:15:45Z","title":"Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T18:50:10.554445Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2509.09629"},"observation_digest":"sha256:05ae218b639a04c26a5bf6c99d0122c8963098eb90790ddb6bae7312b43d080c","observation_id":"1ffe2ae4-5226-4f86-b0fb-2daf5a0086f6","resolution":{"observed_at":"2026-08-04T18:50:10.554445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:ef45c79a21f10fdd3f2b785612e5e0519dda6e5dba3a3b5a2db7da17bb5fe477","observation_id":"e5abc5f4-acb5-49b1-a537-180ae38e0bbb","resolution":{"observed_at":"2026-05-21T13:14:10.981671Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-03T03:33:44.696113Z","title":"D., Agarwal, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:44.696113Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:8318e575858add4f7c9cc71e2b7896126880417c76e931589e32e0027901d51f","observation_id":"790c996a-e57a-453a-a2cc-5e7228b8c615","resolution":{"observed_at":"2026-08-03T03:33:44.696113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-03T02:43:36.662189Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10014","last_updated":"2026-05-31T19:13:22Z","snapshot_observed_at":"2026-08-06T02:34:35.293978Z","submitted_at":"2026-02-10T17:36:41Z","title":"A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:43:36.662189Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.10014"},"observation_digest":"sha256:a56c7c16c79ba408c1377220e0fa1f3ff675220ca0a2459022c94f655424daa1","observation_id":"5f340510-3d13-47fd-b388-cdd51ecdeb84","resolution":{"observed_at":"2026-08-03T02:43:36.662189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T22:08:42.714880Z","title":"Srivastava, A., Rastogi, A., Rao, A., Shoeb, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17993","last_updated":"2026-07-12T00:58:22Z","snapshot_observed_at":"2026-08-07T11:22:28.223283Z","submitted_at":"2026-02-20T05:01:32Z","title":"Turbo Connection: Reasoning as Information Flow from Higher to Lower Layers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:42.714880Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.17993"},"observation_digest":"sha256:bba2a49f00d169638e0d063aa233151765451d210b043392f291b8883f1624cf","observation_id":"8c37dfd8-83f4-4fe2-b809-033c678ab898","resolution":{"observed_at":"2026-08-02T22:08:42.714880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2602.22507","last_updated":"2026-05-12T01:27:47Z","snapshot_observed_at":"2026-08-05T20:55:22.027584Z","submitted_at":"2026-02-26T00:54:38Z","title":"Space Syntax-guided Post-training for Residential Floor Plan Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T19:38:24.134463Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2602.22507"},"observation_digest":"sha256:987be43d18931b5408d3f1abfd3a8ed48dfce795cd07c947d59f5c2e82c4692a","observation_id":"924abd59-3f5f-43c1-a9ff-3d048b97ebd4","resolution":{"observed_at":"2026-05-15T19:40:17.733380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2604.18354","last_updated":"2026-04-20T14:47:50Z","snapshot_observed_at":"2026-08-01T15:39:56.428672Z","submitted_at":"2026-04-20T14:47:50Z","title":"PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:00:26.238268Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2604.18354"},"observation_digest":"sha256:a24cd27c5991b33f2a435ebd5b9f17d7bfc92186d654d295e83bb4db55977b17","observation_id":"c391cbcd-6896-4f3d-856f-c02b0e90f75a","resolution":{"observed_at":"2026-05-10T10:14:10.818457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T15:08:53.731480Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:df482be33bf6bc17af6972cb4225901d957379c6ab45719889343d9e88d19c96","observation_id":"734bac73-6aee-4772-a492-e877d7328eae","resolution":{"observed_at":"2026-05-11T16:46:06.930542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T00:48:54.797750Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:f84710459a889ade89536613e9ace0e3ca012e97009f67497a2e1144e7159819","observation_id":"af2a7b0e-a535-4cb4-814f-64525ee14ee4","resolution":{"observed_at":"2026-07-01T00:55:12.106795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.01327","last_updated":"2026-05-07T08:09:44Z","snapshot_observed_at":"2026-07-29T17:18:59.626285Z","submitted_at":"2026-05-02T08:47:45Z","title":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T14:44:31.160543Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.01327"},"observation_digest":"sha256:8ddc8441f9cf2c372763157dde9822d114d9c127e048bfce82dfb16027466c0b","observation_id":"83deb363-64c7-4970-958d-fc6bd40d1a98","resolution":{"observed_at":"2026-05-11T16:51:07.861678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:db9ac370048e93f16f4c47bb2f94115a8ceeed0a3108b769e3c0f5c7a69451f4","observation_id":"b8c432ad-a1c4-4228-8f84-5e9a210351c7","resolution":{"observed_at":"2026-05-11T20:16:08.428351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:f77d9996fd713219053d9f19504601ff5b75225cb9e247e8294249c75bcffe4d","observation_id":"4df2d3ef-ea52-4954-ac9b-091668ef48f3","resolution":{"observed_at":"2026-05-21T11:24:08.738134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:40b769898a89c55e28e88239235a13bbb5e0b11b7a44d9cf741b5d039b8faddb","observation_id":"2d8e60a0-23ff-491b-888b-6e971a037740","resolution":{"observed_at":"2026-05-21T05:39:40.598262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:e8548fe7a996f2e778beb8675086cbe20bf8487bac6ca498b2d192d1c4be0eec","observation_id":"7fbeceff-a5d9-481c-975e-d297f43c2bed","resolution":{"observed_at":"2026-06-30T17:24:57.549368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.22675","last_updated":"2026-05-21T16:18:41Z","snapshot_observed_at":"2026-07-31T08:48:25.385630Z","submitted_at":"2026-05-21T16:18:41Z","title":"Self-Policy Distillation via Capability-Selective Subspace Projection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:42.803465Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.22675"},"observation_digest":"sha256:cfef224b3fc289a769b2947c6b4fc6035b3456a47f9b90bf974a245fd874edc6","observation_id":"66f7a843-37d7-49f4-bd12-4b296193d4ae","resolution":{"observed_at":"2026-05-22T05:34:40.416173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.26037","last_updated":"2026-05-25T17:05:35Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T17:05:35Z","title":"Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T21:20:16.027196Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.26037"},"observation_digest":"sha256:618e98b312ebe1b70106e010bfeaa356aad7d28da250fa944c6a1060b3662a41","observation_id":"5eb8abed-a77d-444c-800a-cad6063f909a","resolution":{"observed_at":"2026-06-29T21:23:58.942626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2605.31455","last_updated":"2026-05-29T15:49:13Z","snapshot_observed_at":"2026-08-06T06:42:59.945235Z","submitted_at":"2026-05-29T15:49:13Z","title":"DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:49.358792Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2605.31455"},"observation_digest":"sha256:c06e910038d283bcc60e8b5dbc180adff4f75754c9cf7b5e853287b7e00cfb79","observation_id":"162d4ffc-93b7-43b0-9ec3-d2daf9973525","resolution":{"observed_at":"2026-06-29T00:02:50.297157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.00628","last_updated":"2026-05-30T09:03:03Z","snapshot_observed_at":"2026-08-03T17:14:51.636270Z","submitted_at":"2026-05-30T09:03:03Z","title":"Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T19:12:39.939329Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.00628"},"observation_digest":"sha256:b075fa5caa48ba29699bab2c77a45a905a90912f166d868b987d4ad4f1671a90","observation_id":"b1ad4b1d-ebb2-4778-83a0-a03e9fe21758","resolution":{"observed_at":"2026-06-28T19:22:35.025991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.05464","last_updated":"2026-06-03T21:43:38Z","snapshot_observed_at":"2026-08-03T10:19:08.677126Z","submitted_at":"2026-06-03T21:43:38Z","title":"Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T05:46:26.938277Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.05464"},"observation_digest":"sha256:c76b8e25bd42fbf8c2b732123bbfb244d823db2531344517db808b245896d9a4","observation_id":"71a6711c-6d6e-4d83-8eba-186cf78d6b44","resolution":{"observed_at":"2026-07-02T08:46:48.965970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:25111686a6ef7dc678cb16f6eb98ed724d0d896802764f64ce9496ef39ce688d","observation_id":"667f03c4-2391-4a3c-bcd0-3a76d4a86077","resolution":{"observed_at":"2026-07-03T20:48:56.134444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.18307","last_updated":"2026-06-16T07:21:49Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T07:21:49Z","title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:57:05.784589Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.18307"},"observation_digest":"sha256:971aa6faeb0234740b0f0d28bf462069c445fdb65c0e4727d03b8d3f18bd867e","observation_id":"e3ccd73e-cf5c-42c6-8855-488529460e81","resolution":{"observed_at":"2026-07-03T19:18:54.719160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:3d6b02d67399eda52d7e7602a95f86037102f4067011555ab6989bb4cf3d7916","observation_id":"f8137536-2793-4e73-828e-8f691d7d3b6d","resolution":{"observed_at":"2026-07-04T09:49:44.969512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-02T03:35:37.854415Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:6a341659e79a154cb6c62f73d57123144e58f652fe04386e0821a305fe681b71","observation_id":"dcf81913-45a8-4a5f-bf89-88c9345346a9","resolution":{"observed_at":"2026-07-04T21:00:08.422731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.27373","last_updated":"2026-06-25T17:59:55Z","snapshot_observed_at":"2026-08-08T23:29:13.406265Z","submitted_at":"2026-06-25T17:59:55Z","title":"Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T05:01:47.207296Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.27373"},"observation_digest":"sha256:a106a4e62e25e3ed5688f1c42f6115d9d9853177d21f730f9dd07414c0bec765","observation_id":"c88cb04e-be10-40ae-bda7-3e86ffdc71c1","resolution":{"observed_at":"2026-07-04T13:39:50.967732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2606.29340","last_updated":"2026-06-28T11:15:26Z","snapshot_observed_at":"2026-08-08T00:55:58.041882Z","submitted_at":"2026-06-28T11:15:26Z","title":"PHF: Privileged Hidden Flow for On-Policy Self-Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T07:26:32.902086Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2606.29340"},"observation_digest":"sha256:56ba7f643df9b980b4b8aad5835cbc40c06859780e19f4c38bc536b54491aeba","observation_id":"6cb802be-2f28-43ef-a056-6c9296fdc956","resolution":{"observed_at":"2026-06-30T07:34:21.811633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":"2312.06585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-04T21:00:08.414065Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":"8f17103a-ebe3-43cd-9593-4c9d4c69edb3","year":2023},"citing_paper":{"arxiv_id":"2607.00531","last_updated":"2026-07-01T07:22:46Z","snapshot_observed_at":"2026-08-05T15:12:09.427437Z","submitted_at":"2026-07-01T07:22:46Z","title":"Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-02T16:07:49.362916Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.00531"},"observation_digest":"sha256:492479d8f86d2f4a50d5cebf65064dd2199d06d781557882dc9b8a985063f7b1","observation_id":"bd21824f-69a1-4582-8962-2589159d7811","resolution":{"observed_at":"2026-07-02T16:17:08.604206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":205,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3971bfc0778461786b5da174a08a0c7385ef39d83328cc35b75f5261830ff99b","observation_id":"90ab09a6-18ef-4af7-bb5b-b663d1979ec4","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T08:40:56.405118Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:56.405118Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b57273ec5aff530464a4c5a41e7554d77e00f783df704ade4a8a6f66f02640b8","observation_id":"a5c001a8-f646-4831-b290-bdd4ceadd008","resolution":{"observed_at":"2026-08-02T08:40:56.405118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-14T17:25:37.713857Z","title":"Co-Reyes, Rishabh Agarwal, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09709","last_updated":"2026-06-23T13:47:41Z","snapshot_observed_at":"2026-08-04T12:23:53.502733Z","submitted_at":"2026-06-23T13:47:41Z","title":"The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T17:25:37.713857Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.09709"},"observation_digest":"sha256:5ea5a079eb52e8075f393ae907198f3624c17f6b3bf6f86bb05f2f41d6a1c2df","observation_id":"2d3c46f9-bc77-4557-bd9f-699103e384a7","resolution":{"observed_at":"2026-07-14T17:25:37.713857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-07T19:26:40.944900Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:e5d8822d0dc4cbee6ee76487012655fd6e6f04ac045bebd2ad119f93c7f96871","observation_id":"13dd479b-e987-4d72-adad-948b0c3a7dfb","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T03:56:26.701252Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13753","last_updated":"2026-07-20T09:24:51Z","snapshot_observed_at":"2026-08-07T10:59:34.790525Z","submitted_at":"2026-07-15T12:12:37Z","title":"Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-02T03:56:26.701252Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.13753"},"observation_digest":"sha256:c282e554d89c33a4d7d80d49e384eac61af1ccde9e9f46464b868157f99f9caa","observation_id":"e0ff153d-3cab-4e56-aead-9b7e7bd48a79","resolution":{"observed_at":"2026-08-02T03:56:26.701252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T01:52:28.936526Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14552","last_updated":"2026-07-16T04:28:19Z","snapshot_observed_at":"2026-08-08T01:28:27.726121Z","submitted_at":"2026-07-16T04:28:19Z","title":"Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T01:52:28.936526Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.14552"},"observation_digest":"sha256:d6e7d7f47e9abf46a2206fcdb0a834e2b11e2167a2ff86419f4289625d55cc64","observation_id":"d1620c7f-8ad5-43ff-bc27-7b2489a9d2b6","resolution":{"observed_at":"2026-08-02T01:52:28.936526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T01:15:33.669821Z","title":"Transactions on Machine Learning Research (2024), https: //arxiv.org/abs/2312.06585","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14735","last_updated":"2026-07-16T09:01:02Z","snapshot_observed_at":"2026-08-08T20:30:15.458427Z","submitted_at":"2026-07-16T09:01:02Z","title":"CoTu at EXACT 2026: Neuro-Symbolic Reasoning for Transparent Educational QA","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:15:33.669821Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.14735"},"observation_digest":"sha256:39dad415796b8397affc002e024fb7eab83f77630c2312633632eacef3641ff5","observation_id":"f75ed8b3-e8bc-4b2e-9605-2afc67667824","resolution":{"observed_at":"2026-08-02T01:15:33.669821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-01T12:54:34.843879Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:34.843879Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:13312fa96f37ba56e42ba4efc72e5d4559086931de503b5beb04cce2a4b078de","observation_id":"8601a47d-6b23-4ca9-8ba9-1fc876d16795","resolution":{"observed_at":"2026-08-01T12:54:34.843879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-02T13:32:13.493804Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19354","last_updated":"2026-05-21T18:09:33Z","snapshot_observed_at":"2026-08-06T05:23:08.778709Z","submitted_at":"2026-05-21T18:09:33Z","title":"FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T13:32:13.493804Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.19354"},"observation_digest":"sha256:2c2202c5a0a01b3e2bf3f701924a5f450999ddeaa1fad438bf620e0ede90681e","observation_id":"0be574e1-6fbf-4c6b-96a8-61d630984dcf","resolution":{"observed_at":"2026-08-02T13:32:13.493804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-01T03:02:08.797292Z","title":"and Agarwal, Rishabh and Anand, Ankesh and Patil, Piyush and Garcia, Xavier and Liu, Peter J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-08T08:44:07.330246Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:08.797292Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:1f3155242b40c49f952455270504dc46161d5c037518d087104675e8f39b271a","observation_id":"05e6d4e8-23ee-4cdc-b797-a7c0281ffebe","resolution":{"observed_at":"2026-08-01T03:02:08.797292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-07-31T22:51:49.392233Z","title":"arXiv preprint arXiv:2312.06585 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27937","last_updated":"2026-07-30T09:47:58Z","snapshot_observed_at":"2026-08-06T10:28:04.843430Z","submitted_at":"2026-07-30T09:47:58Z","title":"From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T22:51:49.392233Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2607.27937"},"observation_digest":"sha256:e885357fe18be15f8fee6ec7f86f95d19e14167fee587187f153e485d58a2df9","observation_id":"8f08c263-545e-4637-b701-934097b26025","resolution":{"observed_at":"2026-07-31T22:51:49.392233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-08T12:35:01.459919Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05466","last_updated":"2026-08-05T23:24:26Z","snapshot_observed_at":"2026-08-09T16:10:39.469696Z","submitted_at":"2026-08-05T23:24:26Z","title":"Recursive Synthesis for Long-Horizon Terminal Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:35:01.459919Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2608.05466"},"observation_digest":"sha256:fc076cd2b90df53e6e507d91a4253751a2471dd46320803efa07f99328b0f690","observation_id":"c2689870-d8ac-4522-a585-d2f1e16e5a9b","resolution":{"observed_at":"2026-08-08T12:35:01.459919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06585/citation-record","integrity":"/paper/2312.06585/integrity","json":"/paper/2312.06585/citation-record.json","paper":"/paper/2312.06585"},"outbound":[],"paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2312.06585."}