{"as_of":"2026-08-08T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3e4100225c6cdbd5f0cf2213aef2db8f92e01b8c2da017a071c63f56e4726d0","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:30:40.435211Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02338/citation-record","integrity":"/paper/2506.02338/integrity","json":"/paper/2506.02338/citation-record.json","paper":"/paper/2506.02338"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:30:40.095403Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.095403Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:e53022b0a2e2df22443c48972648227c4b1c82ea706958df2a946d6b6557608b","observation_id":"3a620c53-2971-4c03-be1c-26aed213bb56","resolution":{"observed_at":"2026-08-07T11:30:40.095403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T11:30:40.109082Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.109082Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:601757ad17cc245d88f78c56f47034eb981f6bc04c0f2b6dc7b2a34fe5f8c939","observation_id":"fafcd2b1-2580-4a82-a3e3-1cafd5624b9c","resolution":{"observed_at":"2026-08-07T11:30:40.109082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:30:40.120327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.120327Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c52600da42e8a9389bb903a88b57bbc50464a5f58c2331cb8a721efbbc5f55dd","observation_id":"470914d3-e96b-4022-8e51-24794ef3b387","resolution":{"observed_at":"2026-08-07T11:30:40.120327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:30:40.129217Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.129217Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:a8abe3f87f1e2a90d955623dbdcb6e6ef192b4bd4b09b303a80ebeaab55119d3","observation_id":"8336a38d-68dd-4876-8394-68288d115880","resolution":{"observed_at":"2026-08-07T11:30:40.129217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T11:30:40.139932Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.139932Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:383e1edc3c2b87a7309711dbb37ef63fb41a9a3343f068c38fe9d80521b0c5cd","observation_id":"abc0b61a-31c9-4586-8bf7-70f503b7e8fe","resolution":{"observed_at":"2026-08-07T11:30:40.139932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:30:40.149670Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.149670Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:f0f733f96aac1bff9003d45167a76c87aecc71263bfecf163f39d3e54913c922","observation_id":"8144c61d-b6dc-4247-8e83-bd410c59b013","resolution":{"observed_at":"2026-08-07T11:30:40.149670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T11:30:40.159435Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.159435Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5dee8277b454c2639698c83a2246df0e96c4f63d445711607f11b040e2c601d0","observation_id":"a407ff1e-8f7f-4c45-9e09-ba3f39fc24a4","resolution":{"observed_at":"2026-08-07T11:30:40.159435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-07T11:30:40.166528Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.166528Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:35e3e999da05fc53fcdbf1298b16e9cd6e76f8d59a67fc0e1b0010f4a7e52ea4","observation_id":"0d5b3497-a783-48d8-bd38-4be515430b98","resolution":{"observed_at":"2026-08-07T11:30:40.166528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T11:30:40.175491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.175491Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9b96cf0fc6a8b18a50926cadeca38f4e6805350cbff1adf189637b1e4892f92c","observation_id":"c36feee3-b382-499b-9777-4e8baec108c3","resolution":{"observed_at":"2026-08-07T11:30:40.175491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T11:30:40.181809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.181809Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:e8ae7d5420fc65213cab4cb354cb373bcf1af38f188df1412b8b4ccc2c429fea","observation_id":"138d07e0-6681-424c-993c-7834b5af1842","resolution":{"observed_at":"2026-08-07T11:30:40.181809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.156676Z","title":null,"venue":null,"work_id":"5daf54d7-48db-4b33-9ca8-785e1866640c","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.190888Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:2fd26d2f526ee0b1c58467d3bb7a467b810bce377f20bbdb19cddb66f831aa56","observation_id":"6a63a3a0-0fdf-47cb-a435-65664274dc02","resolution":{"observed_at":"2026-08-07T11:30:42.170900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T11:30:40.198182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.198182Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:f510f9d3fec9da78cedb7cfa645b13ab8a41018a2e740d90acc24d985b7d4cbb","observation_id":"75a3efd2-fc16-4e71-93ea-e76bcfddf22d","resolution":{"observed_at":"2026-08-07T11:30:40.198182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.129410Z","title":null,"venue":null,"work_id":"8946dd50-0d06-4413-a094-c482adcf16fc","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.207318Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:51beb1483dfb72ec70cc8c94a2c18ce70fe25671aa8f040ab596a8b2831fe6d4","observation_id":"af14dcbf-dada-4fe0-a10c-0f134e11cae6","resolution":{"observed_at":"2026-08-07T11:30:42.137299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05318","last_updated":"2024-10-05T05:21:48Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-05T05:21:48Z","title":"Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05318","snapshot_observed_at":"2026-08-07T11:30:40.214833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.214833Z"},"links":{"cited_paper":"/paper/2410.05318","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5a315840925437e857bf07e6d6c176d818e37cbe173eee538739a69b33da1082","observation_id":"59e8e1e9-4b76-4c12-8e4d-39a0f264ed32","resolution":{"observed_at":"2026-08-07T11:30:40.214833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T11:30:40.222867Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.222867Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5d8a7b6966bf8626b10573a73644ef1d8e7541216c1c84e7d411106eb6a0c5d8","observation_id":"fbd92be8-c84b-4151-9a72-4c0cbb2b1a24","resolution":{"observed_at":"2026-08-07T11:30:40.222867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T11:30:40.232268Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.232268Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:81c149dafc777cd72263c6f27d49ecdb0ca007ecf541411d8c64248cf912f4d1","observation_id":"196780c7-d2c6-4134-9ae4-6c4362406864","resolution":{"observed_at":"2026-08-07T11:30:40.232268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T11:30:40.243867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.243867Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5013f5138989ecee80084fd579a28bc061cffe36d9733e2b958e0114d9586385","observation_id":"38c2129e-14fb-4c30-b090-1a8270f5421c","resolution":{"observed_at":"2026-08-07T11:30:40.243867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.086077Z","title":null,"venue":null,"work_id":"9440a3f3-9ee9-4aba-ab6b-0340d2b9ad74","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.249490Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:8df3387fc329c6b1c5fb1c6b29ed39dc5f498803fe1a126cf09436f4bef883f9","observation_id":"5791fb73-f390-4b0c-a883-11e76bfef89e","resolution":{"observed_at":"2026-08-07T11:30:42.101056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.054242Z","title":null,"venue":null,"work_id":"349e3caf-da5e-45dd-b747-d1c557dde910","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.256938Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:7e04f17a9d9a8dc7862c9a0bbf32259654782398ba4e8686042785e45da5bce1","observation_id":"133c582f-5501-454a-ae21-ee900206634e","resolution":{"observed_at":"2026-08-07T11:30:42.061042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T11:30:40.263653Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.263653Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:cebcd57b9ee3f8900f7c9d72ef86980adeb7b672c575af2c15b7825c9bf99397","observation_id":"0bfe602b-2997-480c-bc68-fc6e76f3d866","resolution":{"observed_at":"2026-08-07T11:30:40.263653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03860","last_updated":"2025-02-06T08:19:59Z","snapshot_observed_at":"2026-08-07T04:01:54.793954Z","submitted_at":"2025-02-06T08:19:59Z","title":"BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03860","snapshot_observed_at":"2026-08-07T11:30:40.270967Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.270967Z"},"links":{"cited_paper":"/paper/2502.03860","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:ecd371f107bf86065a51c8bef1621b79a803edfec258bec08ae19209f3020c55","observation_id":"7386175c-0d20-478c-8879-b89f2fd30cf5","resolution":{"observed_at":"2026-08-07T11:30:40.270967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:30:40.279569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.279569Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:529ee815337da21a3351d41b58f41274bdbe911de0e98b4fb4dc62b113609afb","observation_id":"51ad3838-3c8f-4fc4-8ea4-36de2e5e33f6","resolution":{"observed_at":"2026-08-07T11:30:40.279569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T11:30:40.292039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.292039Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c2da080579d9ad04d0cb987c17e684e560be6573763410d94de3b6586e3be59e","observation_id":"fd945479-6501-437d-ac78-15869f69d8b4","resolution":{"observed_at":"2026-08-07T11:30:40.292039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:30:40.299149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.299149Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:4a01a8eaaf23bb12aad2ea2aeeecfa8093f66c0d6c6cee8bbc41d82d21a63c19","observation_id":"9c46240b-2e4d-4188-8cd7-ad583572395d","resolution":{"observed_at":"2026-08-07T11:30:40.299149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T11:30:40.304456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.304456Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:aa4c708f6308c26924a6affaa8d42ae2d5a3e2d5381e41f092c39a8a2b85c37a","observation_id":"505fc5cd-2c32-4803-932d-35a185277239","resolution":{"observed_at":"2026-08-07T11:30:40.304456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.011110Z","title":null,"venue":null,"work_id":"81bb1bef-baa0-48c3-a45e-5d38dd958a5e","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.310291Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:3d019a3bfd3fd14728c149a3eaac03deaaba0f61cce405c058facfc92d7b6281","observation_id":"c45ae7de-2d83-443e-908b-eef6cfad4427","resolution":{"observed_at":"2026-08-07T11:30:42.020936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:41.966881Z","title":null,"venue":null,"work_id":"65d680f0-59c8-4512-a597-13f505a7e580","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.319370Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:3f235964371694c75624ec8852993d74cbcad3fc385e2cbcdd88e78c007ed070","observation_id":"0981fa35-cb9a-4e76-baab-9ea9177ab3f3","resolution":{"observed_at":"2026-08-07T11:30:41.977143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.327281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.327281Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c687dd237c753504e119ca23892764f9a6c8cdfe74b75f4d9c68b6babf9fc760","observation_id":"70e64e28-d9e0-4cd0-89fb-8b2cf5bcde62","resolution":{"observed_at":"2026-08-07T11:30:40.327281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:30:40.332643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.332643Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:aefe152032e79adb7f20e333c1b1c658295074bf0adfdc2d351dcc043d99ace3","observation_id":"c47bf320-e49c-45d4-a33f-144415becc0a","resolution":{"observed_at":"2026-08-07T11:30:40.332643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14283","last_updated":"2024-07-22T10:01:49Z","snapshot_observed_at":"2026-07-06T18:34:15.291938Z","submitted_at":"2024-06-20T13:08:09Z","title":"Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14283","snapshot_observed_at":"2026-08-07T11:30:40.339030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.339030Z"},"links":{"cited_paper":"/paper/2406.14283","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:30479d921f3958f35350328e08dcc6355b84d1d7fef2660302a71653c2ab8a1a","observation_id":"37be43d1-c47d-4fa3-bea9-6bf92ae3e265","resolution":{"observed_at":"2026-08-07T11:30:40.339030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-07T11:30:40.351279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.351279Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:eeb659a8aa6333ca0400a24695c0e21fb97548d211af96e452544f6dffc34396","observation_id":"53536604-b829-430a-a54e-2a8efd3ec156","resolution":{"observed_at":"2026-08-07T11:30:40.351279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-08T15:09:27.177867Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-07T11:30:40.358899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.358899Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:409e46b76c03659fe83d2b53dc0a8a7d3eb51ec5e598f86b5794b9516b0b3ba7","observation_id":"4f37b2ca-202f-4c65-a786-0e39b2586b8f","resolution":{"observed_at":"2026-08-07T11:30:40.358899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T11:30:40.365512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.365512Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:be6021e375a50c787d0e155b8ac5a185d21f104510808cb155494e2bea763177","observation_id":"db56cecf-9f5a-4d29-9bcf-863d9e379bfa","resolution":{"observed_at":"2026-08-07T11:30:40.365512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-07T11:30:40.373089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.373089Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:e63f001cb187174afad7786651ede624b0545c67a197eac15c1becc86ac96667","observation_id":"a35a4bf7-4597-45b2-9057-8ef4b19a54bf","resolution":{"observed_at":"2026-08-07T11:30:40.373089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T11:30:40.380185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.380185Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5726dcfce9f2bcebeca8c0a24be54e52e8e772fcaba818557b4d11e1f4e40b9c","observation_id":"0bb73033-dc53-47b9-83ae-7fc1a637e5ab","resolution":{"observed_at":"2026-08-07T11:30:40.380185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T11:30:40.388167Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.388167Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:d5524a1c384379ada3d954e419cbef07b03c1efdd2b51c1b6330d58c58a25d0b","observation_id":"c969852d-8e08-4927-be52-38b9736a4cd4","resolution":{"observed_at":"2026-08-07T11:30:40.388167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-07-06T20:21:42.341172Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T11:30:40.394611Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.394611Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:ce96c41af8e51962e15a8d3a440f1716e49ada9582f6cd82d777ed7fb433bfd8","observation_id":"0fa1eb0f-0c63-4a2e-97db-e2b700904a24","resolution":{"observed_at":"2026-08-07T11:30:40.394611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-07T12:03:21.367108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-07T11:30:40.401314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.401314Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:2e8b64247b4fe0a37e77896592e53e540da252a45bf677dbd9eab7889bb51dbf","observation_id":"ab44c3fb-adf0-49fd-91b6-4a4f2c95a478","resolution":{"observed_at":"2026-08-07T11:30:40.401314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00154","last_updated":"2024-12-10T04:39:25Z","snapshot_observed_at":"2026-08-05T17:55:01.214018Z","submitted_at":"2024-11-29T07:19:56Z","title":"o1-Coder: an o1 Replication for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00154","snapshot_observed_at":"2026-08-07T11:30:40.410198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.410198Z"},"links":{"cited_paper":"/paper/2412.00154","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:ad595282beb9e16666647fe495b9a2f71882d8c1e290d8c234984ed6d9f49619","observation_id":"e5ff97dd-070b-4d5c-be49-0b54664f2870","resolution":{"observed_at":"2026-08-07T11:30:40.410198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T11:30:40.416440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.416440Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:630b3c18da66c172bd57dbe09d28e9bfa1dc711d8e3d1eb6ff66e7b3054fe15d","observation_id":"a2a8c277-e738-4e85-b9bd-732e42193099","resolution":{"observed_at":"2026-08-07T11:30:40.416440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.422849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.422849Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:4447288a0957616267f3c6e5c62ff6ba886cbc76c32e1f1f30cc0baf17407349","observation_id":"bd8639f7-bc2e-41b5-8c96-f5c1e861a5b0","resolution":{"observed_at":"2026-08-07T11:30:40.422849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.428196Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.428196Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9e2ab33676752401bcd343d6c6d7cac7bf5704e63ade6ee25d49c4d0e2ac2938","observation_id":"43c14ce9-5f8a-4e73-bf90-58096c7406c1","resolution":{"observed_at":"2026-08-07T11:30:40.428196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.435211Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.435211Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c3fb3587c2ba7c879541bab76c0088f5f80c584a0ea373a13ad25eaad5dcc913","observation_id":"5f10d5a3-57b7-431d-ba84-a96b80a47512","resolution":{"observed_at":"2026-08-07T11:30:40.435211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.02338."}