{"as_of":"2026-08-21T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4361963178d0404c79ca89894d1c21d3a5bcf140d6d9ba474a9f19c0b7e386b4","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:41:30.443487Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.656180Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.875028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:8363d762bc1970657264ec6d44135386ab04d4714d148d606fa353eaae7c26f3","observation_id":"788f827d-c11a-4f5e-911b-d40096de2272","resolution":{"observed_at":"2026-05-14T01:29:56.823186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-08-06T17:54:17.656180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-20T12:31:43.651320Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.656180Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:afedf4caffeaa70b4149f6083bb0cbc036be2e5784d1bdd4a7b879a52cbf8aa7","observation_id":"1a6a0e55-3b5f-4c3f-8143-3877a86ae2c4","resolution":{"observed_at":"2026-08-06T17:54:17.656180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.01111","last_updated":"2026-05-01T21:31:59Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T21:31:59Z","title":"When Less is Enough: Efficient Inference via Collaborative Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:04.267404Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.01111"},"observation_digest":"sha256:6e0f35fbb3ea86ee264be7c22505b4559b7a27af7e3142ee8f350cb030130aab","observation_id":"8750ce5d-5a39-4973-b88c-f5a6ab0bb8e8","resolution":{"observed_at":"2026-05-11T15:41:43.015133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-08-17T00:27:13.360022Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:9c38541829d9f771cb83d7d4156bb775e118be1549935284a2bb37eececec96b","observation_id":"db530fcd-f20b-452a-a13e-c6bf8b302f72","resolution":{"observed_at":"2026-05-11T20:06:09.245378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-08-15T18:40:31.376425Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:3d433c2baea362cd872089a211db258128436c58d832012dd234979ee937a6a6","observation_id":"e7e74023-cbfa-40f8-bf5f-ce48eef83c14","resolution":{"observed_at":"2026-05-20T06:43:05.960803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-12T21:06:03.093786Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:e3e0c9807e0146092921a89f46e7bc5f6e5ee64cc053f5f9493b844a0ed52493","observation_id":"95d5fa2c-63b2-4dac-83bf-2b0e9d95bf91","resolution":{"observed_at":"2026-07-04T05:09:36.877011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-08-02T10:49:08.087657Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-12T21:06:03.093786Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.087657Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:58cff88273ef00e07e01c67c48d1d9fba706fcf45645b95d08ddfb1c64e242a7","observation_id":"e6967e08-c3c8-4e23-8297-c4dd9a0ee001","resolution":{"observed_at":"2026-08-02T10:49:08.087657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-14T19:03:41.455654Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:a45a968a58298859c2d2093cb827feb3467b9885324155cf2dfb914194f3da96","observation_id":"d3634661-fae2-4be1-8448-6bce7fdca490","resolution":{"observed_at":"2026-07-04T09:19:43.876796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21178/citation-record","integrity":"/paper/2505.21178/integrity","json":"/paper/2505.21178/citation-record.json","paper":"/paper/2505.21178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.371918Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.371918Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:b3a6eb40dfc4c9b685f0fd930affc4ebe8416c8d48fc78dfb7a9469d9b00a1a4","observation_id":"b81ee456-0d52-4b5f-a579-962eb784e605","resolution":{"observed_at":"2026-08-07T13:41:28.371918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:41:28.479540Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.479540Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:2ef412ab0359eb834b4834b6cafde4a659486ad9907a40372ba70c5be5636243","observation_id":"12e31e88-5060-4b0a-8c26-a120743c7073","resolution":{"observed_at":"2026-08-07T13:41:28.479540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.585725Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.585725Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:6d5bf3fc4f4eb3767d2c4b488a4e1c89cb817209dac8c2cce29b8715534910a5","observation_id":"1420f42f-046d-4d1e-b85f-f8012d519340","resolution":{"observed_at":"2026-08-07T13:41:28.585725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:41:28.688241Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.688241Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:34e789127a1bb5a35fe933df07402abad522d76511412b0a0d2bd0565cb51c91","observation_id":"5b96ee8c-6b8d-4c54-86ce-3f52d171f55a","resolution":{"observed_at":"2026-08-07T13:41:28.688241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:41:28.743661Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.743661Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:ac967290a0f8495096898f1b0bbc5d680afae18825e167dd779533fd8c95db98","observation_id":"33d1973f-f508-46ff-85b6-373f6c750ef6","resolution":{"observed_at":"2026-08-07T13:41:28.743661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.831623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.831623Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:a0505f1e99433597643b5b9261685b530b122f1a1acf6a24c4313f80797f7ff2","observation_id":"1f177744-3d28-4f1c-aef2-1fe4e8ed9d75","resolution":{"observed_at":"2026-08-07T13:41:28.831623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.905630Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.905630Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:44b1750e71e63216a9f88a4304ca4805eed0dac99acc4cd157e40fe4ed873bc8","observation_id":"456363e9-8d2a-40f7-a591-f83ee6693c8b","resolution":{"observed_at":"2026-08-07T13:41:28.905630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:31.299343Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"4be580f7-8fc5-44c4-84b2-cc8e14be0059","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.965945Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:13b4be31857c31843c01e6345f179cc28c4d0626f5717e26aa13b711282a4c35","observation_id":"86c3e0a8-97dc-42e0-a5bf-afd2471842bb","resolution":{"observed_at":"2026-08-07T13:41:31.410685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T13:41:29.061996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.061996Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:24796f944da9ef72e6c8a973ebbc2e7a80eea97580a72afc0c350ce7c9473e4e","observation_id":"7f16d0e7-aa85-44dc-b555-33bb96a862db","resolution":{"observed_at":"2026-08-07T13:41:29.061996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.136896Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.136896Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:46ed7f1d9913201771cda194e34a1b8964230f980722893978d2e62dea46e103","observation_id":"a9fd87bd-9edf-4305-8e57-5b10c52f7099","resolution":{"observed_at":"2026-08-07T13:41:29.136896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:31.063946Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models, 2025","venue":null,"work_id":"10751d96-5069-4d9f-8ed2-e220a82ad5f8","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.211992Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:daba37cb5c20343c980989f749a51317be48d5a8ef291f78e3bd5506bbc19d72","observation_id":"5b103f33-1860-4f6d-b835-a1d09a3214f4","resolution":{"observed_at":"2026-08-07T13:41:31.164901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.309212Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.309212Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:966d800c555e44bbdcddbcb75c5a05808b267f3413cd1b0d0e146b189de4e16c","observation_id":"5192dda7-3a17-4409-a2a3-95e4236bd339","resolution":{"observed_at":"2026-08-07T13:41:29.309212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T13:41:29.358576Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.358576Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:0be21c82d2b6d3a21372b095d5580208e79a80c51ab43fb9e5d1a627b2b12ada","observation_id":"14d24b52-b044-43cb-b105-0d52f8507a96","resolution":{"observed_at":"2026-08-07T13:41:29.358576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.407186Z","title":"Concise reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.407186Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:231ab245ac55b909d9d63746c8e1f371c9fbd72fb8975c97f23dc11d18618418","observation_id":"a511c874-76ae-4ea0-85d0-2e683ec10817","resolution":{"observed_at":"2026-08-07T13:41:29.407186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:41:29.485654Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.485654Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:f79431a411be016f41f7b711300bf48de54722f40c6353d8354ba7764d81c383","observation_id":"268f1b66-93e5-483a-b060-83623e1f2a68","resolution":{"observed_at":"2026-08-07T13:41:29.485654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:41:29.558645Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.558645Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:5bdfad3150abe2248366899b5e76d775c8009689def98f10d10d60b6e0b1bdc8","observation_id":"b78ba4d1-5f53-4b63-b769-b4ea1b998dac","resolution":{"observed_at":"2026-08-07T13:41:29.558645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.651369Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.651369Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:9ccdf3bfb11112875b4d1aac775f43933f4c7709025fe300fb44fd779a5d2932","observation_id":"dd7c4d8d-a154-4858-b2e0-37ecac62f55f","resolution":{"observed_at":"2026-08-07T13:41:29.651369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T13:41:29.732447Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.732447Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:25b367b5954f949d6645c2c225d13226cc626a0aa95e951857a63023f7e8c635","observation_id":"a8570983-096a-48d2-96c9-cb11b5ddd572","resolution":{"observed_at":"2026-08-07T13:41:29.732447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.811939Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.811939Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:0f37316ed80d37d7f9263ca04609e72ae6014d39672b380bfa449c867c1774be","observation_id":"d83cab6b-6cbc-47a6-89d8-dc83d447fa79","resolution":{"observed_at":"2026-08-07T13:41:29.811939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.865586Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility, 2025","venue":null,"work_id":"856e85b6-5c34-478f-91b0-19e2c09e4be4","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.893961Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:900651343bf48b9c0da06ee098658a71abe0d4bb8a3da7b3cd1e193f06422e91","observation_id":"2ed5ca11-5da9-4e14-ae6c-686c2603a8b2","resolution":{"observed_at":"2026-08-07T13:41:30.939427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:41:29.958468Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.958468Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:a5f55722b6c6fed680befcf9ed7b6fda2ee2d564397d16fd5a513671b6a12a83","observation_id":"0be12f3a-3998-48ae-b6c5-b0585ec4b4a6","resolution":{"observed_at":"2026-08-07T13:41:29.958468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.007684Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.007684Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:9562a434a014e81b23352a036a75a6d73498c941791bd75266cb1613b5005ebf","observation_id":"03ada641-80cc-400b-98b9-b340269b483c","resolution":{"observed_at":"2026-08-07T13:41:30.007684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-20T04:08:34.710482Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T13:41:30.046501Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.046501Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:8bcb4f7a82bafdd5a440cb42d93df1d567a6204c141042229e583346435c45e5","observation_id":"267993ab-5ae7-41f0-9343-3a739f73831e","resolution":{"observed_at":"2026-08-07T13:41:30.046501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.127471Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.127471Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:526b2c9663618224b338aa2d6d921be695969a2f270130ff3ec0c7b812010d86","observation_id":"d2a9d0b3-0b5e-4d55-9cc0-2409c6bff85d","resolution":{"observed_at":"2026-08-07T13:41:30.127471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.176429Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.176429Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:944b5cc4ceff4a2ccc11e9ce72d6c959d9fdca4b6cdd207288566235f0d993d5","observation_id":"2f985c0f-0f15-43e3-9239-8d282d54aa74","resolution":{"observed_at":"2026-08-07T13:41:30.176429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.664520Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"b5edaca9-a83b-47c9-8527-1d1e1f5e46fe","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.255652Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:a5af273742693b1298c856d45590892e74a7ab056db30ae992626e2cfa2d3575","observation_id":"dfa24d0c-3be8-487b-8067-7af43a5e905e","resolution":{"observed_at":"2026-08-07T13:41:30.761315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.317826Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.317826Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:c73796fecc529b0f864706680dfd2b1adb95ee58bd49062078ec92b5c4374dfe","observation_id":"21283f7c-89e6-4307-8f3e-8c67dc08414f","resolution":{"observed_at":"2026-08-07T13:41:30.317826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.382317Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.382317Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:4d55082ce7e51684dc081c5095f3f86faad0c08e045451b207ee4cda22a657c4","observation_id":"166f3aa0-d6bd-4d93-93f9-12be5dd032c0","resolution":{"observed_at":"2026-08-07T13:41:30.382317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-20T04:23:28.056352Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T13:41:30.443487Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.443487Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:b8a0acffed35464cb0c13834d2bba9801ecd3de5a5632e409eed432b75fab927","observation_id":"a85ba105-22b8-4869-ad5a-b8688d9142cc","resolution":{"observed_at":"2026-08-07T13:41:30.443487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T13:23:35.297695Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 8 inbound Pith citation observations for arXiv:2505.21178."}