{"as_of":"2026-08-23T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:113f4fc029dcbd4ce10fd8148c4a683da52f8760ee08b2058882d4c8d4edc8d0","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:40:36.160535Z","state":"measured"},{"denominator":135,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":135,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:02:43.391391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.398075Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-11T14:03:18.881721Z","title":"arXiv preprint arXiv:2502.06703","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12583","last_updated":"2025-09-08T13:19:38Z","snapshot_observed_at":"2026-08-19T15:04:48.341360Z","submitted_at":"2024-12-17T06:24:34Z","title":"Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T14:03:18.881721Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2412.12583"},"observation_digest":"sha256:414da7091786da8981d87b714e00ab25b8e94e8528955f710e6517d649111998","observation_id":"12e23caf-5740-48e4-a599-552c1dc2ba0d","resolution":{"observed_at":"2026-08-11T14:03:18.881721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:877648529e14393603dc2515fb3f5c112c94d55e4d4503f30dc5e6bb0b3bf927","observation_id":"fe093e0f-d652-441b-b5fa-38c9472106c5","resolution":{"observed_at":"2026-05-19T06:59:03.190673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-16T12:02:43.391391Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13828","last_updated":"2025-04-28T12:41:07Z","snapshot_observed_at":"2026-08-18T03:47:57.203659Z","submitted_at":"2025-04-18T17:55:58Z","title":"Generative AI Act II: Test Time Scaling Drives Cognition Engineering","version":3},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-08-16T12:02:43.391391Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2504.13828"},"observation_digest":"sha256:ae3ed589ccf486228f97acafec238b0b9becee668421feaa1adbffc0ace4b2fd","observation_id":"de9a547a-9609-43e4-a615-cc6cdb1b7bca","resolution":{"observed_at":"2026-08-16T12:02:43.391391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-16T12:01:24.978443Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14047","last_updated":"2026-08-01T01:08:19Z","snapshot_observed_at":"2026-08-20T05:13:03.251113Z","submitted_at":"2025-04-18T19:32:55Z","title":"Rethinking Inference-Time Scaling: Efficiency Limits and Linguistic Signals","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:01:24.978443Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2504.14047"},"observation_digest":"sha256:fbb52dbcb92a35a0b4f915f5ebcaabea078178ea538243a06fa27d29a4c492a1","observation_id":"75491ede-3eb2-43fb-a5ac-1803552c43bc","resolution":{"observed_at":"2026-08-16T12:01:24.978443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-16T11:24:11.989033Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-17T21:55:02.668814Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:11.989033Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2504.15585"},"observation_digest":"sha256:a39909dbd5dcb8c823e2c05247f64a84185780bf4bdfc3cc1ba4e30fcf0ee916","observation_id":"04d34214-fdf5-4c87-a187-334209e2a6f2","resolution":{"observed_at":"2026-08-16T11:24:11.989033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-16T04:32:20.445343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01073","last_updated":"2025-05-02T07:25:01Z","snapshot_observed_at":"2026-08-19T08:02:49.118444Z","submitted_at":"2025-05-02T07:25:01Z","title":"Retrieval Augmented Learning: A Retrial-based Large Language Model Self-Supervised Learning and Autonomous Knowledge Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:32:20.445343Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.01073"},"observation_digest":"sha256:7902d86d6e2ff4e6d97647c4bf0e6ad461a9276d8eb779747845328be7436d6b","observation_id":"6566f18c-c441-4f8c-95c5-1b5bb6c878d8","resolution":{"observed_at":"2026-08-16T04:32:20.445343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-16T00:48:17.937441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02665","last_updated":"2025-05-08T05:27:18Z","snapshot_observed_at":"2026-08-18T12:36:55.051772Z","submitted_at":"2025-05-05T14:14:59Z","title":"A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:48:17.937441Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.02665"},"observation_digest":"sha256:974c6dd697c43e318e51c3b2e6391199940610346a69daa7800b9e835d8d83b3","observation_id":"b4e6488e-6282-4356-b486-808a8578c478","resolution":{"observed_at":"2026-08-16T00:48:17.937441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-15T20:38:16.941819Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12392","last_updated":"2025-05-26T05:28:49Z","snapshot_observed_at":"2026-08-18T19:44:39.778431Z","submitted_at":"2025-05-18T12:37:56Z","title":"SLOT: Sample-specific Language Model Optimization at Test-time","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:16.941819Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.12392"},"observation_digest":"sha256:8023d5e3474b1c82cae9d822e74cef228b1fbcda4a4b0ccdffee43ded96a5b70","observation_id":"7ca01e10-82d6-4c5b-bc2c-171388286475","resolution":{"observed_at":"2026-08-15T20:38:16.941819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T15:20:21.815453Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15508","last_updated":"2025-05-21T13:27:38Z","snapshot_observed_at":"2026-08-10T19:26:09.750901Z","submitted_at":"2025-05-21T13:27:38Z","title":"Multilingual Test-Time Scaling via Initial Thought Transfer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:21.815453Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.15508"},"observation_digest":"sha256:cbb71c4361d9d1b1212cecb2f906221e06d3e72595a9d413f1efa0cef9fb64c4","observation_id":"d4935d78-a4ba-474c-b0b3-7ad6ed3f10c7","resolution":{"observed_at":"2026-08-07T15:20:21.815453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:45:17.775098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17829","last_updated":"2025-05-23T12:42:50Z","snapshot_observed_at":"2026-08-20T18:38:54.052870Z","submitted_at":"2025-05-23T12:42:50Z","title":"Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:45:17.775098Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.17829"},"observation_digest":"sha256:d3a7ff187ce39a37d2dc908043ed5e288cdd40ce5c3f57cde01a12559bbabf3f","observation_id":"cec42c1f-e556-47dc-b89a-fa22ea3aa623","resolution":{"observed_at":"2026-08-07T14:45:17.775098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:31:13.154734Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.154734Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:26c69a1549193e71934574c060b5b80b6ad8eafa0d89e9afea629e62697b6a23","observation_id":"061d8941-df23-4968-95e9-82c3a7d639e5","resolution":{"observed_at":"2026-08-07T14:31:13.154734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:14:22.357992Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19634","last_updated":"2025-09-12T01:41:20Z","snapshot_observed_at":"2026-08-20T07:40:35.836424Z","submitted_at":"2025-05-26T07:51:30Z","title":"Faster and Better LLMs via Latency-Aware Test-Time Scaling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:22.357992Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.19634"},"observation_digest":"sha256:f00aeaabb00e347fcaf68e7815109f1555cd6f7e6b0fc2af1208391511943041","observation_id":"770b0951-6d1e-4e04-80c8-1b81e777a340","resolution":{"observed_at":"2026-08-07T14:14:22.357992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:14:19.428465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-22T00:11:54.323200Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.428465Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:c00a605e1c5e6fb36a5b758c162e869df80b352838f91f92edcf78daa2ead0b5","observation_id":"c9834023-d4e3-4163-b2fb-b9b35d000c63","resolution":{"observed_at":"2026-08-07T14:14:19.428465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:38:06.969200Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20325","last_updated":"2025-05-23T18:19:09Z","snapshot_observed_at":"2026-08-20T19:20:54.250799Z","submitted_at":"2025-05-23T18:19:09Z","title":"Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:06.969200Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.20325"},"observation_digest":"sha256:0b052e3abcf2194fbbee8b3c8ecf4e2fb5db54c6f6cb40b6b6288b31b7c37ed3","observation_id":"0c218e16-140b-455b-92f5-e2e6dc5776f2","resolution":{"observed_at":"2026-08-07T14:38:06.969200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T13:53:57.290694Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20643","last_updated":"2025-05-27T02:44:00Z","snapshot_observed_at":"2026-08-17T23:06:13.201500Z","submitted_at":"2025-05-27T02:44:00Z","title":"Can Past Experience Accelerate LLM Reasoning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:57.290694Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.20643"},"observation_digest":"sha256:b8ee1d6b1c207fcd8240fb60a89b95afab6761aa03509e40ffd68ee7009efc4b","observation_id":"c08a3bb2-51a6-464e-bd4b-23b5a2357fc3","resolution":{"observed_at":"2026-08-07T13:53:57.290694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T12:45:46.144862Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-18T16:44:41.603160Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.144862Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:6100b9f4c06971d2bc6842de3d8c700dd885cc840c00b62d1c38a951658b3d25","observation_id":"e8b51122-ee9a-4f4c-a762-8a2f07fc51e9","resolution":{"observed_at":"2026-08-07T12:45:46.144862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T10:52:49.678833Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04205","last_updated":"2025-06-04T17:49:10Z","snapshot_observed_at":"2026-08-19T14:34:41.451189Z","submitted_at":"2025-06-04T17:49:10Z","title":"EPiC: Towards Lossless Speedup for Reasoning Training through Edge-Preserving CoT Condensation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:49.678833Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.04205"},"observation_digest":"sha256:7c0bcb0c67f08c69316dec53b0ed60075b6440d6ccd7b2654ca7c6d951f8690a","observation_id":"df98069d-c01a-4be8-a355-bf5788b300b8","resolution":{"observed_at":"2026-08-07T10:52:49.678833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T05:26:47.172225Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-16T21:20:10.865400Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.172225Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:bfd4066a38dec1dc73cea46c206706c091191af1f8438611aa70ed7354331cfc","observation_id":"70bd4eff-189c-4e66-ba8b-fcf6c0b35422","resolution":{"observed_at":"2026-08-07T05:26:47.172225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T00:41:48.364617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12928","last_updated":"2025-06-15T17:59:47Z","snapshot_observed_at":"2026-08-19T10:20:20.766519Z","submitted_at":"2025-06-15T17:59:47Z","title":"Scaling Test-time Compute for LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:48.364617Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.12928"},"observation_digest":"sha256:4d8f64d6102e901572f50c1e01d7abf6f3a0c87db9faf668d3fc329fab948d66","observation_id":"b527d30a-272e-4fb3-9d5c-64ecec4f111a","resolution":{"observed_at":"2026-08-07T00:41:48.364617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T23:48:23.585240Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16043","last_updated":"2025-06-19T05:40:54Z","snapshot_observed_at":"2026-08-17T06:40:44.502583Z","submitted_at":"2025-06-19T05:40:54Z","title":"DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:23.585240Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.16043"},"observation_digest":"sha256:3b42e0c69b380cebea192e5e4c7321096b033288413bbd82b20bedad23cd0cae","observation_id":"e1dffc48-5b3e-485f-844b-22ccc0ae2bac","resolution":{"observed_at":"2026-08-06T23:48:23.585240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T22:59:14.428010Z","title":"arXiv preprint arXiv:2502.06703 (2025) 24","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20294","last_updated":"2026-07-03T05:27:17Z","snapshot_observed_at":"2026-08-18T10:13:10.055353Z","submitted_at":"2025-06-25T10:01:00Z","title":"Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:59:14.428010Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.20294"},"observation_digest":"sha256:99536f625369138e43bdf5e0a9d7a7d57518fe34e0799f62e5f33197dbd8ce2a","observation_id":"2bb8fc79-a48f-435b-ba00-1ec1647935fc","resolution":{"observed_at":"2026-08-06T22:59:14.428010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T22:16:18.935562Z","title":"arXiv preprint arXiv:2502.06703 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22075","last_updated":"2026-06-30T08:35:07Z","snapshot_observed_at":"2026-08-23T11:05:17.871843Z","submitted_at":"2025-06-27T10:03:05Z","title":"Reasoning in machine vision by learning fast and slow thinking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:18.935562Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.22075"},"observation_digest":"sha256:cff03d4507c24f41178bb0bf44984dad945b4d3843087fc01f8cdbf6b09cac90","observation_id":"24c08bd8-c10a-4603-a5cf-ceaf7891c0a7","resolution":{"observed_at":"2026-08-06T22:16:18.935562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T20:46:44.778485Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-13T21:11:00.864909Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.778485Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:0cdf8b37eead61fa0ab24cd9e9fea5a52d3a1fe89939815862b17cd457095efa","observation_id":"47967841-d013-48fe-a5c4-a9853eeb27be","resolution":{"observed_at":"2026-08-06T20:46:44.778485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T20:43:11.344018Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-08-14T10:43:51.935390Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:11.344018Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.02076"},"observation_digest":"sha256:f4f7816a4aa55a1e2c65821b8c492dcb600278b86647ad6dd661f6910126c4fa","observation_id":"19d5599b-be23-49fd-9f3b-148432ac69ae","resolution":{"observed_at":"2026-08-06T20:43:11.344018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T16:17:44.141518Z","title":"belongs to the category of,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13966","last_updated":"2025-09-01T20:28:13Z","snapshot_observed_at":"2026-08-19T12:06:48.647511Z","submitted_at":"2025-07-18T14:30:08Z","title":"Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T16:17:44.141518Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.13966"},"observation_digest":"sha256:1d075666901cf7bc7ba5cfaef8c896c5b56eca8562de2a277fcaaf95d25dd752","observation_id":"53431e79-949f-4e23-b2ac-162677dd400c","resolution":{"observed_at":"2026-08-06T16:17:44.141518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-14T07:39:12.121905Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:7d38a605f8a7ac0dfd3886dd9df602ffbf8c47eb9116cc17712ccb50f6e213e2","observation_id":"acd9282a-53af-4db8-a978-38b29d59fe79","resolution":{"observed_at":"2026-05-21T23:24:26.286832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-15T18:20:59.459727Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17699","last_updated":"2025-07-23T17:04:20Z","snapshot_observed_at":"2026-08-19T14:08:51.530652Z","submitted_at":"2025-07-23T17:04:20Z","title":"Thinking Isn't an Illusion: Overcoming the Limitations of Reasoning Models via Tool Augmentations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:20:59.459727Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2507.17699"},"observation_digest":"sha256:fd966bbf7e6656d98bfa77f8d7f61ff8c050ab150f61863cb17d70b860d23491","observation_id":"0f4e7dcf-2c7d-4e7e-aa2a-2a3989bf4133","resolution":{"observed_at":"2026-08-15T18:20:59.459727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-06T00:49:56.372971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04216","last_updated":"2025-08-06T08:48:55Z","snapshot_observed_at":"2026-08-17T16:54:43.197754Z","submitted_at":"2025-08-06T08:48:55Z","title":"Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T00:49:56.372971Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2508.04216"},"observation_digest":"sha256:c774f455fe60735ea3446fa4f6f9b565288663d87c27939a3b42ba32021343f3","observation_id":"9c1a11d3-de30-4c11-9006-604f787b15e8","resolution":{"observed_at":"2026-08-06T00:49:56.372971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-05T20:17:10.690804Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:10.690804Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:303341291271b43274d2977ccd1191a5a8d597dcd98a7f8e25a6f2b72359b189","observation_id":"0972242c-07d0-4677-81ae-206435b91c3f","resolution":{"observed_at":"2026-08-05T20:17:10.690804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-05T20:04:02.266502Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-20T00:16:35.809238Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:02.266502Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2508.11356"},"observation_digest":"sha256:79ed03f087adb891bb782ab84c0958a5c5a88ccaedecbfc475d925fba73cca73","observation_id":"7bff4313-4b00-48ed-aa9e-c23e1d52487a","resolution":{"observed_at":"2026-08-05T20:04:02.266502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2508.15202","last_updated":"2026-05-04T16:17:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T03:31:11Z","title":"Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T22:41:26.047957Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2508.15202"},"observation_digest":"sha256:e4208535fdfb44a956265886224ea34bec39faaca4d81dd3231af1ef2ff44130","observation_id":"d6267bea-60f9-4002-9d17-e79cf6229fd4","resolution":{"observed_at":"2026-05-18T22:41:52.929951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2509.13332","last_updated":"2026-05-10T19:19:49Z","snapshot_observed_at":"2026-08-16T15:06:47.717927Z","submitted_at":"2025-09-09T18:36:02Z","title":"Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T17:31:28.644151Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2509.13332"},"observation_digest":"sha256:9c9c5574485f0a780a77bd7f923393bb07ed2e82be02970309ce501ca2a1ae1c","observation_id":"e3eaa87b-24a6-41d4-be51-6f9b9d280004","resolution":{"observed_at":"2026-05-18T17:31:41.548743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-04T12:43:41.263738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03352","last_updated":"2026-05-26T02:33:06Z","snapshot_observed_at":"2026-08-15T02:15:19.015141Z","submitted_at":"2025-10-02T20:16:00Z","title":"Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:43:41.263738Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2510.03352"},"observation_digest":"sha256:9bc6c095010b5d24102e97249f30a61b473c20210adc576bfe95891253af0a07","observation_id":"2a58f66e-2eb4-4c11-a9b8-328ef81b1a4e","resolution":{"observed_at":"2026-08-04T12:43:41.263738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-08-15T14:36:41.242147Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T20:29:25.874620Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2510.06062"},"observation_digest":"sha256:1fe18aea24fbf5e739557af908e363fec2664e898df7a965e11eb234f69ee66d","observation_id":"2a18a124-832f-43ac-b30b-6e04511b983b","resolution":{"observed_at":"2026-05-21T20:30:35.518062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2601.21684","last_updated":"2026-05-05T06:17:11Z","snapshot_observed_at":"2026-08-02T07:26:05.475014Z","submitted_at":"2026-01-29T13:18:36Z","title":"Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T09:53:14.045466Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2601.21684"},"observation_digest":"sha256:c1d9d90e370a31e88eb8fe734536e56e2b622c720b9ceb3f9db5e63f28e0f4ea","observation_id":"92240cde-4213-4933-91e7-3328797739ac","resolution":{"observed_at":"2026-05-16T09:57:43.015774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2603.16331","last_updated":"2026-05-22T07:55:26Z","snapshot_observed_at":"2026-08-19T20:10:01.158077Z","submitted_at":"2026-03-17T10:03:30Z","title":"Decoding the Critique Mechanism in Large Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T06:48:20.712294Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2603.16331"},"observation_digest":"sha256:c3f2abceba639c01141b9140bf376df159aa73e79da36bd72ba049ff73c30e01","observation_id":"bbda081e-6dd4-4094-a0ad-2de16fb6ff00","resolution":{"observed_at":"2026-05-25T06:50:28.456759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2604.04750","last_updated":"2026-04-09T14:13:19Z","snapshot_observed_at":"2026-08-15T16:24:53.602682Z","submitted_at":"2026-04-06T15:16:35Z","title":"DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:17.725111Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2604.04750"},"observation_digest":"sha256:04eeb65a8c577137bec29c8404d89e5d09fc76b198fbb2a67da7b390e4336bd8","observation_id":"54d004f6-27d7-4e08-9bce-fb0331d17a3d","resolution":{"observed_at":"2026-05-10T23:30:52.070140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2604.14853","last_updated":"2026-04-16T10:39:22Z","snapshot_observed_at":"2026-08-18T08:50:10.405688Z","submitted_at":"2026-04-16T10:39:22Z","title":"Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T11:57:44.680423Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2604.14853"},"observation_digest":"sha256:e856dc670804f8305ffcfc37b4725d3ac8bb72c5bcef702b66ee294808a43f2d","observation_id":"126d36a2-d261-418c-8477-6cc26e49bbea","resolution":{"observed_at":"2026-05-10T12:00:22.130974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2604.15239","last_updated":"2026-04-16T17:12:37Z","snapshot_observed_at":"2026-08-15T23:00:27.111453Z","submitted_at":"2026-04-16T17:12:37Z","title":"TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T11:11:45.176020Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2604.15239"},"observation_digest":"sha256:20f4692e1915dd331f4c3339f35cbe0d3685ebcbe8fff6ad1aff06814a016d1b","observation_id":"e27a3869-9ed8-4ef0-9efb-add1b299e1c8","resolution":{"observed_at":"2026-05-10T11:20:11.264650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2604.24198","last_updated":"2026-06-20T11:27:04Z","snapshot_observed_at":"2026-08-11T12:39:50.702230Z","submitted_at":"2026-04-27T09:00:30Z","title":"Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:34.897401Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2604.24198"},"observation_digest":"sha256:b29bfbfdbadad81b435ce2796cdbc57c1f1902accbcb90c6ff0512a6ca3a328a","observation_id":"7ad84d25-93e2-4f8e-b738-589f602625db","resolution":{"observed_at":"2026-05-11T21:56:15.853807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2604.24198","last_updated":"2026-06-20T11:27:04Z","snapshot_observed_at":"2026-08-11T12:39:50.702230Z","submitted_at":"2026-04-27T09:00:30Z","title":"Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T09:13:20.071265Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2604.24198"},"observation_digest":"sha256:3489b0cb10b38de9e311d8262a57ad7e03155df18a0a0b18e02c9ce336f3b0e1","observation_id":"3b38060d-072b-466c-b341-4eeb9f518978","resolution":{"observed_at":"2026-07-01T09:15:43.492180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-10T20:20:22.759976Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:3d90d85ab56e949c32148da3f92d600cfd83c30c9cede929da120f34bcf342ad","observation_id":"a195219e-a949-4335-852b-361d6126e051","resolution":{"observed_at":"2026-05-11T16:31:09.074348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.04461","last_updated":"2026-05-06T03:40:05Z","snapshot_observed_at":"2026-08-01T01:47:15.158535Z","submitted_at":"2026-05-06T03:40:05Z","title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:16:14.985693Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.04461"},"observation_digest":"sha256:acdbc259823363732f097f21e80f9d1de56e4712e4e8595202b7f420cbf9f819","observation_id":"11ce872f-0adc-4370-8d30-fe73dc63e331","resolution":{"observed_at":"2026-05-09T06:40:39.485808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.08057","last_updated":"2026-05-08T17:44:15Z","snapshot_observed_at":"2026-08-11T07:32:29.834666Z","submitted_at":"2026-05-08T17:44:15Z","title":"CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T02:28:20.366674Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.08057"},"observation_digest":"sha256:d57ebae18feb56fd700ebff5ca8c85c07f0d73632718ecabefccb62f8e5570ab","observation_id":"bf6069d9-8c6b-41c2-b8be-3d5599c9b936","resolution":{"observed_at":"2026-05-11T03:25:58.231082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.10158","last_updated":"2026-05-11T08:05:27Z","snapshot_observed_at":"2026-08-16T03:12:39.850017Z","submitted_at":"2026-05-11T08:05:27Z","title":"Unsupervised Process Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:19:04.275069Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.10158"},"observation_digest":"sha256:587250aa264bfc4d41ec6ee61c0eea11e838f93f495d8c6f93e0623b916c1eb0","observation_id":"caf4bf73-971a-4969-b53a-d38ec486c73f","resolution":{"observed_at":"2026-05-12T03:21:18.916734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:52.375703Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:0778bfac3d92c0fa838b2f6fccd1874512a2d0791b810f76ca5a923ef07fe159","observation_id":"bee8b60e-40cd-4275-a5e4-987132bfa689","resolution":{"observed_at":"2026-05-12T06:51:30.089678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T05:11:32.053440Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:02c5628b9279cb1661d5215cc305d663bb735ce3329f5c4d4aa3863453221b9c","observation_id":"03950951-7438-428e-bfa6-432eab0f39d4","resolution":{"observed_at":"2026-05-15T05:15:03.365580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:f464ea2523294d880957685b76590c88e0b473497b0c95d641c42c55dcd3f0fe","observation_id":"3be9bfea-ecf3-44d4-bf02-409477c54888","resolution":{"observed_at":"2026-07-01T20:56:13.733864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-08-13T23:07:04.214760Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:7b2dd597a3683b9d1fe740c1172bcfb611ec3b72aa9ba4eefd6ea54258885462","observation_id":"6388b362-79f2-43ae-9054-63e432943e5d","resolution":{"observed_at":"2026-07-02T22:27:26.378161Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-08-12T13:39:08.360008Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:e969f110bd3547f44666cde48aefd3389b29ab4590729ac7a324345e818ce355","observation_id":"7170760e-940f-4c37-902f-f3141149314a","resolution":{"observed_at":"2026-07-04T09:49:44.883889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-10T18:32:18.583804Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:0e8459608e3f1cc76314cb0faa628d2431cd4e7424a44e77c32b4779e0f0476c","observation_id":"ec2d4e04-69fa-49d4-ab3d-60fa6008b35b","resolution":{"observed_at":"2026-07-04T21:00:08.400710Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2502.06703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-04T21:00:08.398075Z","title":"Liu, R., Gao, J., Zhao, J., Zhang, K., Li, X., Qi, B., Ouyang, W., and Zhou, B","venue":null,"work_id":"9325fd2c-00cc-47d0-9154-bfa2a83c5179","year":2025},"citing_paper":{"arxiv_id":"2606.28661","last_updated":"2026-06-27T00:37:33Z","snapshot_observed_at":"2026-08-14T07:05:16.958846Z","submitted_at":"2026-06-27T00:37:33Z","title":"When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T09:44:27.786630Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2606.28661"},"observation_digest":"sha256:27ee06d737720c7972e6cefab69888b6479bd84bad7791a6b0f8506f563dda16","observation_id":"ff9bd608-6a8d-4d92-9f84-fce98c499edf","resolution":{"observed_at":"2026-06-30T09:44:37.092805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-13T12:49:40.220419Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:9f8af218f24e0de7d88344bb3f1dcb77b8d4199b13e8cc7750df779b72d82794","observation_id":"fb27912b-109e-4283-9f1d-4c4727f952d5","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-14T14:00:54.863716Z","title":"Can 1B LLM surpass 405B LLM? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10139","last_updated":"2026-08-17T00:19:55Z","snapshot_observed_at":"2026-08-20T23:12:38.487900Z","submitted_at":"2026-07-11T05:57:54Z","title":"LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:54.863716Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2607.10139"},"observation_digest":"sha256:664e4e35731d43759aa59d50be42ade2e1e1e116840760ee6912da1bf30d2ba0","observation_id":"479f5bd3-9708-4dd4-bb78-add836d6214f","resolution":{"observed_at":"2026-07-14T14:00:54.863716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-02T07:28:23.264118Z","title":"Can 1B LLM surpass 405B LLM? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10139","last_updated":"2026-08-17T00:19:55Z","snapshot_observed_at":"2026-08-20T23:12:38.487900Z","submitted_at":"2026-07-11T05:57:54Z","title":"LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:23.264118Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2607.10139"},"observation_digest":"sha256:106a1b2ec2b7d33da37c7b2c23257a845242e0544d9e0507eb611f9e3d6e93a7","observation_id":"1c322afa-c81b-4eb6-ae47-174fb3224b10","resolution":{"observed_at":"2026-08-02T07:28:23.264118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-07-14T05:09:00.865375Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11505","last_updated":"2026-07-13T12:56:21Z","snapshot_observed_at":"2026-08-15T06:15:17.745652Z","submitted_at":"2026-07-13T12:56:21Z","title":"Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T05:09:00.865375Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2607.11505"},"observation_digest":"sha256:4cea1306e4dc4f7e1a9a25900ba28df0874b702c41d8254ec10eede6658038fd","observation_id":"71089cd9-0a78-4511-b41f-ac42a2359ce4","resolution":{"observed_at":"2026-07-14T05:09:00.865375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-05T05:02:10.707287Z","title":"Can 1B LLM surpass 405B LLM? Rethinking compute-optimal test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03961","last_updated":"2026-08-04T17:27:21Z","snapshot_observed_at":"2026-08-23T05:23:01.213135Z","submitted_at":"2026-08-04T17:27:21Z","title":"Interpretable Adaptive Sampling for LLM Test-Time Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:02:10.707287Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2608.03961"},"observation_digest":"sha256:2900a8b8dd08a3f169c44112f65d3f3f3b3a7db6a0d8b3982ff5fb02b6568300","observation_id":"5e0c3839-c60d-4d1e-808f-c23fbca65622","resolution":{"observed_at":"2026-08-05T05:02:10.707287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-14T04:40:10.392620Z","title":"arXiv preprint arXiv:2502.06703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08447","last_updated":"2026-08-09T03:30:14Z","snapshot_observed_at":"2026-08-17T06:02:48.187688Z","submitted_at":"2026-08-09T03:30:14Z","title":"Hidden Language Consistency Phenomena in Reasoning LLMs","version":1},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-08-14T04:40:10.392620Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2608.08447"},"observation_digest":"sha256:dd5dd6ec2c0f25044b72b382f865166d6dc336d8a68c5b1248a4cb0f7f05f5ab","observation_id":"93d7ffdc-ce11-42f4-96f2-5e42db65a721","resolution":{"observed_at":"2026-08-14T04:40:10.392620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06703/citation-record","integrity":"/paper/2502.06703/integrity","json":"/paper/2502.06703/citation-record.json","paper":"/paper/2502.06703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.136792Z","title":"Aime 2024, 2024","venue":null,"work_id":"d799c4c3-6ad1-43e7-9a4f-0b1b8812a8e0","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.899577Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:eec5969d41458dd08ab65c902b1c44e8fc8a642cdfba1ff0a9cdbe2e5b2e5d3e","observation_id":"9b234873-5a17-4cbc-9950-59c4831a6423","resolution":{"observed_at":"2026-08-08T14:40:37.140448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.126440Z","title":"Introducing Claude , 2023","venue":null,"work_id":"28660b6f-b5ea-4d4b-9e48-1b118020a682","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.903281Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:36c01936f3c44f2ad70e7b10b2f38ac2ee3949f5b1dc3703e2dee3a81b01c64a","observation_id":"06ce97ab-dcdd-4aa0-9a79-f9045c9869d8","resolution":{"observed_at":"2026-08-08T14:40:37.130065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.115519Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":"1659c858-3869-4c60-b5a6-cab595c0c7d6","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.906437Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:69a88b8aa228808e9f1e0643a7b715fb2e1be9662f7ccf491377a98ed46c7f60","observation_id":"ddd5ca04-ed60-4b7d-af4b-aef9152c1f26","resolution":{"observed_at":"2026-08-08T14:40:37.119494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:35.909681Z","title":"Scaling test-time compute with open models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.909681Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:9cb580b1b8416cfe25acba9ecc886f443803bc29ac042a2471d34afdb35e83d6","observation_id":"712a3c0b-25bf-45d1-b9cb-a3beea0be966","resolution":{"observed_at":"2026-08-08T14:40:35.909681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-08T14:40:35.912801Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.912801Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f1ffab27ef7e86974238f16218d6f034f9ae13669872bc46b46738e1d2ab5ea1","observation_id":"91d79cbd-262d-4ba7-9547-f5012acd2b88","resolution":{"observed_at":"2026-08-08T14:40:35.912801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.097300Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"53b8dca7-ea97-46c6-ad2f-f99b6fceda96","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.916332Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:0a9c507559a3b3e92f958eb1f33604a298ed226ec0effe86753163c3fa2f104f","observation_id":"37e25032-ec12-4d41-9dde-cba02e654965","resolution":{"observed_at":"2026-08-08T14:40:37.101228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.085740Z","title":null,"venue":null,"work_id":"d75adae7-73e2-4a05-87ab-ef28ba0475c1","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.919626Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:bb0401ce9279f7a32e74bc3cc7fea41c258acca8bb276f72c5e020c4217ca6d1","observation_id":"30793fe3-4fea-493f-b778-cf1d4dc31f23","resolution":{"observed_at":"2026-08-08T14:40:37.089675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-20T04:08:34.710482Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-08T14:40:35.922961Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.922961Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:d14adc1de34bc81e7b6ec35f0f3c59b46b546a55e41762aa7c1567db205aea4e","observation_id":"b3be7772-8dda-4476-b35e-0a398b107fd9","resolution":{"observed_at":"2026-08-08T14:40:35.922961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T14:40:35.926575Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.926575Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:0cdc23e020c5e30b35bc3010442becd72ddbe9bea0a359e866f3563bc4212bcd","observation_id":"45a1a20f-3ff6-4919-a5d1-d5ea3cf29412","resolution":{"observed_at":"2026-08-08T14:40:35.926575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:40:35.930952Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.930952Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:89b199c836d41e08f25fa226bdd2dd5db093387acb33319ce8f5d5ca6d73a3b5","observation_id":"a3b29857-2dab-48a0-bc8f-de5c5cfb570e","resolution":{"observed_at":"2026-08-08T14:40:35.930952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.074212Z","title":"PAL : Program-aided language models","venue":null,"work_id":"6473d7c9-f4d4-4067-b00a-36b28e3ef711","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.934485Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:e9b6a3b18cfbf39c7ad2e327b9f363542dd912a74181d7345c045c2b0a25ea9b","observation_id":"566da9e1-339e-4e73-b2ab-52de7e17902c","resolution":{"observed_at":"2026-08-08T14:40:37.078105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.062925Z","title":"To RA : A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":"6c722678-6c03-4f89-9acd-523c2871a564","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.937991Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:7f27fe7b167e9cb264384398fa1a30765aa12b15ecd49ee75d4d89e010242be3","observation_id":"d82bdf7d-f831-4cb8-b1ac-5e61b2fba3d5","resolution":{"observed_at":"2026-08-08T14:40:37.066886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-08T14:40:35.941372Z","title":"rStar-Math : Small llms can master math reasoning with self-evolved deep thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.941372Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:3dfe6d43c21e0ff1ab9a34c60563186da0029268d27a7201bb60d26f428cfce1","observation_id":"7e1abdd1-50fb-48bf-8a14-e2f02454c213","resolution":{"observed_at":"2026-08-08T14:40:35.941372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-08T14:40:35.944896Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.944896Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:68342c3ec346fb6c408412bb82a8af73f572fda471fb3e9c66d9a2d5a1fef068","observation_id":"5840cf9b-0d50-4fa1-9a3b-262f2902e37d","resolution":{"observed_at":"2026-08-08T14:40:35.944896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.051839Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"f3c91b7b-1ae9-4ac3-a267-4dc6199fea8e","year":2021},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.948498Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:6b63bf6a93b3138653441b9be370b0bc59a8bf6488883a1992f91d1ed223d1a5","observation_id":"ab3ca706-af8b-4e5c-9fd9-cf4d4b816374","resolution":{"observed_at":"2026-08-08T14:40:37.055719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-20T09:22:11.974261Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-08T14:40:35.951932Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.951932Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:29af82978a19b4f184240c52fe92f6cc3de6a61188f8945605fb7d2998f1a8a5","observation_id":"0bc30d98-3359-4a0b-a26f-831a39a02904","resolution":{"observed_at":"2026-08-08T14:40:35.951932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-21T00:33:19.968625Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-08T14:40:35.955396Z","title":"O1 replication journey--part 2: Surpassing o1-preview through simple distillation, big progress or bitter lesson? arXiv preprint arXiv:2411.16489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.955396Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:b04b1864baf33f7c1699247c1d1a4fceecafc2e10fa42175d2663439c5535adb","observation_id":"624dac24-83cc-4a27-be2e-2c9f3a305274","resolution":{"observed_at":"2026-08-08T14:40:35.955396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T14:40:35.959414Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.959414Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:7d5a660d9ae58622705a9e7aad4124d0ee281a38c0e80feadfca14708ecd4325","observation_id":"ce7b896e-a227-4b1f-922d-b56f2204c105","resolution":{"observed_at":"2026-08-08T14:40:35.959414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T14:40:35.963873Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.963873Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:86cf13d214fb3ce2b14ac503569dd02c1f90c285b0ec18f92f0008b399cfa9d1","observation_id":"57320b16-f3c1-4e58-b6cc-4950d0f23936","resolution":{"observed_at":"2026-08-08T14:40:35.963873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16265","last_updated":"2024-06-26T14:01:15Z","snapshot_observed_at":"2026-08-20T11:12:49.874724Z","submitted_at":"2024-05-25T15:07:33Z","title":"MindStar: Enhancing Math Reasoning in Pre-trained LLMs at Inference Time","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16265","snapshot_observed_at":"2026-08-08T14:40:35.967949Z","title":"MindStar : Enhancing math reasoning in pre-trained llms at inference time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.967949Z"},"links":{"cited_paper":"/paper/2405.16265","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:76c6e5436d34a522305e78d9540fdfc53154071768257041db792def7015e145","observation_id":"1acd9cc6-35c3-4e0a-af46-d6b722437adf","resolution":{"observed_at":"2026-08-08T14:40:35.967949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.040742Z","title":"ARGS : Alignment as reward-guided search","venue":null,"work_id":"4dacf3bf-6d2b-453c-ba9f-cdfe8977996e","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.971685Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:6a75507249884f775819644e5153423c193fb1d489a4df275b3c65ed7235f3ad","observation_id":"d4a654a2-13ab-401c-8f11-08bb223f5ebf","resolution":{"observed_at":"2026-08-08T14:40:37.044614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.029030Z","title":"k0-math, November 2024","venue":null,"work_id":"1b258c82-9552-4c27-b9ec-3baa69a4f71e","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.975103Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:ba9630e270fcdf95ef84975e97ef72695dad7d01434a5385ce91addfd9ceec57","observation_id":"0741e2ef-f8c8-4360-9f98-9db2a4ba181f","resolution":{"observed_at":"2026-08-08T14:40:37.033274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-08T14:40:35.978584Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.978584Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:57fe36c2abfa4c41aa91c238855120ddcaa7e3357bb032fe1a67648791442784","observation_id":"064fd4a5-66a7-4b43-b591-a837bb24d4f9","resolution":{"observed_at":"2026-08-08T14:40:35.978584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-08T14:40:35.982068Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.982068Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:5c06a3aa69aeb6090b59da2018ab868c7e5f54ccb30a8cc668814ee3e06ec707","observation_id":"af72ee27-cc45-4415-a83f-ff4808dc3417","resolution":{"observed_at":"2026-08-08T14:40:35.982068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:35.985577Z","title":"CoMAT : Chain of mathematically annotated thought improves mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.985577Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:57ed4d72e5177a698fd90de1c63da8216d9eab75346f716ff48ea8dd02d60765","observation_id":"7c47f1cf-0b92-47ba-8bef-8f498b9b7289","resolution":{"observed_at":"2026-08-08T14:40:35.985577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11287","last_updated":"2025-02-11T05:41:41Z","snapshot_observed_at":"2026-08-18T20:35:01.343706Z","submitted_at":"2024-10-15T05:10:34Z","title":"Process Reward Model with Q-Value Rankings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11287","snapshot_observed_at":"2026-08-08T14:40:35.988761Z","title":"Process reward model with q-value rankings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.988761Z"},"links":{"cited_paper":"/paper/2410.11287","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:1320019215ddc49699137ccae682ba141c3d5a7c2c71b9831f17702335f54349","observation_id":"8c3df4bf-21af-4c82-87ea-c8af838614f8","resolution":{"observed_at":"2026-08-08T14:40:35.988761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:35.991827Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.991827Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:3577b59cce8ac6be99f48decf27fba1f8b3b2a982d53ea3fe0195eca0fb4e3ca","observation_id":"0ce9f88a-7f18-41eb-84d3-b7974d12d9fe","resolution":{"observed_at":"2026-08-08T14:40:35.991827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:37.010590Z","title":"Autopsv: Automated process-supervised verifier","venue":null,"work_id":"27222b23-b4c3-4195-9c5a-b8d56a5f1f8e","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.994620Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:cbcb0b968d784913e504fb87fd2ea95117aae636cec6881800ac8ba77f8bf970","observation_id":"8a81314a-c661-4bb7-b89d-1de1b1eb2365","resolution":{"observed_at":"2026-08-08T14:40:37.014738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-08T14:40:35.997449Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:35.997449Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:6cc89de97a46f0bfcc999e6d8d30fe6e03a9b01e2790ffd7f4641d8c7128d026","observation_id":"b70475cd-8263-46b3-bae9-cc6442650a4e","resolution":{"observed_at":"2026-08-08T14:40:35.997449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-08T14:40:36.000646Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.000646Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:7a43de3b1e3db706aa837813b659cc214eef37fd112e0b34c016474f25451b9b","observation_id":"ad645c84-0867-4c71-a2c1-fb03097333fe","resolution":{"observed_at":"2026-08-08T14:40:36.000646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.998164Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"fceda15b-f7a8-4d94-80ae-d081483fc952","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.003933Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:2f1a320ea4525eff88d159dd7a879ee4aaac874ab86423bb0a21903938d897ad","observation_id":"5a638610-5dad-438b-982e-cef6dbf8a1db","resolution":{"observed_at":"2026-08-08T14:40:37.002315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02725","last_updated":"2024-10-03T17:47:29Z","snapshot_observed_at":"2026-08-19T21:14:58.741186Z","submitted_at":"2024-10-03T17:47:29Z","title":"Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02725","snapshot_observed_at":"2026-08-08T14:40:36.007327Z","title":"Adaptive inference-time compute: Llms can predict if they can do better, even mid-generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.007327Z"},"links":{"cited_paper":"/paper/2410.02725","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:327be9d5fb6408be88c68bd690cdb937271c849316c3e06dc0bf1c031c379e5a","observation_id":"28dbae4a-9763-4ab2-b62d-6bb555d23956","resolution":{"observed_at":"2026-08-08T14:40:36.007327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:40:36.010978Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.010978Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:837b382d2db720f190774e085fb87dbedd9ccc073c77ab3d32f728839b552d69","observation_id":"a4c24f4a-71ea-486c-8656-7176fd0f95f9","resolution":{"observed_at":"2026-08-08T14:40:36.010978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.014673Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.014673Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f11abd86172c344abbeca2f3b5f4ae6fa016bd221445e954dc801f708c491f8c","observation_id":"f2c56bb5-23de-4d70-8814-04cc66d0faa1","resolution":{"observed_at":"2026-08-08T14:40:36.014673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-08-17T14:27:29.437009Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-08T14:40:36.017882Z","title":"O1 replication journey: A strategic progress report--part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.017882Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:93b7cc3d0ea65235ce425cb832caedfeec10d7e02907d0f2a96962847564c4a5","observation_id":"25dd2f91-ba65-4050-8ee3-fe1df5e68c3c","resolution":{"observed_at":"2026-08-08T14:40:36.017882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.980818Z","title":"Recursive introspection: Teaching language model agents how to self-improve","venue":null,"work_id":"58e0bea8-3e5f-4c6e-9589-95e58dd25611","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.021431Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:313548dc0b0d270b62200f2171dfca162c2ef56c1f4288bdcc7c979d8a896f6e","observation_id":"c303f902-d6a2-4476-b52b-c8661b8c323e","resolution":{"observed_at":"2026-08-08T14:40:36.984757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.968595Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"7f4962b6-5dab-44f3-96d6-3d3dee38d6d7","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.024620Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:4a58be7acf43d31d373cf54a7e1a9467ff786977cfc00095becabf9c07bdc735","observation_id":"742df8c8-f473-4602-b00a-13436d3260fb","resolution":{"observed_at":"2026-08-08T14:40:36.972908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14532","last_updated":"2024-06-20T17:45:54Z","snapshot_observed_at":"2026-08-21T19:48:32.294469Z","submitted_at":"2024-06-20T17:45:54Z","title":"RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14532","snapshot_observed_at":"2026-08-08T14:40:36.027707Z","title":"Rl on incorrect synthetic data scales the efficiency of llm math reasoning by eight-fold","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.027707Z"},"links":{"cited_paper":"/paper/2406.14532","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:3ff5715f257239dfe22f9f43c8594d1d3ab08a08215924bd5f45945ebb61af47","observation_id":"2a82e362-277a-4120-910f-1cc2d62ec641","resolution":{"observed_at":"2026-08-08T14:40:36.027707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-08T14:40:36.031174Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.031174Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:30d0614bd3ba460d0d90d5c54f3b0fca4292ba431ca9c39f2af4a0e28cb2c14b","observation_id":"c4a86e0f-6e88-4f8c-86c4-3fd1c3c5815a","resolution":{"observed_at":"2026-08-08T14:40:36.031174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T14:40:36.034863Z","title":"DeepSeekMath : Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.034863Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:fa95ae0ee6b722eb172c7aefe9b3b30d2fc4eaca1e8ab7ed18a2173b73a7e25d","observation_id":"1916c2ad-1322-4db7-876a-fbef78dd2aee","resolution":{"observed_at":"2026-08-08T14:40:36.034863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-17T14:30:20.233099Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-08T14:40:36.038438Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.038438Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:3bb0f36085d86771812ea4e58b0a605c79198b472fdc599832a734acd2610d67","observation_id":"3dce8e4f-0f9d-4d11-a579-5c0aabe028d2","resolution":{"observed_at":"2026-08-08T14:40:36.038438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.957086Z","title":"Skywork-o1, November 2024","venue":null,"work_id":"dc3f8f13-b51d-410e-9298-365ef2840089","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.042118Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f13b178d556ff98542116ca6d29a9e2d232a92871bbd56918e3ec6acb01b26cd","observation_id":"23018d0f-dec7-41ab-a100-76ea8108a30e","resolution":{"observed_at":"2026-08-08T14:40:36.960840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.945849Z","title":"Skywork-o1 open series","venue":null,"work_id":"b4dc5685-db98-49ab-b097-53466a1ba989","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.045536Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:114d66d8230193e9821cfeccffdee705b7cc79a5e177281bd9e08f09d591a0c5","observation_id":"9dde4a2d-d7d3-45af-8c16-eb539b2c6a83","resolution":{"observed_at":"2026-08-08T14:40:36.949886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-08T14:40:36.048931Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.048931Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:fe5ae418a57d85491ce3af7cd459c8926f3394420621aa17432ae9ee1db9f223","observation_id":"4c3df50b-c127-466c-96e4-8db1aa666aa1","resolution":{"observed_at":"2026-08-08T14:40:36.048931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-20T01:42:56.063261Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-08T14:40:36.052680Z","title":"Prmbench: A fine-grained and challenging benchmark for process-level reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.052680Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:9819c41e6d25614754b7d8be01c9de91522c68fab603a9016b0726836abad67a","observation_id":"37177012-0210-4d98-88e6-f2e2220604b7","resolution":{"observed_at":"2026-08-08T14:40:36.052680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.056441Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.056441Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:ea082f85c9fc39afa5c28254b6c353d2efc61be7c961d581ed75ec66d40a5426","observation_id":"53b87581-3c4a-4909-b64a-c04607f3f0c2","resolution":{"observed_at":"2026-08-08T14:40:36.056441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.928576Z","title":"M ath S cale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":"554a047c-cfb6-4d3a-a662-46437dd83207","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.059886Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:d3815bda93d1d09283c45798e09e205b84fa8a7ee1598120d8d3523507bf5fcd","observation_id":"38f11997-da93-40d2-90d1-71f742bd1619","resolution":{"observed_at":"2026-08-08T14:40:36.932605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.917206Z","title":"DART -math: Difficulty-aware rejection tuning for mathematical problem-solving","venue":null,"work_id":"3a9520d2-af17-4f33-9439-d714e7db23e6","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.063273Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:aac18f55f45ec60776e306557145c1be0412eb2a1bcec88d11f7d9b1941fe6ce","observation_id":"e3d29d45-a60e-4d05-87e1-a8126d48b419","resolution":{"observed_at":"2026-08-08T14:40:36.921249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:40:36.066620Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.066620Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f1c7a60ad4cfef924b5cf5b9be5eebcb43a2aaa6023e6777b49fc4f83131ccd8","observation_id":"0789a4ea-4b89-427d-9fbe-7739eac0e165","resolution":{"observed_at":"2026-08-08T14:40:36.066620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.905928Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"ef626683-fbc6-43ae-b644-97df20e4082e","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.071452Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:353f871d5db1e400199b4e1486ef003e40ffa5232458770d7d07dcb5bd13102f","observation_id":"b26a9589-09f1-4d73-a331-db9acceeb84c","resolution":{"observed_at":"2026-08-08T14:40:36.909963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-08T14:40:36.074931Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.074931Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:2b275883c27f66ac42c722f1bb70aa0ff81e6772fa6bb4bb2cccc02a2ea006dc","observation_id":"daa40684-8410-4522-937b-42520a90b9e0","resolution":{"observed_at":"2026-08-08T14:40:36.074931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.894020Z","title":"A lpha Z ero-like tree-search can guide large language model decoding and training","venue":null,"work_id":"b0af7a1e-b011-412a-9062-38cc2cbe3ad0","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.078652Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:8dd75b8bfa8f438b956a6c5c52be66d4b4106e8365a07c67b620e891814533b5","observation_id":"8ff50eb6-6c28-4bf0-9a17-79734fe149c4","resolution":{"observed_at":"2026-08-08T14:40:36.898379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-16T13:09:59.425817Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-08T14:40:36.081619Z","title":"Openr: An open source framework for advanced reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.081619Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:7e22fbaffd39e1ff18fb0bfdfcc459137f5a9c6cbb03c44f26db6f0d047bb1fd","observation_id":"2fea5eae-ac56-4f25-a10a-7eb4351bbeac","resolution":{"observed_at":"2026-08-08T14:40:36.081619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.881661Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"4fd74097-f234-4ad8-9c54-b3062a6e0244","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.085554Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:85f8a73397180c4d2f79045baa24bab2f548f7a26abd3cb4e85394fdbf50a00b","observation_id":"774282b2-a9c4-4325-8fa5-87dd9a34556d","resolution":{"observed_at":"2026-08-08T14:40:36.885802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-14T19:57:03.409333Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-08T14:40:36.089127Z","title":"Scaling inference-time search with vision value model for improved visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.089127Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:7b5e1a8ae972fe5bf4472342a7d0ddd1d17717e3e6374a527e1b5c9b776eddec","observation_id":"d5603a6b-9393-46dd-8c6e-5c5d0a5c7a09","resolution":{"observed_at":"2026-08-08T14:40:36.089127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.869627Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":"9c6ad728-b446-4fe2-97e5-821f2ca03ebd","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.092625Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:8fe14196f55b229818b7ccb3614b51381340a43b2cf900b298909868d1f651a9","observation_id":"9624cf7a-6058-47e1-9e9c-3df7d3a45a81","resolution":{"observed_at":"2026-08-08T14:40:36.873687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.858266Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"d4214bb2-929d-415b-b411-02c163fcfd93","year":2022},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.095724Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:bb0d765010c07a8c17a6bf10e25699b59f7bc927f065db79ad938c629640cea0","observation_id":"055280d8-4604-453b-b2a2-8e3e5f71105f","resolution":{"observed_at":"2026-08-08T14:40:36.862420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.847193Z","title":"Large language models are better reasoners with self-verification","venue":null,"work_id":"fdbe3d3b-671e-447a-b8ee-86a2e7742e57","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.099470Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:27dd3f27f1f4bcbdd0d3483a8f93175bc002e8eeb174a846cf7a48a5dd96cdc6","observation_id":"118fdae9-c98e-4e55-9036-0c2d304eb8ae","resolution":{"observed_at":"2026-08-08T14:40:36.851289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-08T14:40:36.103088Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.103088Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:4291d4abc4ae61b0fa6f9cd04715935abdcdb4aa900f29c6f2f0194256081218","observation_id":"8e022e89-257e-4389-9a15-22aac81bde78","resolution":{"observed_at":"2026-08-08T14:40:36.103088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.835401Z","title":"Self-evaluation guided beam search for reasoning","venue":null,"work_id":"58c4fe4b-00cb-48f1-898d-56e0d34d5527","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.106511Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:ec3da583bc3b74cc98372d81d688667c2a3671143ff39c3f1c522f77df72a900","observation_id":"9fe2ff11-667c-4b94-8c94-fa569d2a000e","resolution":{"observed_at":"2026-08-08T14:40:36.839516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.109732Z","title":"An implementation of generative prm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.109732Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:a01bfc1f65091cc283b7c9758a351e54e2553afe73d19f4355c113d9200f5c3b","observation_id":"e42eec14-34b8-4c59-9232-6f56194215e5","resolution":{"observed_at":"2026-08-08T14:40:36.109732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T14:40:36.112622Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.112622Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:689ea18c7705e9b28292b8a8dd16fdf7ed634644f613aa17c497f9a85d5f8559","observation_id":"f7804413-2afd-4129-858b-7d5094ef3eeb","resolution":{"observed_at":"2026-08-08T14:40:36.112622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T14:40:36.115695Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.115695Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f22be923cc1b84cf2d4b14f0acbd3480c0a576f23b2d5a18132f170c7bee14da","observation_id":"eca76b55-733a-4676-ad93-7da8f5b93698","resolution":{"observed_at":"2026-08-08T14:40:36.115695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-08T14:40:36.118755Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.118755Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:b4de5e325c8f15e28e399d97484bfcede2c760a4c1aa9f0d54c714a9576996dc","observation_id":"bee1a504-814b-4a98-a9c1-003f89a534a6","resolution":{"observed_at":"2026-08-08T14:40:36.118755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.816744Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"9bec228f-43f7-408c-a880-4e830cc3e5b5","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.121948Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:4d06c3e9740266bc8f0800250deb361a390018b063ba2924cc1f880200791e6b","observation_id":"9af62b3a-bb44-4bfb-bd5e-d53ed81bd928","resolution":{"observed_at":"2026-08-08T14:40:36.821051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.805058Z","title":"MetaMath : Bootstrap your own mathematical questions for large language models","venue":null,"work_id":"e332b885-62ca-4fea-8aa9-991d258c36cc","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.125025Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:62b02b762c6f777184183f2c1032724bc634adae55491db20262900412aca8e2","observation_id":"8cf6ffe1-ee6e-4e76-a1ae-24dbc07fd35f","resolution":{"observed_at":"2026-08-08T14:40:36.809196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-18T19:37:22.484551Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-08T14:40:36.127934Z","title":"Free process rewards without process labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.127934Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:1b98a9813a60a4809a20222cb13f9faf967bb6695b2bfe48019ba9755877c646","observation_id":"b22cc61a-0819-4ca9-b55b-4430dfc7bc60","resolution":{"observed_at":"2026-08-08T14:40:36.127934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.793302Z","title":"STaR : Bootstrapping reasoning with reasoning","venue":null,"work_id":"2c540cb2-f933-4b79-bdf3-6c3a8c181f79","year":2022},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.131103Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:60023c039be98fdf6d50c1ba0537574a61bf078cbaebe43f9c863bcb5e62db5f","observation_id":"09937fb9-fcca-4823-b78e-9e8096432330","resolution":{"observed_at":"2026-08-08T14:40:36.797361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.781568Z","title":"Quiet- ST ar: Language models can teach themselves to think before speaking","venue":null,"work_id":"7b217320-840c-431b-aacd-aa409aee006a","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.133970Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:cda74a2810c0d2762911b8178ce7c7f47d813b464104e85b927028f2ddf9ed00","observation_id":"0976b0af-aa03-4cb9-92b9-b9d325a6ba1f","resolution":{"observed_at":"2026-08-08T14:40:36.785727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08348","last_updated":"2024-07-17T16:28:33Z","snapshot_observed_at":"2026-08-16T13:35:08.564005Z","submitted_at":"2024-07-11T09:56:51Z","title":"Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08348","snapshot_observed_at":"2026-08-08T14:40:36.136935Z","title":"Skywork-Math : Data scaling laws for mathematical reasoning in large language models--the story goes on","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.136935Z"},"links":{"cited_paper":"/paper/2407.08348","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f4e0d485021a42734332dbe6045d397a8a4d92b96f2281f98d2fb73cc460989e","observation_id":"36d41b5b-d316-4c83-b945-3fead7233752","resolution":{"observed_at":"2026-08-08T14:40:36.136935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.140097Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.140097Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:44c44d14b4a709c27bcb96296a4ffa8b2c0ebfe3e215907a52adb5c910235c3b","observation_id":"3dfb2880-ecef-4fdd-a85e-775e78307e49","resolution":{"observed_at":"2026-08-08T14:40:36.140097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.763183Z","title":"Re ST - MCTS *: LLM self-training via process reward guided tree search","venue":null,"work_id":"eaf224ad-daac-4564-8b42-06783a52454b","year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.143337Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:2fa140be308d45e84d1def7f5c6e282545732e81682376071d318b5a9fa4dfd4","observation_id":"b525bb1b-7f58-491e-b1e7-c250e11dfd5b","resolution":{"observed_at":"2026-08-08T14:40:36.767667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.146362Z","title":"Entropy-regularized process reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.146362Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f52ae7c8d291029a23043036c76c237ee178087adf94221ab9be52b74ee1161a","observation_id":"df41818f-15c1-457f-8453-228ca05e8ec2","resolution":{"observed_at":"2026-08-08T14:40:36.146362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-21T19:20:50.144406Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-08T14:40:36.149694Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.149694Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:06d750a7a3ddaffb24cf2a35588ec73985d93f8e4f543d1c34f09a024ea041dc","observation_id":"8985249a-65d0-45ed-9783-3e917694a695","resolution":{"observed_at":"2026-08-08T14:40:36.149694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14405","last_updated":"2024-11-25T17:57:55Z","snapshot_observed_at":"2026-08-18T11:40:03.096849Z","submitted_at":"2024-11-21T18:37:33Z","title":"Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14405","snapshot_observed_at":"2026-08-08T14:40:36.153233Z","title":"Marco-o1: Towards open reasoning models for open-ended solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.153233Z"},"links":{"cited_paper":"/paper/2411.14405","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:f4c18fb2f4aaed365b5d411ee4b3845bcfebdcabfbc3eead4bc6cbcabe4417ba","observation_id":"b308f711-f1d7-44e4-b73a-f08d37d36706","resolution":{"observed_at":"2026-08-08T14:40:36.153233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-08T14:40:36.156886Z","title":"Processbench: Identifying process errors in mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.156886Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:07f0e150a0b6471bac9fdb586e367f95f2cd1640bdc4fff03ef479a08e3e28fd","observation_id":"8732e1ea-9b23-4cf6-a522-b7934a693e48","resolution":{"observed_at":"2026-08-08T14:40:36.156886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:40:36.749783Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"dc16ae3f-405a-46b0-ad28-4fbe2376f327","year":2023},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.160535Z"},"links":{"citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:e4852fcc571149c700b9200c4cba3035774949ecf40bf5f4a04dc4d9e27a09d4","observation_id":"8bd7b484-084e-43ef-b060-f8173872cc84","resolution":{"observed_at":"2026-08-08T14:40:36.755459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T20:31:50.522103Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 58 inbound Pith citation observations for arXiv:2502.06703."}