{"as_of":"2026-08-16T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fac3f2d293740e5d09a359640a873e68c9c58f2d0b9b472c695d928448edfe07","coverage":[{"denominator":283,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:49:04.602845Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04001/citation-record","integrity":"/paper/2608.04001/integrity","json":"/paper/2608.04001/citation-record.json","paper":"/paper/2608.04001"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-15T14:49:03.053337Z","title":"arXiv preprint arXiv:1904.09751 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.053337Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:f176f1be8b2525994bc883aa70d96d452eaef0c9478c96f6ece630b80ab292d1","observation_id":"716c193e-8f4e-4fe9-b004-ee536ac34a12","resolution":{"observed_at":"2026-08-15T14:49:03.053337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10577","last_updated":"2024-08-20T06:32:57Z","snapshot_observed_at":"2026-08-12T23:00:57.990450Z","submitted_at":"2024-08-20T06:32:57Z","title":"Optimizing Large Language Model Hyperparameters for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10577","snapshot_observed_at":"2026-08-15T14:49:03.064748Z","title":"arXiv preprint arXiv:2408.10577 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.064748Z"},"links":{"cited_paper":"/paper/2408.10577","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:088aaaa152b7b20e97787d288fd95acfc1f270206a4079a5897cbf43edece18f","observation_id":"574b94b4-bd18-42be-989f-9f0fdd92393f","resolution":{"observed_at":"2026-08-15T14:49:03.064748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.078009Z","title":"arXiv preprint arXiv:2407.01082 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.078009Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:4bbcca4172b860d13d410f60dca3b80631cff0553e5eb568826e9b6d89b28593","observation_id":"2ec0beb8-9236-414e-bf08-9e8fec269b03","resolution":{"observed_at":"2026-08-15T14:49:03.078009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13681","last_updated":"2025-06-19T04:41:52Z","snapshot_observed_at":"2026-08-15T00:07:47.800339Z","submitted_at":"2025-06-16T16:38:04Z","title":"Min-p, Max Exaggeration: A Critical Analysis of Min-p Sampling in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13681","snapshot_observed_at":"2026-08-15T14:49:03.090744Z","title":"arXiv preprint arXiv:2506.13681 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.090744Z"},"links":{"cited_paper":"/paper/2506.13681","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2444c086f479fe28b4390366a0a320664c9ff4237b7ce3d5903485a979a274c0","observation_id":"5211dacc-8084-4023-b3be-f4ce55c42205","resolution":{"observed_at":"2026-08-15T14:49:03.090744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06925","last_updated":"2024-10-08T07:46:47Z","snapshot_observed_at":"2026-08-13T04:22:05.711789Z","submitted_at":"2024-02-10T11:14:53Z","title":"A Thorough Examination of Decoding Methods in the Era of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06925","snapshot_observed_at":"2026-08-15T14:49:03.109318Z","title":"arXiv preprint arXiv:2402.06925 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.109318Z"},"links":{"cited_paper":"/paper/2402.06925","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:0ef31a6bf19c4610c101c33f30894ad461f29b11ba602ad0d05a530dd7474655","observation_id":"cfe11679-bd56-40d2-8b17-5901f17e2972","resolution":{"observed_at":"2026-08-15T14:49:03.109318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01693","last_updated":"2023-10-02T23:16:25Z","snapshot_observed_at":"2026-08-15T19:00:07.129698Z","submitted_at":"2023-10-02T23:16:25Z","title":"Closing the Curious Case of Neural Text Degeneration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01693","snapshot_observed_at":"2026-08-15T14:49:03.120745Z","title":"arXiv preprint arXiv:2310.01693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.120745Z"},"links":{"cited_paper":"/paper/2310.01693","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2e43c424748e52ea13707aff4df000b6841859c7799ed7b0677d2b0e68ee295c","observation_id":"c69370a4-72d4-494f-9e74-37073bd86801","resolution":{"observed_at":"2026-08-15T14:49:03.120745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-15T14:49:03.142677Z","title":"arXiv preprint arXiv:2407.21787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.142677Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:353ad5e24f3ee3a226aabef4adedf06da68b193043cb8cce58d76145ead0c490","observation_id":"deec60cd-dbb6-4a14-8959-22d97b844292","resolution":{"observed_at":"2026-08-15T14:49:03.142677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.161173Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.161173Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:5fc2454935cecc33f8533b8897f07088457376b2eff4bf98e026ddaa3776b926","observation_id":"1b8a3d81-e2c2-4880-a60d-ad3efc81c50f","resolution":{"observed_at":"2026-08-15T14:49:03.161173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.174835Z","title":"B leu: a Method for Automatic Evaluation of Machine Translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.174835Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:dd775ef156411b669016e31c9c00637e7240f0bff794fa8ca65eafb312ed6371","observation_id":"b887cf36-7211-4919-810c-389fa2787d5d","resolution":{"observed_at":"2026-08-15T14:49:03.174835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-12T14:26:33.940158Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-15T14:49:03.188195Z","title":"arXiv preprint arXiv:2009.10297 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.188195Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d57c512f9b9fc38b18f7e5c035b181608793f22dedb6f30f8db6a937e6d1bff4","observation_id":"3f1b430f-64f8-4a92-a944-e457a4588547","resolution":{"observed_at":"2026-08-15T14:49:03.188195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.205102Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.205102Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:b2ffb6bbf26eaae08b5a632f97fc0c43242622086dcd24eef1ade1663fd626a2","observation_id":"b723fd48-a3b5-4b29-9a75-ec7392e48ea7","resolution":{"observed_at":"2026-08-15T14:49:03.205102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T14:49:03.240825Z","title":"arXiv preprint arXiv:2203.11171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.240825Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:b727730a448517315ce3892fc5cc963372f1b2c207be81cacfa011403263e17e","observation_id":"e0020c01-3cba-4f4a-9b7c-296a91bfd21c","resolution":{"observed_at":"2026-08-15T14:49:03.240825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.253273Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.253273Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d079bd36891f8895aba5eca7f00a71dc58820a7e9c1ce1b11c5ddede1c2f61b6","observation_id":"3863b5a4-b9cc-40b4-abc3-35f5ece7cf82","resolution":{"observed_at":"2026-08-15T14:49:03.253273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T14:24:18.501413Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-15T14:49:03.265846Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.265846Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:20d24a58a71cb0f8ac65fde4cd785cfc9be9690408c051805f275384c8cfd6df","observation_id":"b0d85b71-c52f-4c4b-883f-78f86182d36f","resolution":{"observed_at":"2026-08-15T14:49:03.265846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-12T22:09:41.196978Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-15T14:49:03.276331Z","title":"arXiv preprint arXiv:2411.00640 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.276331Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:7a40a707d354369c2df0dfb5262a1070b67d3ede99f708bef36864b6c9d8bc88","observation_id":"b83f2adc-29e9-45d2-87ac-e8ed9c14eda2","resolution":{"observed_at":"2026-08-15T14:49:03.276331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21303","last_updated":"2025-04-30T04:24:50Z","snapshot_observed_at":"2026-08-07T15:58:11.175407Z","submitted_at":"2025-04-30T04:24:50Z","title":"Confidence in Large Language Model Evaluation: A Bayesian Approach to Limited-Sample Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21303","snapshot_observed_at":"2026-08-15T14:49:03.288313Z","title":"arXiv preprint arXiv:2504.21303 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.288313Z"},"links":{"cited_paper":"/paper/2504.21303","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:0aec01972db43067da6b365a8167c3c8bfe2f001c2befcfad2f7fc0d3e3be713","observation_id":"4fce2481-a609-4069-9706-5fbf63403382","resolution":{"observed_at":"2026-08-15T14:49:03.288313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.301220Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.301220Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:cbd4cdbda14be25cdc9820e2bf9f67a7d59df6f0cf5e01da6e389e837daf945b","observation_id":"d741da6b-030a-48f8-a57b-f465dc501039","resolution":{"observed_at":"2026-08-15T14:49:03.301220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.316125Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.316125Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:3027f6062dd08297cc13fb46439bed7de3911c5a16475b958561c779ac4de4d8","observation_id":"bcd421e1-7f19-4c41-a407-3ff5fa179cb6","resolution":{"observed_at":"2026-08-15T14:49:03.316125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.341311Z","title":"The Annals of Statistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.341311Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:89810dd384b405f4911f42f659864d67b65030191ec8e8f6e21e7602466bed56","observation_id":"535e6139-6e96-4916-b79b-def2626253b9","resolution":{"observed_at":"2026-08-15T14:49:03.341311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.353746Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.353746Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d0664512190e8a0426bb27bbb66467f2a2884b6a0fe0d97af93e7b3ac82dc4fe","observation_id":"6a62d4e9-d075-4824-93f2-a765cf32bd0a","resolution":{"observed_at":"2026-08-15T14:49:03.353746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18407","last_updated":"2025-05-29T20:59:03Z","snapshot_observed_at":"2026-08-15T12:38:59.936539Z","submitted_at":"2024-12-24T12:54:19Z","title":"A Statistical Framework for Ranking LLM-Based Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18407","snapshot_observed_at":"2026-08-15T14:49:03.364792Z","title":"arXiv preprint arXiv:2412.18407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.364792Z"},"links":{"cited_paper":"/paper/2412.18407","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:621a1e62b3ea51670df072d90655221ca4d8a30bb18d234f8727e02a9aeb7571","observation_id":"d044c412-1ca5-406c-b8dc-a71f4dfdd7ef","resolution":{"observed_at":"2026-08-15T14:49:03.364792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11452","last_updated":"2025-09-02T08:20:59Z","snapshot_observed_at":"2026-08-10T18:34:02.223413Z","submitted_at":"2025-08-15T13:00:07Z","title":"Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11452","snapshot_observed_at":"2026-08-15T14:49:03.377159Z","title":"arXiv preprint arXiv:2508.11452 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.377159Z"},"links":{"cited_paper":"/paper/2508.11452","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:adf0d8631d352bded20d374bcc061088088d92e42b1a54eef3874b1a14d0ad13","observation_id":"c035fa7d-3389-46df-8c86-5a2f9fbb9662","resolution":{"observed_at":"2026-08-15T14:49:03.377159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.398215Z","title":"2nd Workshop on Models of Human Feedback for AI Alignment , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.398215Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:a3469dc0b379126ea1697c59652e035a02c1ce4c6a8e366f117e0c31d92524cb","observation_id":"deb6767e-a044-4401-b2cf-9598a2fce834","resolution":{"observed_at":"2026-08-15T14:49:03.398215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.417664Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.417664Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:4cd5f9b9efb0969b4c86125795d3c325978b9e8aa3897c9dda51e93c1db6ba8d","observation_id":"be1aded2-6283-4387-927a-e5c1f6e35417","resolution":{"observed_at":"2026-08-15T14:49:03.417664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.426647Z","title":"Improving Reproducibility in Machine Learning Research (A Report from the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.426647Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:03d198fbf2499bd68c926e90b132cf42591bebb651a98bd35c42a81b7f69fe7f","observation_id":"aeb66974-4ffe-4bb5-818c-cc2bb35510fe","resolution":{"observed_at":"2026-08-15T14:49:03.426647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.448648Z","title":"Proceedings of Machine Learning and Systems , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.448648Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:588ebc13e54aaffef52acb7a25dd2d264f125e65a954cb1a9ffb830e69ae022d","observation_id":"ad7954dd-7d55-4389-ba08-db58a481ca6e","resolution":{"observed_at":"2026-08-15T14:49:03.448648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.468322Z","title":"Second Conference on Language Modeling , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.468322Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:f57544ec807604191b34ecd72195a47c2e52e6716f43ded42d2c0a6078d1a5c4","observation_id":"7b8f2e42-ac33-4335-86d9-61c10e30b6d9","resolution":{"observed_at":"2026-08-15T14:49:03.468322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.476117Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.476117Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:5f9351d627245697742d0889e1babc8f6abd4320eb28666bacbad1283c37a40c","observation_id":"fb471102-fd09-4971-ba7f-609d09589d2d","resolution":{"observed_at":"2026-08-15T14:49:03.476117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04823","last_updated":"2025-08-18T16:06:09Z","snapshot_observed_at":"2026-08-08T03:19:58.705742Z","submitted_at":"2025-04-07T08:22:45Z","title":"Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04823","snapshot_observed_at":"2026-08-15T14:49:03.483178Z","title":"arXiv preprint arXiv:2504.04823 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.483178Z"},"links":{"cited_paper":"/paper/2504.04823","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:e3445c0e5c072fd4c6d18b50621c2712b9f8b1d43faed65239b28620efb6b38e","observation_id":"21dfafae-aaf9-41de-9244-23aa91f4628d","resolution":{"observed_at":"2026-08-15T14:49:03.483178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.502063Z","title":", booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.502063Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2ab12f6d5fe9b6341f521bdc6aced20711a35ea8b782b9f7411b276e973d9c66","observation_id":"e4f141b8-ff04-4dae-b1bb-35acbed02698","resolution":{"observed_at":"2026-08-15T14:49:03.502063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.508897Z","title":"2025 , archivePrefix=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.508897Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:0ea5b399325519c0c23c0f594547a491e39a18a7d3fa0fbca8a1089f5301bad8","observation_id":"15c95db8-f6c4-45c2-aabe-cdeae021d0a0","resolution":{"observed_at":"2026-08-15T14:49:03.508897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.518460Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.518460Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:44a71b1c1a5e114ec8020264861b440750fdd488edeee5dbaa39b227cc004c4c","observation_id":"744ab445-8875-4d6c-af4f-b3b486e8406c","resolution":{"observed_at":"2026-08-15T14:49:03.518460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.530899Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.530899Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:714e8e0efc4e0956afd81c2db43f7a2923641f92860fbc6f043ba6d77827c080","observation_id":"febafdcc-4389-4721-8159-ec2b15fd27bc","resolution":{"observed_at":"2026-08-15T14:49:03.530899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.538941Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.538941Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:c8f5a7b0f24c6f0b1cf20deb36fa8d821ce772345d7021af7621160db8b3c27b","observation_id":"2da06781-b7d6-4afb-bed0-80fbdb395e4a","resolution":{"observed_at":"2026-08-15T14:49:03.538941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.557934Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.557934Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:61c6ab7fbb67a8ba34dc700bf447cc6e8eb4ab8f64f65f84cc6ddecda607d627","observation_id":"dfabeeec-4c98-4079-8907-19d85a39c81e","resolution":{"observed_at":"2026-08-15T14:49:03.557934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.571013Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.571013Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:5628ae462a779b23a0f3113f7720f4e3dfdc8b475c0384b4c4fea0322ce208da","observation_id":"859ed12d-2a8c-4e0f-95e8-38b563a9cc09","resolution":{"observed_at":"2026-08-15T14:49:03.571013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.583744Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.583744Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:9cc47549096b6bc62085c0f17120eb04de8f7820637132817f095ac80380d998","observation_id":"140c94f3-3238-4563-8827-73dfb990a5a2","resolution":{"observed_at":"2026-08-15T14:49:03.583744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.594268Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.594268Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:a7e224f0a12eddcac04c255df69b770b6ea43f266247e31c4f0aafa5aacd78f2","observation_id":"5e5f0879-9b08-4e83-8dca-8a90ad9890d3","resolution":{"observed_at":"2026-08-15T14:49:03.594268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T14:49:03.604718Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.604718Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:4e113680a8918f274ac60490e4ae634a32143ace2f07b07973eea00514589300","observation_id":"aafa9cc9-6c4f-4924-80b9-bbf6fd078530","resolution":{"observed_at":"2026-08-15T14:49:03.604718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.620654Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.620654Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d2260c1ac7b319b5d7715f4e8d79523acee762703ee28c9c696706b3857b6feb","observation_id":"4ae6fece-e2b3-4f0c-b451-ee0c051d3c09","resolution":{"observed_at":"2026-08-15T14:49:03.620654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-16T00:12:44.179679Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-15T14:49:03.637202Z","title":"arXiv preprint arXiv:2502.06453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.637202Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:173b0cf2d42d1236ebe8cdb912d8cdc2fbcd31435355eb1dfd260d529a0eb690","observation_id":"b91102af-3bb0-4ed8-8aa6-b13203c9c064","resolution":{"observed_at":"2026-08-15T14:49:03.637202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.650955Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.650955Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1a03a30a434d38fe71ac16c3a8b6c7b9c2d8e63ea4da0addc81ce0bd3ef259e1","observation_id":"465eeb61-4db3-405f-9654-1203bd1759fc","resolution":{"observed_at":"2026-08-15T14:49:03.650955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.10367","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:10.163386Z","title":"arXiv preprint arXiv:2602.10367 , year=","venue":null,"work_id":"e49f98ac-d6d6-47df-8eda-e5a8df3861ad","year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.665804Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1642611eb3f83f921d19355e4421b76300ee881c7b77442f32fe76389b54f86d","observation_id":"a43964eb-31bf-490f-94d5-0a9d68e2461d","resolution":{"observed_at":"2026-08-15T14:49:10.171236Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.677534Z","title":"Challenging","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.677534Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1be993f5db661c1863b6f7c1e95f03ce8cd2962f1c44e058980cde09b0cb5435","observation_id":"cf1eea6e-0a93-4652-a4a6-1969a1400f5e","resolution":{"observed_at":"2026-08-15T14:49:03.677534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T14:49:03.690322Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.690322Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:f55f0c9b87dd28d81aa8e59cdde79a633498374c70ba9cd62a4e6e96b78aa719","observation_id":"187f9a1b-360c-4700-9c77-76e077d89bc5","resolution":{"observed_at":"2026-08-15T14:49:03.690322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.705214Z","title":"2025 , archivePrefix=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.705214Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:df11acd8828ad37e053c1184242d2e757ec3abaa9c8d08a1f8e7bb7cdfb86cfb","observation_id":"7e4a299d-4bec-466d-ab03-e131870d2d61","resolution":{"observed_at":"2026-08-15T14:49:03.705214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.714669Z","title":"2026 , archivePrefix=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.714669Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2b6c3feffedf23ed9bfc51a314da3cde3a084370b43fc7e9a07f56346c5dfa96","observation_id":"b7df270b-d100-489a-8eec-9c32b809d689","resolution":{"observed_at":"2026-08-15T14:49:03.714669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.722278Z","title":"2026 , doi =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.722278Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1b2d37556d5ff95d6f976a89fd98d0bb5276c14ab3d9b5e764d8fce164ab1142","observation_id":"ca48349d-395d-4946-98d5-122b2d80fe5b","resolution":{"observed_at":"2026-08-15T14:49:03.722278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.748051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.748051Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:b8e4e9ea109883bb6d3f8a9d95f0840321317b45f56a83ead0efe84b0508632e","observation_id":"7b8a6c81-ce65-4b6e-a8b4-fddee27edba2","resolution":{"observed_at":"2026-08-15T14:49:03.748051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T14:49:03.759711Z","title":"arXiv preprint arXiv:2412.15115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.759711Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:651f8ccdde488674901d3c649e6c28562c543556f2f6f3ce7619a629381d51ef","observation_id":"31dc3ccd-c9b6-4ff9-ba90-214a4f4677ab","resolution":{"observed_at":"2026-08-15T14:49:03.759711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.772795Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.772795Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:552a4ad8835926a5fc51fd6e96e5fa6d554074bdbb01fb566bb90cd12a634ff5","observation_id":"8afa8fae-5397-41e3-b0b5-aac3e2051f8c","resolution":{"observed_at":"2026-08-15T14:49:03.772795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.789033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.789033Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:b36de5a89218979b6d8f99a0c915c51fd28aa8ce2fc3c6338f33975185e5aa83","observation_id":"bb3c1410-5ba5-4936-98cd-b4636762f556","resolution":{"observed_at":"2026-08-15T14:49:03.789033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.810806Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.810806Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:ed297e53d45b6c980eb266288729e11141f0c1999f6fc095fe13d76f6fa3fdc6","observation_id":"a6195a13-6e25-4577-b6c2-23e65d0920ae","resolution":{"observed_at":"2026-08-15T14:49:03.810806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-12T07:09:19.930689Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-15T14:49:03.822238Z","title":"arXiv preprint arXiv:2502.14382 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.822238Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:32765a125de9c0ef43aa5ac72aaa4375da79f9b22808214a781d84489d1a9f67","observation_id":"9897b4f5-f0cd-4f79-8b44-358fd6a9cffa","resolution":{"observed_at":"2026-08-15T14:49:03.822238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-08-08T19:18:06.171048Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-15T14:49:03.850897Z","title":"arXiv preprint arXiv:2305.11206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.850897Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2b3d5277621db0ccc9a85afc341f5988aabba31cbfaf83125852c0a791a7a281","observation_id":"9467578a-49db-46af-970a-74d3768ec7a7","resolution":{"observed_at":"2026-08-15T14:49:03.850897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-12T12:48:14.689935Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-15T14:49:03.884561Z","title":"arXiv preprint arXiv:2502.11886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.884561Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:ca2d19729194b09bc66cba495a4196fc5aba8befb5b96afd405379f2fbcc7d1a","observation_id":"a8024bfb-8703-4df7-be90-c56f4140dd78","resolution":{"observed_at":"2026-08-15T14:49:03.884561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.892518Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.892518Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d94592905fd0f6c13aabeacd5d4b8da69b876b48d95bcbe125ad4bb525714421","observation_id":"bf26976d-e44e-426b-a78b-5bcac61826df","resolution":{"observed_at":"2026-08-15T14:49:03.892518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.900136Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.900136Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:7bc3345c1bd390547a8d251198f7a934951317d513c142c24c8da45782733c17","observation_id":"2aeb59e9-da0e-4608-9a67-7518b7e2697b","resolution":{"observed_at":"2026-08-15T14:49:03.900136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:03.912354Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.912354Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:a83bfeb67153c4005d14c21118f03b462bdd0b9c7d4113b5e7f3a876b69179de","observation_id":"380d3236-b9ad-4d63-933f-42094778f7fd","resolution":{"observed_at":"2026-08-15T14:49:03.912354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10491","last_updated":"2024-01-22T17:16:37Z","snapshot_observed_at":"2026-08-14T02:25:46.836991Z","submitted_at":"2024-01-19T05:02:46Z","title":"Knowledge Fusion of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10491","snapshot_observed_at":"2026-08-15T14:49:03.926672Z","title":"arXiv preprint arXiv:2401.10491 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.926672Z"},"links":{"cited_paper":"/paper/2401.10491","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:5aed3bca454c32c15246bcb9e232f752f9e5f2ddf0bca8595b34fa69b2594925","observation_id":"e023607b-b724-4b2f-93c9-1862ccaa2d65","resolution":{"observed_at":"2026-08-15T14:49:03.926672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07990","last_updated":"2024-08-15T07:37:24Z","snapshot_observed_at":"2026-08-15T07:57:34.367254Z","submitted_at":"2024-08-15T07:37:24Z","title":"FuseChat: Knowledge Fusion of Chat Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07990","snapshot_observed_at":"2026-08-15T14:49:03.942405Z","title":"arXiv preprint arXiv:2408.07990 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.942405Z"},"links":{"cited_paper":"/paper/2408.07990","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:24259b8a124405c1fc6f87243d3ea4a5fba8f81f962fe1afc9b3034fe945ec13","observation_id":"332bdf63-fe15-4976-9ed2-77e40cc2b11d","resolution":{"observed_at":"2026-08-15T14:49:03.942405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04222","last_updated":"2025-03-06T09:03:36Z","snapshot_observed_at":"2026-08-07T17:25:27.710390Z","submitted_at":"2025-03-06T09:03:36Z","title":"FuseChat-3.0: Preference Optimization Meets Heterogeneous Model Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04222","snapshot_observed_at":"2026-08-15T14:49:03.966561Z","title":"arXiv preprint arXiv:2503.04222 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.966561Z"},"links":{"cited_paper":"/paper/2503.04222","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:41e0f9c0b1af4c5e500ceb635b342718ea90814683a4068beec7e853c5813e1d","observation_id":"a3bd99cc-ceeb-449e-981c-92e22641e042","resolution":{"observed_at":"2026-08-15T14:49:03.966561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-15T14:49:03.983309Z","title":"arXiv preprint arXiv:2503.10460 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:03.983309Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:aa2113c07b0b27ec38411157aa3d756251e66f9bfc8249d893f53a0d52ec11d5","observation_id":"1eafb797-f179-47da-97b1-418540031a12","resolution":{"observed_at":"2026-08-15T14:49:03.983309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04872","last_updated":"2026-04-29T08:59:56Z","snapshot_observed_at":"2026-07-06T20:48:09.386369Z","submitted_at":"2025-03-06T16:25:53Z","title":"TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04872","snapshot_observed_at":"2026-08-15T14:49:04.000351Z","title":"arXiv preprint arXiv:2503.04872 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.000351Z"},"links":{"cited_paper":"/paper/2503.04872","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:30ae963cf7babe6258bf70f59214c200cd6147ebe09f6b330ee6648de73b2351","observation_id":"df092afa-de0a-4486-af45-a42e10b4aa6a","resolution":{"observed_at":"2026-08-15T14:49:04.000351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.026475Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.026475Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:3e37455f409db62584e3a4cff7fe0f3a5eae42807fa4f4bc1bb358bdbdbbd891","observation_id":"809b3a86-bf6f-4c0f-9fce-ae93cedd94bc","resolution":{"observed_at":"2026-08-15T14:49:04.026475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.036564Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.036564Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:c0578d42adfdd4fd317c8f0380c82b76fc3a2c5c8c0905b3fb38bc038fb88732","observation_id":"478271a6-d874-498f-87f3-4be5a1de9795","resolution":{"observed_at":"2026-08-15T14:49:04.036564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.052419Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.052419Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:7cb08d0adfd529b8477f652baf42cfaa1e9dc0d17719dd3a114ca8ad95db1f5e","observation_id":"2ce0b4eb-d728-45e2-9ffb-879216c3baa0","resolution":{"observed_at":"2026-08-15T14:49:04.052419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.065643Z","title":"Optimal Aggregation of","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.065643Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:0d03397205807aef3f3f38de5dcfb37e83d5d950b86b5f54ac6e79e4de53bbef","observation_id":"fdfb8f6c-12eb-4cea-91eb-3be546c48d71","resolution":{"observed_at":"2026-08-15T14:49:04.065643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.073304Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.073304Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:ef07c1f0956db9a646c3e0dcfad8e0641a46904bf71d73722b3e4dbe8c196eb5","observation_id":"dacdbd11-2b29-464c-8d42-666e13e8adb3","resolution":{"observed_at":"2026-08-15T14:49:04.073304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.084816Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.084816Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:08a7b8c563763c6e333c0d0f61b6d450984a03e2e8be27c89cdeec7171bccf71","observation_id":"125c9ea7-6e1c-4a21-ae1f-7eb909cd7fd2","resolution":{"observed_at":"2026-08-15T14:49:04.084816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.100667Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.100667Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:6f249de5841a8917956aefc1e613081dfc573f15bbc77c31cb8f27bf053716da","observation_id":"77f8467b-9cc6-4d44-b7ca-fd51bec82f1e","resolution":{"observed_at":"2026-08-15T14:49:04.100667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.110984Z","title":"Proceedings of the 40th International Conference on Machine Learning (ICML) , series =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.110984Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:43960aa1f836fc80c8f85e2b295a2af42340ebc0f0c41ce31401ec2415deb938","observation_id":"71f7c46e-1a9b-40fe-906c-5556af1ea1ae","resolution":{"observed_at":"2026-08-15T14:49:04.110984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.136460Z","title":"Proceedings of the 42nd International Conference on Machine Learning (ICML) , series =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.136460Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:2c7bf59980b0ad28881941144048a9f6c890c2cf40871480bd5b99496990a8ce","observation_id":"5387bdf4-bcf9-4feb-a438-ad11c386f66b","resolution":{"observed_at":"2026-08-15T14:49:04.136460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03156","last_updated":"2025-05-06T04:03:11Z","snapshot_observed_at":"2026-08-15T23:55:59.132795Z","submitted_at":"2025-05-06T04:03:11Z","title":"Soft Best-of-n Sampling for Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03156","snapshot_observed_at":"2026-08-15T14:49:04.163654Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.163654Z"},"links":{"cited_paper":"/paper/2505.03156","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:090b568d2a8b9007c75d863ce9c4255f8d1c971a4122f17422e33119a59131ce","observation_id":"c56500bb-cc81-4324-9519-2830e00b443c","resolution":{"observed_at":"2026-08-15T14:49:04.163654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01387","last_updated":"2023-10-02T17:47:10Z","snapshot_observed_at":"2026-08-14T15:03:42.416676Z","submitted_at":"2023-10-02T17:47:10Z","title":"It's MBR All the Way Down: Modern Generation Techniques Through the Lens of Minimum Bayes Risk","version":1},"cited_work":{"arxiv_id":"2310.01387","doi":"10.48550/arxiv.2310.01387","metadata_source":"pith","pith_arxiv_id":"2310.01387","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"It's MBR All the Way Down: Modern Generation Techniques Through the Lens of Minimum Bayes Risk","venue":"cs.CL","work_id":"a1bb1d94-635d-46ee-a838-bce5c5117ef0","year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.177578Z"},"links":{"cited_paper":"/paper/2310.01387","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:e6cf2dfc08e1e6cb9e9f5ffba7eb556efe3cb1ab5bc72725115d225bf93f7d4f","observation_id":"92d5ee9e-8602-4389-b1ed-c0cb7aed0ca3","resolution":{"observed_at":"2026-08-15T14:49:09.925826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.188855Z","title":"Proceedings of the Human Language Technology Conference of the North American Chapter of the Association for Computational Linguistics (HLT-NAACL) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.188855Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1ab7b44893972c26fecd29e26344f7dcd344c21b4c0e460ead061cb519b6690c","observation_id":"c673f3cc-00dc-4e2c-9e02-904c41bb1739","resolution":{"observed_at":"2026-08-15T14:49:04.188855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.197812Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.197812Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:62504017042555518e6b905df70573dd36035e2b19acce00007cd01418830f6f","observation_id":"d436f7b9-b20f-4fee-9250-0b5715addc7e","resolution":{"observed_at":"2026-08-15T14:49:04.197812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02902","last_updated":"2025-02-25T19:43:29Z","snapshot_observed_at":"2026-08-12T22:31:18.885950Z","submitted_at":"2024-10-03T18:48:38Z","title":"Better Instruction-Following Through Minimum Bayes Risk","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02902","snapshot_observed_at":"2026-08-15T14:49:04.204164Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.204164Z"},"links":{"cited_paper":"/paper/2410.02902","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:a980bce764163f071f557920ed4471a30f4367ab4166d95c96b82fd952bd104c","observation_id":"01295ef8-cac2-4f6d-9a0f-264133eb254b","resolution":{"observed_at":"2026-08-15T14:49:04.204164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14919","last_updated":"2023-11-25T03:38:14Z","snapshot_observed_at":"2026-08-13T05:18:04.343446Z","submitted_at":"2023-11-25T03:38:14Z","title":"Faster Minimum Bayes Risk Decoding with Confidence-based Pruning","version":1},"cited_work":{"arxiv_id":"2311.14919","doi":"10.48550/arxiv.2311.14919","metadata_source":"pith","pith_arxiv_id":"2311.14919","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"Faster Minimum Bayes Risk Decoding with Confidence-based Pruning","venue":"cs.CL","work_id":"867a0b95-0228-4928-a8cb-adbc11b8235c","year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.212031Z"},"links":{"cited_paper":"/paper/2311.14919","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:6ed20240361d84d071ee2d268f0ce0d68c707ff29846dc167af8b6b39f2a07b4","observation_id":"07c3911c-76bf-493e-8842-6f83b1d2d69e","resolution":{"observed_at":"2026-08-15T14:49:09.780154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02749","last_updated":"2024-06-12T01:14:45Z","snapshot_observed_at":"2026-08-15T12:31:35.023863Z","submitted_at":"2024-01-05T11:02:08Z","title":"Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding","version":2},"cited_work":{"arxiv_id":"2401.02749","doi":"10.48550/arxiv.2401.02749","metadata_source":"pith","pith_arxiv_id":"2401.02749","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"Hyperparameter-Free Approach for Faster Minimum Bayes Risk Decoding","venue":"cs.AI","work_id":"4a1ea200-ed12-4a29-9d0c-ce960cda1afd","year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.223920Z"},"links":{"cited_paper":"/paper/2401.02749","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:6e456044a95e49424780fc37af8670ba9fb3b124a8aa32ac94cdbf3784b10be4","observation_id":"ef98f7cc-dce0-4a33-82d8-643987a11e78","resolution":{"observed_at":"2026-08-15T14:49:09.689468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.267671Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.267671Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:6f3b2112c123f27bcf58e80614f829bb0b03131639b9e8a358d6f47f7c1e604b","observation_id":"e659d0c6-c363-4598-b954-9181caf8ad6f","resolution":{"observed_at":"2026-08-15T14:49:04.267671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T14:49:04.283055Z","title":"2022 , eprint =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.283055Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:906d5efe6920c38ac1b456d88220f41669d6ca3cbd5fc77ebcef91944c338b94","observation_id":"6f644802-bea2-40f0-b29c-f90a475d5cf4","resolution":{"observed_at":"2026-08-15T14:49:04.283055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17311","last_updated":"2023-11-29T02:07:09Z","snapshot_observed_at":"2026-08-15T08:26:58.046768Z","submitted_at":"2023-11-29T02:07:09Z","title":"Universal Self-Consistency for Large Language Model Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17311","snapshot_observed_at":"2026-08-15T14:49:04.294789Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.294789Z"},"links":{"cited_paper":"/paper/2311.17311","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:7071a53b53d6aad779a3e7f75d3c672a65581426db4105b261bcb0ab3112d417","observation_id":"04540a5a-9b77-48e7-973a-0bae09f5332b","resolution":{"observed_at":"2026-08-15T14:49:04.294789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10772","last_updated":"2025-05-16T01:09:43Z","snapshot_observed_at":"2026-08-15T21:01:37.715898Z","submitted_at":"2025-05-16T01:09:43Z","title":"Ranked Voting based Self-Consistency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10772","snapshot_observed_at":"2026-08-15T14:49:04.410743Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.410743Z"},"links":{"cited_paper":"/paper/2505.10772","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:52a78613281f43b5902bfc97bb2077cd8b80a845cd322590a888aa83221d3c51","observation_id":"5203ef2c-225a-4bd0-83bd-a693844b4bb2","resolution":{"observed_at":"2026-08-15T14:49:04.410743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T14:49:04.448798Z","title":"2021 , eprint =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.448798Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:255c8ed026ede8163e2df35d3a87449c6c4a7f578e8f5bd05819f5c6770a0afe","observation_id":"4bf09981-9f9c-44a9-8920-c77510fc6931","resolution":{"observed_at":"2026-08-15T14:49:04.448798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-15T14:49:04.469228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.469228Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:07b1c88a30aa1b4e99d6c4c489a1bc094e8097d40c92709f6e6d961076359b3d","observation_id":"982ad22c-feed-4b18-939b-2f880fec4c88","resolution":{"observed_at":"2026-08-15T14:49:04.469228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-12T23:52:06.447877Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-15T14:49:04.482328Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.482328Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:89324e02e2fe22cc142d23194b6e4b5a29a4b9750d42cfe0473a822e16cc709c","observation_id":"61a36d49-167c-4402-8516-20f0e84765a4","resolution":{"observed_at":"2026-08-15T14:49:04.482328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06057","last_updated":"2025-03-04T14:33:50Z","snapshot_observed_at":"2026-08-12T23:26:38.161586Z","submitted_at":"2024-07-08T15:59:44Z","title":"Variational Best-of-N Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06057","snapshot_observed_at":"2026-08-15T14:49:04.493890Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.493890Z"},"links":{"cited_paper":"/paper/2407.06057","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:84cd8ff0feda85439522045b1d96bec43043c0ad81f268abc4f547f11f8ed419","observation_id":"18fdb6ed-7ca2-453d-a9a1-399b5c03c232","resolution":{"observed_at":"2026-08-15T14:49:04.493890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-15T14:49:04.507240Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.507240Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:1ec9eb46c6a0228f3798f1bcd4b87d2ba3aa9462e32170471e9d68ea5a786473","observation_id":"9c4f0e19-75d9-4289-b4e4-913bfb9ff9c3","resolution":{"observed_at":"2026-08-15T14:49:04.507240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.514114Z","title":"2024 , month = jul, publisher =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.514114Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:cc33f180dbf7712cb79c3f45b4d3fe08f00d210b4dd1ef3c2be6064c0f989b34","observation_id":"de297c5c-2d83-4dc2-a45f-fdb00483a7e6","resolution":{"observed_at":"2026-08-15T14:49:04.514114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.520452Z","title":"2024 , month = jun, publisher =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.520452Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:abbab1c80c9b9d51970f4330009733b43fe140a951ee096435e1bd5c4fa7c934","observation_id":"7b9ed27f-c2d5-49e1-886f-7968f8de9626","resolution":{"observed_at":"2026-08-15T14:49:04.520452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.528030Z","title":"Policy Guided Tree Search for Enhanced","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.528030Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:7fcabfe799a49ccf7044b1b2d3d0eaad6e62d05c6aa379b65c13d98a64e9a8f9","observation_id":"ea09fda9-5d18-4c4a-b8e4-1fff5b46108a","resolution":{"observed_at":"2026-08-15T14:49:04.528030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.536806Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.536806Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:ab9215cdfb31e05d6244323baa5cc114d892fabb4e29ab37e32b956748265180","observation_id":"88595a3f-38b0-42c4-85c3-636c7d31c86f","resolution":{"observed_at":"2026-08-15T14:49:04.536806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.03606","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:09.026181Z","title":"2026 , eprint =","venue":null,"work_id":"39b82e4b-0969-48a6-bd30-3b435b7d98b5","year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.543603Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:6f3e0894409ec2c207640a964b67927daec0f60c456d1e22d81df9f2ff8cb5a7","observation_id":"e987dfd2-6f6a-4940-8dec-f459990e9a28","resolution":{"observed_at":"2026-08-15T14:49:09.041995Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.550606Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.550606Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:0d086551864b4276a02c2f62beb23872f9793b9ceb6abb4e462facd45a665fba","observation_id":"6b0eb9fe-4132-4c92-9fd7-a1b39b19e39e","resolution":{"observed_at":"2026-08-15T14:49:04.550606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.558411Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.558411Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:c25a3c73b3190254d07056f50ee024780c57c9e0e509f88bffc8d53128e1ffa0","observation_id":"70cacda5-6998-49f4-ba8a-15bb4988c998","resolution":{"observed_at":"2026-08-15T14:49:04.558411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.567845Z","title":"DEFT: Decoding with Flash Tree-Attention for Efficient Tree-Structured","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.567845Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:dfe62bfb514d951ac11605e47ddcd121542c24ed03615e5e44879d62f1e61882","observation_id":"28e6f3fe-ca38-4975-81f4-a9f712a87b4a","resolution":{"observed_at":"2026-08-15T14:49:04.567845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.576930Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.576930Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d11b1aa38f86f09149cfb1ca3a61105f50dc72aacf67a1a74e415b590d89fe12","observation_id":"73740463-84e4-4c4b-9342-7730f1b5dce3","resolution":{"observed_at":"2026-08-15T14:49:04.576930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.587472Z","title":"Bandit Based","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.587472Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:e1582daa29fa5093e636bc8d59ccbfbad1da88ac342768217fc745bffd587591","observation_id":"021f8166-9156-4f2d-a5a3-4a5afde8ccc2","resolution":{"observed_at":"2026-08-15T14:49:04.587472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:49:04.602845Z","title":"and Powley, Edward and Whitehouse, Daniel and Lucas, Simon M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-15T14:49:04.602845Z"},"links":{"citing_paper":"/paper/2608.04001"},"observation_digest":"sha256:d9e48436936d6ff896b1a5e5d25d3573bfbff185efec68538cc58bdc1f06a797","observation_id":"a2bcafe9-21f7-4526-bda4-f0ce31176a44","resolution":{"observed_at":"2026-08-15T14:49:04.602845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04001","last_updated":"2026-08-04T17:57:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T18:58:42.964326Z","submitted_at":"2026-08-04T17:57:20Z","title":"Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":283},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 283 outbound references and 0 inbound Pith citation observations for arXiv:2608.04001."}