{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61965c156b8236ece00900b6704b31dab1c482faed393856f2cb60b646ef1e87","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:40:42.903751Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:53:40.869843Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:17:15.138349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18149","snapshot_observed_at":"2026-08-06T17:53:40.869843Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:40.869843Z"},"links":{"cited_paper":"/paper/2505.18149","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:b10d47384bd7d522ec22617d40d8a6b8ff60261a1f09a64d3e8e288ab877b9d8","observation_id":"fe208371-4307-450f-ae9a-f534c222f62b","resolution":{"observed_at":"2026-08-06T17:53:40.869843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.18149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18149","snapshot_observed_at":"2026-07-02T17:17:15.138349Z","title":"arXiv preprint arXiv:2505.18149 , year=","venue":null,"work_id":"a89f6715-4468-4f3b-8c89-20bd7a70195c","year":null},"citing_paper":{"arxiv_id":"2606.06906","last_updated":"2026-06-05T04:49:37Z","snapshot_observed_at":"2026-08-02T10:42:01.638389Z","submitted_at":"2026-06-05T04:49:37Z","title":"EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T22:05:00.537690Z"},"links":{"cited_paper":"/paper/2505.18149","citing_paper":"/paper/2606.06906"},"observation_digest":"sha256:14f8d087b1471181c70b6b718a122e97ea6ed311c3cd4d88c2e2343e32754b9e","observation_id":"7b075402-bc0c-4bf8-9700-afa59a9af154","resolution":{"observed_at":"2026-07-02T17:17:15.139638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18149/citation-record","integrity":"/paper/2505.18149/integrity","json":"/paper/2505.18149/citation-record.json","paper":"/paper/2505.18149"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T14:40:39.958576Z","title":"Abdin, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:39.958576Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:647fa47c71c85651f15703b7820f922f1079c91050d43d49df0218b9fbe21224","observation_id":"ce71aa4e-0dad-4bbc-9b6d-c514e9926bbf","resolution":{"observed_at":"2026-08-07T14:40:39.958576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T14:40:39.995140Z","title":"Aggarwal and S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:39.995140Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:b725ccace749ebe0a6e4883b26dad3556f019b60154caf397e7c06261aac543b","observation_id":"f61a9703-8231-42c3-8f5b-40a9bcd5dedf","resolution":{"observed_at":"2026-08-07T14:40:39.995140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-05T07:13:53.183874Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-07T14:40:40.111091Z","title":"Bandyopadhyay, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.111091Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:014a771b2f33c2e23245b091533735fd36ca1a21a448e5ab111bac3339113637","observation_id":"e96f47e2-f43f-4f40-8102-ccc4f2222df1","resolution":{"observed_at":"2026-08-07T14:40:40.111091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T14:40:40.208024Z","title":"Brown, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.208024Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:833b5ba09208c6d3584150d74c87b05c61871abbe48aa8a75f6b5fd017eae202","observation_id":"9f62ca1a-5efa-4f2c-b642-eb3c7fba6a69","resolution":{"observed_at":"2026-08-07T14:40:40.208024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:40.297180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.297180Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:123694573079a735f9c2ef0d9912e06cb09b3f53f7a915d33af1686764e54001","observation_id":"497ae892-7eae-4ea4-a8f3-64b0ccdbb7ff","resolution":{"observed_at":"2026-08-07T14:40:40.297180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.475684Z","title":"Galambos","venue":null,"work_id":"cd1e4d37-1f42-4588-bd83-9ecb0071b82f","year":1977},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.390665Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:03d7ac6a2e558f7e649ca5fd1e7e2280aea0116c9c8e23f0d8363bec5f3fa7bf","observation_id":"ee5895d2-ec4b-4382-b62f-9901f05fa8c2","resolution":{"observed_at":"2026-08-07T14:40:44.548698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-06T11:34:00.528900Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T14:40:40.464981Z","title":"Gandhi, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.464981Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:67935c6fc2f240f0638ea5d7588792ba871f8920fcf9e752d9f4f899ff28ee31","observation_id":"098f2393-f22d-45e7-a763-0ae6dba4a78e","resolution":{"observed_at":"2026-08-07T14:40:40.464981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:40:40.583421Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.583421Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:006f6a2a6a2a24e768b5cd39384824ed461061f74aa3c0cdea6922f85c216bd7","observation_id":"b3655294-b413-4057-a4ce-ff9bb760fd73","resolution":{"observed_at":"2026-08-07T14:40:40.583421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.338844Z","title":null,"venue":null,"work_id":"fa0a9391-44d9-45bf-8af7-d14f666eea85","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.657963Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:bb31252b20d6337b36e94b68f6a976f55908fc434535c2bd4abefbb840572301","observation_id":"587aa42e-bd3f-49f0-bb65-5e8e184b92c6","resolution":{"observed_at":"2026-08-07T14:40:44.394401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16772","last_updated":"2024-06-26T15:00:04Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:31:12Z","title":"OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16772","snapshot_observed_at":"2026-08-07T14:40:40.764182Z","title":"Huang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.764182Z"},"links":{"cited_paper":"/paper/2406.16772","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:e77551b043af83144cb7ad5cb89b80cfaf531e91a8865276ecc8f408a7c437da","observation_id":"6891f0ac-5f4e-444b-8e7c-e08b7b453a40","resolution":{"observed_at":"2026-08-07T14:40:40.764182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09891","last_updated":"2025-01-17T00:41:44Z","snapshot_observed_at":"2026-07-06T20:22:14.764479Z","submitted_at":"2025-01-17T00:41:44Z","title":"Evolving Deeper LLM Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09891","snapshot_observed_at":"2026-08-07T14:40:40.871189Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.871189Z"},"links":{"cited_paper":"/paper/2501.09891","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a6866972a828d00c2812aba240a65b8195f54923ad681f19c09ffc2dec30877a","observation_id":"d20acd15-cff0-4775-bde4-9c56bb80c01b","resolution":{"observed_at":"2026-08-07T14:40:40.871189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16377","last_updated":"2024-12-07T22:50:41Z","snapshot_observed_at":"2026-08-05T11:33:45.483902Z","submitted_at":"2024-10-21T18:00:06Z","title":"A Simple Model of Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16377","snapshot_observed_at":"2026-08-07T14:40:40.957595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:40.957595Z"},"links":{"cited_paper":"/paper/2410.16377","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:668b3059f3c62689b3d90d57cfb09f41f0bda8b21e44cf2765f8f0a577a56990","observation_id":"641263f8-c8c2-4378-8ca2-b52cdcc7e3b1","resolution":{"observed_at":"2026-08-07T14:40:40.957595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-07-06T20:39:37.922156Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-07T14:40:41.058314Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.058314Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:cf88e3b1cec0e5caceda76a3ba288d9e21487c937f3d963f055e17a2f94bb8ff","observation_id":"1d51f9f6-71e7-4b35-8641-d17ab126bf7f","resolution":{"observed_at":"2026-08-07T14:40:41.058314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15771","last_updated":"2025-05-29T05:35:57Z","snapshot_observed_at":"2026-07-06T20:40:39.302105Z","submitted_at":"2025-02-16T11:05:27Z","title":"Learning to Reason from Feedback at Test-Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15771","snapshot_observed_at":"2026-08-07T14:40:41.165894Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.165894Z"},"links":{"cited_paper":"/paper/2502.15771","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:b84d4ba43529002053dde912bee194f4deeb0084c25a26f556bf0eac43ad3934","observation_id":"8affb4cb-92e0-4b06-b76c-5ca0b89c2d76","resolution":{"observed_at":"2026-08-07T14:40:41.165894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T14:40:41.276077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.276077Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:6ef1b3042c36ddaa679c47666818d3a4cbc7eacb31d96c3b5c6a35c26aad8b86","observation_id":"a97404e4-6e93-4568-9269-9c9949baf107","resolution":{"observed_at":"2026-08-07T14:40:41.276077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:40:41.381868Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.381868Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:211431897675153da4653f45b8a4059989eebd6283c39ad10454aff35e57a408","observation_id":"bdc76d2d-090b-4bd4-8120-59bd30323835","resolution":{"observed_at":"2026-08-07T14:40:41.381868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15028","last_updated":"2024-04-02T17:51:49Z","snapshot_observed_at":"2026-07-06T16:23:53.247204Z","submitted_at":"2023-09-26T15:57:57Z","title":"Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15028","snapshot_observed_at":"2026-08-07T14:40:41.468076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.468076Z"},"links":{"cited_paper":"/paper/2309.15028","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:01900561697f0674c0eaa6ee62ac4d1dc24bebfb66df150e615812f8dab8c3a8","observation_id":"58bc3bbb-01bc-402c-bb0b-67aa8298aa77","resolution":{"observed_at":"2026-08-07T14:40:41.468076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.190694Z","title":"Aime problems and solutions","venue":null,"work_id":"ce5455cd-1c1a-4050-9cb4-5f024f34ce3b","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.544855Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:cfaacc6c0e6be7fa4cd478b0ebe28620ada55f9d0bd66851b4150c6eec04e476","observation_id":"11de2ecb-a877-4491-bc81-8436d449d41f","resolution":{"observed_at":"2026-08-07T14:40:44.282250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:40:41.629981Z","title":"Muennighoff, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.629981Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:9afc4b0069a43ba8811e4375db8e7592306a4807929ae56af69a132e38513dea","observation_id":"2371bc63-b9c9-49ea-8395-18021ff9196f","resolution":{"observed_at":"2026-08-07T14:40:41.629981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:44.081884Z","title":"Learning to reason with llms","venue":null,"work_id":"3275abf0-38cb-4b5c-9872-96d78e634e0a","year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.696588Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:2ecc51bbc6b0df2edcba40f0740eb83479c7ffdaf4f901080d1fce30717b8fcd","observation_id":"7cdde967-89a1-4952-af17-1847709248f3","resolution":{"observed_at":"2026-08-07T14:40:44.139462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:41.789857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.789857Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:673416deb94b35e905707761f332911962b69a1330195984a4ce409d7ad5b18b","observation_id":"9469758e-8822-4cb0-b939-79f6c33f487d","resolution":{"observed_at":"2026-08-07T14:40:41.789857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19328","last_updated":"2025-02-26T17:19:12Z","snapshot_observed_at":"2026-07-06T20:43:08.913991Z","submitted_at":"2025-02-26T17:19:12Z","title":"Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19328","snapshot_observed_at":"2026-08-07T14:40:41.848273Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.848273Z"},"links":{"cited_paper":"/paper/2502.19328","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:897643c5452e4049868f1ceb6a6e9f6e99a9daed8de3f39fd53624188d166b4a","observation_id":"e8a2ba81-decd-4911-b96e-44adcf724f05","resolution":{"observed_at":"2026-08-07T14:40:41.848273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:41.916263Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.916263Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:c07236cc1b0d286dcd33f46b92be31a091f8785a93604b7cfd96b889468c4f22","observation_id":"7987d3da-ce64-422a-9779-f9d097f1d6a5","resolution":{"observed_at":"2026-08-07T14:40:41.916263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T14:40:41.981282Z","title":"Snell, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:41.981282Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:b6d9db92fee6ce3516c5c7282019561ec0c7c8907339925d6ad7401f3831f511","observation_id":"f9deeb4e-e44e-4dc1-b3b1-4aefd34e8f02","resolution":{"observed_at":"2026-08-07T14:40:41.981282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.983085Z","title":null,"venue":null,"work_id":"bd449e92-f417-4bf0-9130-636e9fa1d3f5","year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.091107Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a3e726aca6c828153cc0702926acf2476f9f4fc795a5b74a069c0db093809fd0","observation_id":"6ce7f65b-9d25-468b-b1fc-5e6a28aaf0e9","resolution":{"observed_at":"2026-08-07T14:40:44.024575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02424","last_updated":"2018-10-22T13:48:32Z","snapshot_observed_at":"2026-07-06T05:13:49.420787Z","submitted_at":"2016-10-07T20:56:47Z","title":"Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02424","snapshot_observed_at":"2026-08-07T14:40:42.164794Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.164794Z"},"links":{"cited_paper":"/paper/1610.02424","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:f9fef7e67f7ea8687765e4711873f49b44157f090378180ded26f8f95a88698e","observation_id":"03193b64-3997-472f-b58a-fb3fda932b77","resolution":{"observed_at":"2026-08-07T14:40:42.164794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12468","last_updated":"2026-05-27T05:13:38Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T02:55:48Z","title":"MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12468","snapshot_observed_at":"2026-08-07T14:40:42.231068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.231068Z"},"links":{"cited_paper":"/paper/2502.12468","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:4c11a24c94e4c8a6d2db5ca727ba1799143cf2a8a30b6ee23c48faf3629a50a7","observation_id":"b3feee3c-4cff-4bec-80d7-48957c93de28","resolution":{"observed_at":"2026-08-07T14:40:42.231068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-07-06T20:28:33.378335Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-07T14:40:42.304124Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.304124Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:c7fbc197ef5ed70abe77ed345400def2616563f0298efe5790cb860763c03c55","observation_id":"4fc7de80-569c-4865-9f02-3751b968a9cb","resolution":{"observed_at":"2026-08-07T14:40:42.304124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16838","last_updated":"2024-11-20T17:57:26Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:45:59Z","title":"From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16838","snapshot_observed_at":"2026-08-07T14:40:42.375970Z","title":"Welleck, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.375970Z"},"links":{"cited_paper":"/paper/2406.16838","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a4c8833458384f2b1653c2fa48f7d5ee9cc33db81d1cc04002f54c9114a8b19f","observation_id":"07e50bf0-a5c8-4ad7-ade3-bd0e2263271b","resolution":{"observed_at":"2026-08-07T14:40:42.375970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.911672Z","title":null,"venue":null,"work_id":"4ffe9c15-f721-4e1f-b033-da64b9926ce5","year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.439987Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:ab7405fe0bf5a105568e221d9d6c47c7662220bebb0d5db1aa8871ec5a8cee02","observation_id":"b7886825-e9f0-4228-9f38-d78df43c4302","resolution":{"observed_at":"2026-08-07T14:40:43.932992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T14:40:42.491053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.491053Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:a7141402540ec7761786bf7371fdc1aa4826754aeccc746d9a961d1816671e22","observation_id":"aab6bc26-c491-4c70-a393-298260d74354","resolution":{"observed_at":"2026-08-07T14:40:42.491053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:40:42.535646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.535646Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:ea6065e38567c8da0649e35bf083a8039b62aaf699deb27f45830cfc38b4be2c","observation_id":"67a2b27c-f669-4e92-82c5-747935fa7ec6","resolution":{"observed_at":"2026-08-07T14:40:42.535646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T14:40:42.616883Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.616883Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:fed0217c82c621e55ed60e5c2f3fe5f09f8422be4408fa9fcef61cb0aa794e1f","observation_id":"c2ef4477-229f-4c36-a4d9-fa1df9c27b32","resolution":{"observed_at":"2026-08-07T14:40:42.616883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04404","last_updated":"2025-02-06T08:52:43Z","snapshot_observed_at":"2026-08-05T03:12:32.063864Z","submitted_at":"2025-02-06T08:52:43Z","title":"Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04404","snapshot_observed_at":"2026-08-07T14:40:42.686239Z","title":"Yang, X.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.686239Z"},"links":{"cited_paper":"/paper/2502.04404","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:49c987117245da8fa8015d9f2c4c6b9d48497bdee1beaf34462600869b1c04fd","observation_id":"e2f61140-d94d-4675-ba74-4790077aeae0","resolution":{"observed_at":"2026-08-07T14:40:42.686239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-07T14:40:42.735954Z","title":"Zhang, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.735954Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:91e0c4e3b2290b91755ca14d86db78b41c5872afd28f9757bfe72cef07027da8","observation_id":"da283fa3-a8ac-4004-b05a-2ef47b81a6e6","resolution":{"observed_at":"2026-08-07T14:40:42.735954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05510","last_updated":"2023-03-09T18:59:47Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:59:47Z","title":"Planning with Large Language Models for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05510","snapshot_observed_at":"2026-08-07T14:40:42.814618Z","title":"relative lift","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.814618Z"},"links":{"cited_paper":"/paper/2303.05510","citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:279b486490037758e3d99698a5e0f1b4331c6b10df74572c0600ebae3d74a3f9","observation_id":"78f0f04c-8b72-4920-9d4d-bdc76f798214","resolution":{"observed_at":"2026-08-07T14:40:42.814618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4025.24025","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.351195Z","title":"So, 22 = 4 does not divide n4 + 1for any n","venue":null,"work_id":"2a2bbc7a-5a5f-45f6-84f6-2e23b18b71f6","year":null},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.869321Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:dbc5ad0248f3eeb84a9115d33b6859cac7ab9e5f2d11f14720e0c78da9c85099","observation_id":"6a0047ff-82ce-4a70-a95c-6fb8b39bc50b","resolution":{"observed_at":"2026-08-07T14:40:43.459387Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4846.20851","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:43.023153Z","title":"Find the least positive integermsuch thatm 4 + 1is divisible byp 2","venue":null,"work_id":"9c6fe70a-1d0c-438e-8d2f-80087c327a13","year":2023},"citing_paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models","version":1},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:42.903751Z"},"links":{"citing_paper":"/paper/2505.18149"},"observation_digest":"sha256:71c7df1d7d41340bff6ac9945712cc15b73c7640cba2461df484408b0124adec","observation_id":"963f95f2-006d-4d81-a5fd-c4291c12c796","resolution":{"observed_at":"2026-08-07T14:40:43.110325Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18149","last_updated":"2025-05-23T17:57:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:32:34.233639Z","submitted_at":"2025-05-23T17:57:43Z","title":"First Finish Search: Efficient Test-Time Scaling in Large Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.18149."}