{"as_of":"2026-08-09T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e2b1a1dc5f4f1eae2e1d5ede7c20ce4ecfb98c6b7e1169db71709d9812ec612","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:47:31.242429Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-14T22:34:15.638114Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2312.08935"},"observation_digest":"sha256:30f0ccecfefec7114e4469d3f88799dd1ba0e1ad0a0aea3d0b816bde7024e2b4","observation_id":"aea7076a-c96b-45b0-84c0-e62d2b2c97e4","resolution":{"observed_at":"2026-05-14T22:34:15.902550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T20:53:45.878221Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2406.06592"},"observation_digest":"sha256:5c7bde9e7955aa7209273689f12fa61f6fc038d27e735fffa393ad075ad20903","observation_id":"a9446a2e-c207-429b-a153-efdfed86db07","resolution":{"observed_at":"2026-05-13T20:53:45.903535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-09T11:47:31.242429Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-09T11:38:31.414567Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:31.242429Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2502.02584"},"observation_digest":"sha256:ab4dbb4b433d3bdee4e3cff11938c6ce925426633cdd91318ffc266d902adb9b","observation_id":"cfbc782a-e2b0-4875-8f83-4673f0a6e7f6","resolution":{"observed_at":"2026-08-09T11:47:31.242429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-08T14:25:53.332278Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06773","last_updated":"2025-02-10T18:52:04Z","snapshot_observed_at":"2026-08-08T22:57:17.515334Z","submitted_at":"2025-02-10T18:52:04Z","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:25:53.332278Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2502.06773"},"observation_digest":"sha256:fec3692da575786cb3e486ea49fc68f44c7c37100e94fef7d0d71f22920a5bf1","observation_id":"bdd185cc-189c-4585-a351-a8aeff4a8531","resolution":{"observed_at":"2026-08-08T14:25:53.332278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-09T11:20:31.753947Z","title":"M., Wen, Y., Zhang, W., and Wang, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06813","last_updated":"2025-02-04T22:08:20Z","snapshot_observed_at":"2026-08-09T12:19:32.223241Z","submitted_at":"2025-02-04T22:08:20Z","title":"Policy Guided Tree Search for Enhanced LLM Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:20:31.753947Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2502.06813"},"observation_digest":"sha256:ccc04f02253142d12d3c4b99b4336b9c129b9e59714795aca965869168a8a873","observation_id":"4ef57d7c-c201-481b-b7ab-80775d952152","resolution":{"observed_at":"2026-08-09T11:20:31.753947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-08T13:35:24.496163Z","title":"M., Wen, Y ., Zhang, W., and Wang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07191","last_updated":"2025-02-17T03:54:05Z","snapshot_observed_at":"2026-08-09T05:18:33.083500Z","submitted_at":"2025-02-11T02:31:11Z","title":"Bag of Tricks for Inference-time Computation of LLM Reasoning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:24.496163Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2502.07191"},"observation_digest":"sha256:c004068364a784e8ff9f30a87b1bcc062d672b9d3e4942b81ab6381cc548ba04","observation_id":"e92021b1-0c6e-4369-8774-ec43f7b0ccf9","resolution":{"observed_at":"2026-08-08T13:35:24.496163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:31:43.494099Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2503.06520"},"observation_digest":"sha256:c8825d19b91450c9840c843ed68a90835d35c4e225307924c03e978a03dce9a4","observation_id":"fb68f2ca-0621-4020-bd19-b463ba31ccd1","resolution":{"observed_at":"2026-05-16T12:31:43.547304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2504.12334","last_updated":"2026-05-10T17:20:39Z","snapshot_observed_at":"2026-07-30T01:17:05.243178Z","submitted_at":"2025-04-13T12:32:25Z","title":"QM-ToT: A Medical Tree of Thoughts Reasoning Framework for Quantized Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T19:44:16.630377Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2504.12334"},"observation_digest":"sha256:6d70b388578b4691935e93e678541aac6f22862600ceefcede40a4484909eaa3","observation_id":"fb995c4c-c156-4409-a4c3-748bfb0c287a","resolution":{"observed_at":"2026-05-22T19:45:04.025581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T14:23:07.912353Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19126","last_updated":"2025-05-25T12:47:39Z","snapshot_observed_at":"2026-08-09T11:06:54.014327Z","submitted_at":"2025-05-25T12:47:39Z","title":"MMATH: A Multilingual Benchmark for Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:07.912353Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.19126"},"observation_digest":"sha256:30a6b080cfc1c3f9b34fdc0a606f2d15de81635f486aeb72a1a68995779227a9","observation_id":"beb2dcd8-ce09-4a45-ac89-9df398fc6e18","resolution":{"observed_at":"2026-08-07T14:23:07.912353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T13:53:55.952185Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20643","last_updated":"2025-05-27T02:44:00Z","snapshot_observed_at":"2026-08-07T21:57:04.990865Z","submitted_at":"2025-05-27T02:44:00Z","title":"Can Past Experience Accelerate LLM Reasoning?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:55.952185Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.20643"},"observation_digest":"sha256:81a1aa149ba8418086365a2e4d2887bdb44c94175f4d25468f774883973e73fb","observation_id":"db427559-1d5c-4206-92ed-026d48eec8af","resolution":{"observed_at":"2026-08-07T13:53:55.952185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T12:32:21.438917Z","title":"Alphazero-like tree-search can guide large language model decoding and training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24273","last_updated":"2025-05-30T06:49:00Z","snapshot_observed_at":"2026-08-07T18:34:20.398845Z","submitted_at":"2025-05-30T06:49:00Z","title":"How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:21.438917Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2505.24273"},"observation_digest":"sha256:fee81e28b6bc37038bbd9c23c8905595d8b75326d3eb6c7882cfb6babd31d707","observation_id":"8769437d-e1a6-40e5-a546-f22ebb8d114b","resolution":{"observed_at":"2026-08-07T12:32:21.438917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T10:56:23.561140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03978","last_updated":"2025-06-09T04:15:05Z","snapshot_observed_at":"2026-08-08T01:31:04.404758Z","submitted_at":"2025-06-04T14:08:44Z","title":"Structured Pruning for Diverse Best-of-N Reasoning Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:23.561140Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.03978"},"observation_digest":"sha256:412ea4809d963c067e40941223bc12d01cfca48f9ec4d9caba88f699502af8e9","observation_id":"9ad7cede-ca98-4c61-8f14-ecbbdd2bc5ab","resolution":{"observed_at":"2026-08-07T10:56:23.561140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T10:30:34.180416Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05333","last_updated":"2025-06-20T01:25:25Z","snapshot_observed_at":"2026-08-07T10:18:59.977399Z","submitted_at":"2025-06-05T17:59:24Z","title":"Kinetics: Rethinking Test-Time Scaling Laws","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:30:34.180416Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.05333"},"observation_digest":"sha256:4af3a44ad62d99b640cd27dbb202c164a8a50cef1cade54ee94e5d51422a07f5","observation_id":"650cc220-635d-40a7-87eb-790fc13501dd","resolution":{"observed_at":"2026-08-07T10:30:34.180416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T05:09:18.616592Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:18.616592Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:5344e55be4c3307d1e05bccd6a966add876764986bca116000e504316d4ff8df","observation_id":"4234ff1d-a7b8-47fb-b9ec-4092ced0f56f","resolution":{"observed_at":"2026-08-07T05:09:18.616592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T04:38:09.465060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.465060Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:735735701fb6e739c1fa473520ddd1ec61b9609e9bc1c94979fada67253e0c3c","observation_id":"e67df85b-d344-4f51-8833-ae66fee42643","resolution":{"observed_at":"2026-08-07T04:38:09.465060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T01:08:20.750335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.750335Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:bd8140e026c5ffd6f8e577089cc459016194871a7e88dcb398c101666d0674dc","observation_id":"c54a79fa-7e5e-42a8-85a3-f7797b28d389","resolution":{"observed_at":"2026-08-07T01:08:20.750335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2506.19807","last_updated":"2026-04-16T16:50:02Z","snapshot_observed_at":"2026-07-06T21:47:01.972372Z","submitted_at":"2025-06-24T17:17:17Z","title":"KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T07:33:08.719028Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.19807"},"observation_digest":"sha256:7914c4f3949bb9f79dfa66a7e88aa5ebd15632c981c9551206b203d8ea82d32c","observation_id":"2c47a8aa-1244-4b5e-bdc4-7b2deac56277","resolution":{"observed_at":"2026-05-19T07:37:08.989689Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T22:30:14.714930Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21497","last_updated":"2025-06-26T17:26:17Z","snapshot_observed_at":"2026-08-09T04:48:54.629381Z","submitted_at":"2025-06-26T17:26:17Z","title":"Enhancing User Engagement in Socially-Driven Dialogue through Interactive LLM Alignments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:14.714930Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.21497"},"observation_digest":"sha256:54c5928436336395ce289cc5a334c4dbb641099738cb0b2200c942aadc6e2765","observation_id":"6b7d3b68-72f8-48e2-94ec-d7f9494fb526","resolution":{"observed_at":"2026-08-06T22:30:14.714930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T22:16:18.579086Z","title":"arXiv preprint arXiv:2309.17179 (2023) 33","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22075","last_updated":"2026-06-30T08:35:07Z","snapshot_observed_at":"2026-08-07T02:36:35.155158Z","submitted_at":"2025-06-27T10:03:05Z","title":"Reasoning in machine vision by learning fast and slow thinking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:18.579086Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.22075"},"observation_digest":"sha256:ef3c6d10bc305e3230a177763ef5dc8dcc5217ce6227408e537162f132aae204","observation_id":"5eeb45b6-3c6d-4900-93a7-03e4147598f1","resolution":{"observed_at":"2026-08-06T22:16:18.579086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T20:43:26.040552Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02173","last_updated":"2025-07-02T22:12:03Z","snapshot_observed_at":"2026-08-07T13:56:29.658636Z","submitted_at":"2025-07-02T22:12:03Z","title":"Data Diversification Methods In Alignment Enhance Math Performance In LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:26.040552Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.02173"},"observation_digest":"sha256:727c33afe0b66670348ee5a072beb21280fd7eef07f3677b18189a68d747626c","observation_id":"2a1f5f4c-bd4b-4007-af55-873c9248df71","resolution":{"observed_at":"2026-08-06T20:43:26.040552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T19:28:12.161024Z","title":"arXiv preprint arXiv:2309.17179","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2507.05557","last_updated":"2025-07-08T00:41:12Z","snapshot_observed_at":"2026-08-06T19:21:14.781528Z","submitted_at":"2025-07-08T00:41:12Z","title":"Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:28:12.161024Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.05557"},"observation_digest":"sha256:43d195110ed4319ea8f4cd9c51eccf86e1ca3a72a69c979d7cab596935e46ba2","observation_id":"e1d90dd1-c705-42d0-baef-f00aca515744","resolution":{"observed_at":"2026-08-06T19:28:12.161024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T17:47:40.209380Z","title":"Alphazero-like tree-search can guide large language model decoding and training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-07T11:12:53.489576Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.209380Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:922ab2f9a2d62b17ba9165e53d2127e3a80bde9f1ac95b7b3e81447b25b36a1f","observation_id":"60d6e2b2-8357-4380-9b77-2c4b9d9fc6b8","resolution":{"observed_at":"2026-08-06T17:47:40.209380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T16:09:04.281051Z","title":"Kanishk Gandhi, Denise Lee, Gabriel Grand, Muxin Liu, Winson Cheng, Archit Sharma, and Noah D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14419","last_updated":"2025-07-19T00:28:10Z","snapshot_observed_at":"2026-08-09T15:56:57.914495Z","submitted_at":"2025-07-19T00:28:10Z","title":"It's Not That Simple. An Analysis of Simple Test-Time Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:09:04.281051Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.14419"},"observation_digest":"sha256:e6b14ba0b74ba0fbeeed1fdd48483cdc6477159a3a20ae231c3f057502fed991","observation_id":"2a39a040-6db1-4621-9b31-ed1e1b145f3a","resolution":{"observed_at":"2026-08-06T16:09:04.281051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-06T15:28:42.237425Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15815","last_updated":"2025-07-21T17:21:14Z","snapshot_observed_at":"2026-08-07T09:07:30.265550Z","submitted_at":"2025-07-21T17:21:14Z","title":"LLM Economist: Large Population Models and Mechanism Design in Multi-Agent Generative Simulacra","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:28:42.237425Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2507.15815"},"observation_digest":"sha256:a4223fab284fa380fa22ec51bd40ed57041e1a0ee7bceb0d2cd335504176739e","observation_id":"6bacaa48-b2da-445a-9bf2-4aa70ba0a491","resolution":{"observed_at":"2026-08-06T15:28:42.237425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T22:09:46.343818Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07434","last_updated":"2025-08-10T17:11:56Z","snapshot_observed_at":"2026-08-07T02:35:17.826871Z","submitted_at":"2025-08-10T17:11:56Z","title":"Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:09:46.343818Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2508.07434"},"observation_digest":"sha256:0c6ff0d02702220dde485265656e7d117489699ee864369353105fb1569d2135","observation_id":"84845823-462d-4b71-adb7-056d11f47575","resolution":{"observed_at":"2026-08-05T22:09:46.343818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T11:57:16.716582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02129","last_updated":"2025-09-02T09:25:13Z","snapshot_observed_at":"2026-08-09T07:10:13.833406Z","submitted_at":"2025-09-02T09:25:13Z","title":"Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:57:16.716582Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2509.02129"},"observation_digest":"sha256:522037f8398de52efcd93beeaf1fb73eff8a7278681d6bb0cc1d21b9c977da37","observation_id":"14285457-87e1-4d05-a671-243df4b6e228","resolution":{"observed_at":"2026-08-05T11:57:16.716582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-04T18:53:02.654971Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-07T12:25:43.109797Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.654971Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:a8db8efbcd18188e3a00794f468815467eeb8b8a93985a385ca9eefce03a99cf","observation_id":"398b7170-af66-43e5-b8c6-f39c12d228aa","resolution":{"observed_at":"2026-08-04T18:53:02.654971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-04T12:52:26.719841Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01833","last_updated":"2026-05-25T18:23:42Z","snapshot_observed_at":"2026-08-04T12:52:24.589866Z","submitted_at":"2025-10-02T09:28:13Z","title":"Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:52:26.719841Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2510.01833"},"observation_digest":"sha256:46acd5d0a6c1fad6317262eff16dd2bdb01c0ca27e5a1831bc09e5e9686929b5","observation_id":"3f246477-bd08-4ba3-8922-04f6a7bc2519","resolution":{"observed_at":"2026-08-04T12:52:26.719841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2601.03559","last_updated":"2026-04-19T03:10:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-07T03:58:42Z","title":"DiffCoT: Diffusion-styled Chain-of-Thought Reasoning in LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T17:19:58.334098Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2601.03559"},"observation_digest":"sha256:4784514be6746e12ad7aaaa6bb9c5e69bd5d037c81ccf5aaacbd5976ff9f3c6a","observation_id":"028a9c3e-e00f-4664-bf40-d95bf6581261","resolution":{"observed_at":"2026-05-16T17:21:07.901256Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2601.11340","last_updated":"2026-04-15T07:21:40Z","snapshot_observed_at":"2026-08-02T05:43:35.759183Z","submitted_at":"2026-01-16T14:38:18Z","title":"Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:21:36.606855Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2601.11340"},"observation_digest":"sha256:4f7c3507c7ba271ec18ff39f3769b3992e3ee2d4678c14b46af1e02d52284a07","observation_id":"788d1018-d4fc-4a17-8e50-9b4dfe58040a","resolution":{"observed_at":"2026-05-16T13:22:55.276086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:aff34dbd393d3904d3e04528b6107cfe181db1e0e9296b18021f9b446c99b516","observation_id":"0754fcb6-bf24-483b-9a0b-0deb0bafddd8","resolution":{"observed_at":"2026-05-17T15:14:26.052180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-03T03:04:43.542090Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.542090Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:582fca25153097ea269e1321293d7f5ca6803f91b2cf0df1363f5625abd47754","observation_id":"a5728366-d70a-4ffb-9660-d96556437e88","resolution":{"observed_at":"2026-08-03T03:04:43.542090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2604.04379","last_updated":"2026-04-06T03:01:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T03:01:52Z","title":"Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:40:41.642852Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2604.04379"},"observation_digest":"sha256:b7c0b7641632b36a572f907e85502dbed742f33695731ef8abe01268b4fffcfd","observation_id":"2a2df38d-1ab1-4573-b6f5-5d192859296b","resolution":{"observed_at":"2026-05-10T22:35:52.722018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2604.05868","last_updated":"2026-04-07T13:28:09Z","snapshot_observed_at":"2026-08-02T07:08:59.060388Z","submitted_at":"2026-04-07T13:28:09Z","title":"Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:01.200412Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2604.05868"},"observation_digest":"sha256:c1902cee881068c371a9889313169f61e58585c2ba817448bba06b6e3e9a88af","observation_id":"761dd4d6-29a3-4eb1-8972-b07c89f37a19","resolution":{"observed_at":"2026-05-11T00:20:52.418936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:cb2d5a079806155a1908c571cdb773919d4af10ba3edcb55b7bdf9421ab6c453","observation_id":"66be9b4c-024e-473f-ae01-4a23529ff515","resolution":{"observed_at":"2026-05-11T12:26:05.589442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-02T10:20:40.458806Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:d83fe877594375ac44fe4b61ff29bb88a5822acb453d0515064748d805d13e75","observation_id":"93f3611e-068a-4ac9-b5a0-fb844a575fd3","resolution":{"observed_at":"2026-05-11T16:31:08.919771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.05216","last_updated":"2026-04-17T01:45:30Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-17T01:45:30Z","title":"SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T09:34:33.271537Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.05216"},"observation_digest":"sha256:38069ec0f0a57b99b2257c2fe6dbd8a79b3d1da8aea299a0eeb7f481c1045b07","observation_id":"64f389a3-ece9-4f54-8a47-654524236766","resolution":{"observed_at":"2026-05-10T09:38:42.293790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.05262","last_updated":"2026-05-06T06:17:48Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-05-06T06:17:48Z","title":"Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:00.499779Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.05262"},"observation_digest":"sha256:885ab17c64a59d7206b76f3ad7e9cd6128854cbda5095167a9109eedb95e588c","observation_id":"5210ee3d-d234-4f0a-a335-3a0f50e898ff","resolution":{"observed_at":"2026-05-11T17:46:06.956367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.08057","last_updated":"2026-05-08T17:44:15Z","snapshot_observed_at":"2026-07-31T05:49:37.295093Z","submitted_at":"2026-05-08T17:44:15Z","title":"CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T02:28:20.366674Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.08057"},"observation_digest":"sha256:9603927f12513ad379ca0fa2e790318c69b9984d5378fa129979baa7ca7a34b5","observation_id":"ff54ab4a-a1f1-47c5-8e7f-8ebbb47b3abf","resolution":{"observed_at":"2026-05-11T03:25:58.264821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.10172","last_updated":"2026-05-11T08:21:52Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T08:21:52Z","title":"V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:01.612516Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.10172"},"observation_digest":"sha256:8a084a1856ddbfc9b381c53618574e5a6685d453a88ea2524cd50bb7957c20a7","observation_id":"ada3a1b9-1026-41b1-9cad-17bf54fbcee6","resolution":{"observed_at":"2026-05-12T06:41:42.171923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:52.375703Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:2e94d0b7e8107b1fad6cda061ac3e17992bb965f492c9d349fbb0ba82da07b71","observation_id":"cb9cf998-12a0-426d-826e-0ab8d015ecb7","resolution":{"observed_at":"2026-05-12T06:51:30.023684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2605.10195","last_updated":"2026-05-14T07:42:56Z","snapshot_observed_at":"2026-08-03T09:42:12.047946Z","submitted_at":"2026-05-11T08:45:17Z","title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T05:11:32.053440Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2605.10195"},"observation_digest":"sha256:9b309be22f041b2ac938f23f96f98f23e3fe222e9aff693636a3eaeee1ff3fa6","observation_id":"4f34326e-528b-4d96-9ad3-1fc96a76fa5d","resolution":{"observed_at":"2026-05-15T05:15:03.262296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.03102","last_updated":"2026-06-02T03:42:04Z","snapshot_observed_at":"2026-08-03T04:21:57.609394Z","submitted_at":"2026-06-02T03:42:04Z","title":"Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T10:25:10.559953Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.03102"},"observation_digest":"sha256:8c23ca08fe1d480299612772432b24e16a203d0e95b5ac3a424778cda66957a4","observation_id":"4077066b-ce29-43c3-ad50-fc741a014a0d","resolution":{"observed_at":"2026-07-02T02:56:30.042468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.05464","last_updated":"2026-06-03T21:43:38Z","snapshot_observed_at":"2026-08-03T10:19:08.677126Z","submitted_at":"2026-06-03T21:43:38Z","title":"Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T05:46:26.938277Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.05464"},"observation_digest":"sha256:05a08012eb8d8b295e3a0da6d0b1d4ec48054a7348a1c404042b145aa45b26bd","observation_id":"9c889228-de92-44ce-852a-8375a79b6547","resolution":{"observed_at":"2026-07-02T08:46:48.956800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.08068","last_updated":"2026-07-08T15:21:39Z","snapshot_observed_at":"2026-07-12T14:47:31.355938Z","submitted_at":"2026-06-06T09:33:32Z","title":"DICE: Entropy-Regularized Equilibrium Selection for Stable Multi-Agent LLM Coordination","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T19:58:32.016341Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.08068"},"observation_digest":"sha256:535902fd3f8679f56392839a0cadb326fdee5aafb23f2b0709e5fe59893eba50","observation_id":"1cc95fe5-48ec-40d7-879e-988120a46c37","resolution":{"observed_at":"2026-07-02T20:57:23.900391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T13:55:35.363377Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.11119"},"observation_digest":"sha256:d489c8923709ed9d39a74caabdd2972de7e5a801bcbc3789d4716110e3fbca2a","observation_id":"3c60c9d5-bffe-4fc4-937f-e71ab1969215","resolution":{"observed_at":"2026-07-03T04:27:36.750084Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:a480743de85bd676063ad6bf7c6aebb967309cf9196c86338c51782ee5d29920","observation_id":"e84f6b6a-14d9-492c-acf4-7991eabb59ea","resolution":{"observed_at":"2026-07-03T09:37:49.320578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-03T02:12:26.571855Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:26.571855Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:c8ca91a85934bafe9de63315ef1c5b852720959b776102789d7d2f38a277c4bc","observation_id":"956695dc-6775-41b4-930a-08ea6cbae14b","resolution":{"observed_at":"2026-08-03T02:12:26.571855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2606.20599","last_updated":"2026-05-19T09:13:21Z","snapshot_observed_at":"2026-08-02T11:31:41.725373Z","submitted_at":"2026-05-19T09:13:21Z","title":"Beyond Fixed Budgets: Characterizing the Inelasticity and Limitations of Tree-of-Thought Reasoning Strategies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:48.512777Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2606.20599"},"observation_digest":"sha256:249e7bbf88d2345d433698949409d9bdefe8799cf3fa97c56c98cc8e3da462d4","observation_id":"26e4a92d-54d2-45ef-982a-7632f69be8e3","resolution":{"observed_at":"2026-06-30T18:44:59.784865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":"2309.17179","doi":"10.48550/arxiv.2309.17179","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":"arXiv (Cornell University)","work_id":"23ee3c7d-8b2b-419e-bc0b-2ca969d47457","year":2024},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:b5e1e7f05c33c598f5799f7f89c2483afb7c45a7d377633f434f810a0ea30d22","observation_id":"c83a8d58-2ff5-4cae-ac64-129a2da31a2c","resolution":{"observed_at":"2026-07-03T16:38:39.805075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.17179/citation-record","integrity":"/paper/2309.17179/integrity","json":"/paper/2309.17179/citation-record.json","paper":"/paper/2309.17179"},"outbound":[],"paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2309.17179."}