{"as_of":"2026-08-07T18:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9370b5bc79b41f468c631bc6ddb94e1374ad89e06db349c7cea8bc838d7d256","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:23:31.783609Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.26644/citation-record","integrity":"/paper/2604.26644/integrity","json":"/paper/2604.26644/citation-record.json","paper":"/paper/2604.26644"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:26.764939Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:26.764939Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:97915cac4a7598d8b6ad36a7a3dbd5b717077ff992940a5f4c71fa1921f21004","observation_id":"f805d029-2378-48ae-8d8b-d6b1b584069b","resolution":{"observed_at":"2026-08-04T05:23:26.764939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:26.810573Z","title":"Aggarwal, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:26.810573Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:6ee90034a0a8319172c7130b8d139cc65e7deaa6ef21a49b9dd9a682a9cb5c5a","observation_id":"90e31df3-c46f-4f61-83f1-2c6562244ffb","resolution":{"observed_at":"2026-08-04T05:23:26.810573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T05:23:26.895577Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:26.895577Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:f68a9c2c0925b60dcfc8581b61c35753ae8cee799487ee5b46d8d6a758154cd7","observation_id":"da5d13bb-29f7-4668-890c-dfb5969b887a","resolution":{"observed_at":"2026-08-04T05:23:26.895577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-07-06T20:05:46.205005Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-04T05:23:27.111986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.111986Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:5b57819d0119bb05008c91858ea92e605338464b888395444da52278653ac2c3","observation_id":"1e0a8e95-9b44-46b0-ba51-97c4f94be4b9","resolution":{"observed_at":"2026-08-04T05:23:27.111986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:27.231657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.231657Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:0798b865d388c80bc226c64681ea5893e74f8c979f89333f5785204095c88af1","observation_id":"666746f6-bcf0-41e1-a4b3-eba5718772d0","resolution":{"observed_at":"2026-08-04T05:23:27.231657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T05:23:27.327502Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.327502Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:013410a0214a827a1913838c5f46514067f44bfb90d8f7d1d8b37d239dbcea98","observation_id":"aae279a0-5cad-46c6-a9c6-af07b1672669","resolution":{"observed_at":"2026-08-04T05:23:27.327502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-04T05:23:27.377555Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.377555Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:58f0b21658eff3f758234dd8efcc3e22de66b409a1972525478cf573b4ca5d1d","observation_id":"88d2a5a3-22a9-4aae-9a6c-a997b63df74c","resolution":{"observed_at":"2026-08-04T05:23:27.377555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T05:23:27.437780Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.437780Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:215334ab8e2ef3b26ed46acd8cbe5027dd80d2e46e30c7358a559d1d886a2a83","observation_id":"1e784204-e6ba-4f85-bd1e-4a5ca03517c6","resolution":{"observed_at":"2026-08-04T05:23:27.437780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T05:23:27.513846Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.513846Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:8edb633b44209b9e18adb36616bba69149afffb4cfe3fe95045f2acbf2db73f2","observation_id":"78f5fb1a-27f7-4dbe-8966-50a62b3cadea","resolution":{"observed_at":"2026-08-04T05:23:27.513846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-04T05:23:27.573991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.573991Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:60d6acb65522c1b0fcfa42a05714d4a80ebd0dcc19444de3c1d9da54b91b25d0","observation_id":"e34eeb30-6d59-47c7-94fa-d283f71b2a39","resolution":{"observed_at":"2026-08-04T05:23:27.573991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10735","last_updated":"2025-02-08T11:45:10Z","snapshot_observed_at":"2026-08-05T19:26:15.177097Z","submitted_at":"2024-10-14T17:16:44Z","title":"Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10735","snapshot_observed_at":"2026-08-04T05:23:27.639868Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.639868Z"},"links":{"cited_paper":"/paper/2410.10735","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:bfc41363b6018cc111ef989e13951650d824e94730f31590c4508671a8ca7ed7","observation_id":"fde85248-94ef-460b-87f0-f20a029c2648","resolution":{"observed_at":"2026-08-04T05:23:27.639868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01707","last_updated":"2024-12-25T13:32:54Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T16:15:31Z","title":"Interpretable Contrastive Monte Carlo Tree Search Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01707","snapshot_observed_at":"2026-08-04T05:23:27.708803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.708803Z"},"links":{"cited_paper":"/paper/2410.01707","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:20c193266356e5d45ea22274d70baefdeb4c9ff07a844f7ab18554509ba94e93","observation_id":"5634f141-e48e-4f19-8749-cb413b77850c","resolution":{"observed_at":"2026-08-04T05:23:27.708803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:27.751766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.751766Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:fb0bca186e10dd0f0cd3190312cab0629ebaaceca2c2945378d17559da14b75a","observation_id":"e7fa0f2c-cddb-4482-be25-2b54d1a9aaeb","resolution":{"observed_at":"2026-08-04T05:23:27.751766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:27.835546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.835546Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:a57b95591a39c0f248a94cbf3e184aff49803868aa74dd0fedabc8681ebf0a1c","observation_id":"90fb37c8-e2cc-4445-9b12-9dcf615fd327","resolution":{"observed_at":"2026-08-04T05:23:27.835546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T05:23:27.891822Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.891822Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:457d96390af0009ff77a826e211afa31c3e478d31ae6b0ea069ee853e31f9bcc","observation_id":"976b9912-c705-495d-8253-9ab6c8a836e5","resolution":{"observed_at":"2026-08-04T05:23:27.891822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-07-06T20:16:44.607678Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-08-04T05:23:27.929904Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:27.929904Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:3cb6334888ec2edc81cb030f2e2b1ba64a1da8a0393cb5990de3f61465958a89","observation_id":"bc6296c1-e26e-4e32-8134-7a1e782a7075","resolution":{"observed_at":"2026-08-04T05:23:27.929904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:28.135291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.135291Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:6835bc0d401a5ca0b4ea2a6af8c3c1cc5d3e543d23a28f2625169a2072c51624","observation_id":"1db5d8d0-d942-421c-990d-8b2daa414b6e","resolution":{"observed_at":"2026-08-04T05:23:28.135291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-04T05:23:28.308558Z","title":"Kumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.308558Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:8a3e32dfdec5023bdcfae8ee302dad2e896ff989c73c3fb4734cf8b732485c37","observation_id":"33dfa80f-488d-4a8a-9a6c-025604f61140","resolution":{"observed_at":"2026-08-04T05:23:28.308558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02670","last_updated":"2025-03-04T14:41:05Z","snapshot_observed_at":"2026-08-07T17:30:16.122307Z","submitted_at":"2025-03-04T14:41:05Z","title":"Multidimensional Consistency Improves Reasoning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02670","snapshot_observed_at":"2026-08-04T05:23:28.386427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.386427Z"},"links":{"cited_paper":"/paper/2503.02670","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:6caa5890daca9d5913451eca17c496c52293231351267e8a6a58bd3eac515640","observation_id":"29985120-626a-42ec-8a4a-bf65b0c7b3fd","resolution":{"observed_at":"2026-08-04T05:23:28.386427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05120","last_updated":"2024-10-11T09:38:40Z","snapshot_observed_at":"2026-07-06T17:27:03.686119Z","submitted_at":"2024-02-03T05:55:24Z","title":"More Agents Is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05120","snapshot_observed_at":"2026-08-04T05:23:28.569411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.569411Z"},"links":{"cited_paper":"/paper/2402.05120","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:c10fdc5a5f74c764e0b56eb59395ca74e802b27d03bf20e2e6b58f033b76c804","observation_id":"b9d54c95-f54a-462d-bf78-0fe81682d780","resolution":{"observed_at":"2026-08-04T05:23:28.569411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12563","last_updated":"2024-05-13T11:01:17Z","snapshot_observed_at":"2026-08-06T01:13:51.234451Z","submitted_at":"2024-02-19T21:38:02Z","title":"Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12563","snapshot_observed_at":"2026-08-04T05:23:28.745950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.745950Z"},"links":{"cited_paper":"/paper/2402.12563","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:d5e5d079fc0fe9e77a5c40b282022468c38439da0815e2d8f7aa09a78024f125","observation_id":"b7b5b4b2-8dea-4d79-a785-d5310845ad02","resolution":{"observed_at":"2026-08-04T05:23:28.745950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12872","last_updated":"2024-04-19T13:17:07Z","snapshot_observed_at":"2026-07-06T18:02:40.943221Z","submitted_at":"2024-04-19T13:17:07Z","title":"LLM-R2: A Large Language Model Enhanced Rule-based Rewrite System for Boosting Query Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12872","snapshot_observed_at":"2026-08-04T05:23:28.848978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:28.848978Z"},"links":{"cited_paper":"/paper/2404.12872","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:1a9691b33070a58ab71e8379efb3a64388fbd55092361cbcf865299655b9770c","observation_id":"552c0ba5-a93e-42a9-a1c5-078cb99976c5","resolution":{"observed_at":"2026-08-04T05:23:28.848978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:29.021133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.021133Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:221828c44186655b740972a3e5726ba1f50a3b5ae0cd472a3d22c9e2310643b6","observation_id":"498ee16b-fae2-470c-aad4-ca911aa95537","resolution":{"observed_at":"2026-08-04T05:23:29.021133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01352","last_updated":"2026-03-02T20:56:17Z","snapshot_observed_at":"2026-08-04T07:18:25.941807Z","submitted_at":"2025-07-02T04:40:29Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01352","snapshot_observed_at":"2026-08-04T05:23:29.305909Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.305909Z"},"links":{"cited_paper":"/paper/2507.01352","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:715f6eff15e522b510fea94e122f04458f4a7095f5964cc2f5ac5d0a27aaf6cf","observation_id":"73613b89-e3c2-4a91-aff9-c33e2fb6e4d0","resolution":{"observed_at":"2026-08-04T05:23:29.305909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:29.442195Z","title":"Liu and B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.442195Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:a4dd2c8c0f90d02e7239d0d99f6fc94583fd1435f1af88cd4b2660377dffc0a9","observation_id":"19a1188d-72bd-438e-852c-1d531b0d76b9","resolution":{"observed_at":"2026-08-04T05:23:29.442195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:29.559919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.559919Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:f644f8d637d74f6e6ff4924ab363b1dc21051765c5766550f3daf438df96e7e9","observation_id":"e621bd03-88fc-4d78-a296-7ce61f21496a","resolution":{"observed_at":"2026-08-04T05:23:29.559919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-04T05:23:29.810558Z","title":"Shinn, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.810558Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:2cae19baf79b79462b0421c6d5865ceba4e5bc9b61040cbbff4e1dfbc827f15c","observation_id":"91795a5d-2400-4c49-99a0-a76e22604336","resolution":{"observed_at":"2026-08-04T05:23:29.810558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T05:23:29.657877Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.657877Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:7f45750117252b063b5589ca861afb1237cbd49c77459b2041f294b994e5f0fa","observation_id":"94b7e84f-379d-4d17-981d-feb53d92a7e4","resolution":{"observed_at":"2026-08-04T05:23:29.657877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17407","last_updated":"2025-08-01T10:09:29Z","snapshot_observed_at":"2026-08-07T17:52:23.456305Z","submitted_at":"2025-02-24T18:36:15Z","title":"Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17407","snapshot_observed_at":"2026-08-04T05:23:30.136177Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.136177Z"},"links":{"cited_paper":"/paper/2502.17407","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:63db1adcff813aeee2643281e0792206e18d4e707f047e28966378eef0f936b1","observation_id":"ba9a354d-9952-44ce-9ace-6a78dc91557b","resolution":{"observed_at":"2026-08-04T05:23:30.136177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:29.999683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.999683Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:110d0c381dcaac0741c48c42f024cfa2dd9ea713030d73065f4cb2c8aee0ca03","observation_id":"0c4dd503-ac97-4204-b539-38bb9cd70fa2","resolution":{"observed_at":"2026-08-04T05:23:29.999683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T05:23:30.485792Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.485792Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:48779af6717719825e61ce54bff10c5e597eb653c807cf1451004ef24a2986f1","observation_id":"e439f3e4-15ef-4716-99fb-5766f4ee137d","resolution":{"observed_at":"2026-08-04T05:23:30.485792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T05:23:30.303802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.303802Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:8668255502a1e16bfd01f24b2ea21c83ffe6618bfd9862cf95d1096195705fb7","observation_id":"bba0be31-49b7-41b4-8e44-45418bdbc0f0","resolution":{"observed_at":"2026-08-04T05:23:30.303802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:30.765239Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.765239Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:1ec8f5d3b4391cb8a79d034b98c364ff04dba75a1c567c53a6fa014bd84a85ed","observation_id":"08a0e28a-5e80-4fb4-b189-855ae9651d7f","resolution":{"observed_at":"2026-08-04T05:23:30.765239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06787","last_updated":"2026-04-08T07:56:28Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:56:28Z","title":"When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06787","snapshot_observed_at":"2026-08-04T05:23:30.648338Z","title":"Xiang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.648338Z"},"links":{"cited_paper":"/paper/2604.06787","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:472fec9ec48269e50e80586f8d66d01820596d8f35145855f623eec91930b293","observation_id":"9676a0e8-a397-488f-814f-6c4908c1aade","resolution":{"observed_at":"2026-08-04T05:23:30.648338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-04T05:23:31.096799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.096799Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:b5093d0be999ba40e2efbf3cf07f6f6868dbf922bc8a659256896c587d774847","observation_id":"a0e4508f-3d27-4f44-8174-f6ff5b4ca5ca","resolution":{"observed_at":"2026-08-04T05:23:31.096799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-04T05:23:30.922716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:30.922716Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:956e503afc728483d331e420f253bade759185181700a46dc42ce1e8c13e031f","observation_id":"e194b632-893f-4288-8fe4-2c89dedd91fe","resolution":{"observed_at":"2026-08-04T05:23:30.922716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-04T05:23:31.355740Z","title":"Zhang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.355740Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:3e42d9715ace20cd741709a8f40dce951a3ad8900ab7d1278196349a34f28701","observation_id":"0a5e149a-ff73-4cf9-84a2-813865ceed17","resolution":{"observed_at":"2026-08-04T05:23:31.355740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:31.212814Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.212814Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:8ee655dd08f4b9b7948ff8587e757f80fbb960fe2291efda28ab8c2f28d2d61e","observation_id":"d4d9d040-f050-4c25-a34c-ebbc04c3cf79","resolution":{"observed_at":"2026-08-04T05:23:31.212814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:31.494051Z","title":"Zhang, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.494051Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:b4bcf1cb29c682d315e0439318a0ab7f74251dde8c1186b8b7ec2227450553d0","observation_id":"9055a43b-864d-4e6b-acc9-7e3fd49a47a0","resolution":{"observed_at":"2026-08-04T05:23:31.494051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-03T03:32:58.169782Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-04T05:23:31.417314Z","title":"Zhang, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.417314Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:ecb0f69a027cf8794d62ec619a8c3951dbf7d8bf4f3d4f191c32aaddfcd25f8d","observation_id":"7c1b6035-7cef-45f8-ba83-0abc668be8af","resolution":{"observed_at":"2026-08-04T05:23:31.417314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12589","last_updated":"2025-02-18T06:54:32Z","snapshot_observed_at":"2026-08-07T18:10:02.419640Z","submitted_at":"2025-02-18T06:54:32Z","title":"RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12589","snapshot_observed_at":"2026-08-04T05:23:31.640888Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.640888Z"},"links":{"cited_paper":"/paper/2502.12589","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:1fa486505dfe57daed1b56285d859e61125b84e5092c9adac75d005aec198a86","observation_id":"e5dd7735-39c4-4611-9d85-b60880cab147","resolution":{"observed_at":"2026-08-04T05:23:31.640888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-02T10:07:31.047425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-04T05:23:31.540079Z","title":"Zhang, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.540079Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:c61385c6623e37a4ac6eb5e3163251ef813d2166b0cef95c350fc63b314126f5","observation_id":"456f76f0-19c1-4c20-8436-2b23c688c80b","resolution":{"observed_at":"2026-08-04T05:23:31.540079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11500","last_updated":"2024-04-17T15:53:49Z","snapshot_observed_at":"2026-07-06T18:01:40.563108Z","submitted_at":"2024-04-17T15:53:49Z","title":"Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11500","snapshot_observed_at":"2026-08-04T05:23:31.783609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.783609Z"},"links":{"cited_paper":"/paper/2404.11500","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:0e0cf9f504f956d9a2c69d7b70f5d1140c9955a3985adb3fd0c2f1ef38f451ad","observation_id":"4bd865c9-c29b-453d-a585-9df0b2b44207","resolution":{"observed_at":"2026-08-04T05:23:31.783609Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:23:31.693541Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:31.693541Z"},"links":{"citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:c6cdb04ee0002db0c26a52396fa509ed916623de3a4ba5a8db2a0f50ee9a0162","observation_id":"070cedae-d3d5-4167-8dfe-16d8129bf60d","resolution":{"observed_at":"2026-08-04T05:23:31.693541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08154","last_updated":"2024-05-24T14:11:21Z","snapshot_observed_at":"2026-07-06T16:47:21.000236Z","submitted_at":"2023-11-14T13:30:54Z","title":"Just Ask One More Time! Self-Agreement Improves Reasoning of Language Models in (Almost) All Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08154","snapshot_observed_at":"2026-08-04T05:23:29.129601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T05:23:29.129601Z"},"links":{"cited_paper":"/paper/2311.08154","citing_paper":"/paper/2604.26644"},"observation_digest":"sha256:ac86477e2126b7f88e3754226534442c0e43b9ca33dce547028b858101ba9bbc","observation_id":"2b37d8a1-df88-427c-928c-54bae1861fcc","resolution":{"observed_at":"2026-08-04T05:23:29.129601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.26644","last_updated":"2026-08-03T06:41:06Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T23:31:02.960392Z","submitted_at":"2026-04-29T13:11:39Z","title":"When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2604.26644."}