{"as_of":"2026-08-17T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7de0f1d871c28e20b566bcb41b9ccad997a3f7e7b0022c225a4be0474303dce","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:32:41.000897Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08665/citation-record","integrity":"/paper/2607.08665/integrity","json":"/paper/2607.08665/citation-record.json","paper":"/paper/2607.08665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Measuring and improving the energy efficiency of large language models inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:713ebcb7c64e48d90d2632e3b20fbf05c3520fe48a2436e0ca4533037c7e5ba5","observation_id":"576f57c0-9821-48f7-9182-1a6230794c0c","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Ma- chine learning (ML)-centric resource management in cloud computing: A review and future directions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:dd37437ab8ab5ce3960e7b7bcdc3d2ec9791f2cac0e704f35a80b1d13b6ce00a","observation_id":"7b4cf943-e29b-4372-a73a-361faee2469d","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Survey of different large language model architectures: Trends, benchmarks, and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:a86bad11b07ac2a202d5795eca77abcf9ed381f03e313f74342340d19b37c45c","observation_id":"eee247f3-449d-4aea-b3b2-a16db847b78a","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-08-16T16:38:21.205977Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12031","snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"RouterBench: A benchmark for multi-LLM routing system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"cited_paper":"/paper/2403.12031","citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:1bb6afce7ecb17c3ac75cf8d04d76d27c7fedceb757a54f0fed0f683e5d9c1fb","observation_id":"921fc337-0a3f-48fc-b0f1-7c47315d52e8","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"LLMRouterBench: A massive benchmark and unified framework for LLM routing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:53c9556d3582786516cb42f3f1e92444f2825d2444c2dd4c8e7a258b522e2f5d","observation_id":"e8eb072b-c19a-4218-abdf-cad0a96810ea","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"FrugalGPT: How to use large language models while reducing cost and improving performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:af1b0c67abe9b44848881f2868297d36615e7db6f2bba27220bf9d1509cbd0f7","observation_id":"807b6aa1-de10-4888-9b88-9d842a148a1e","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"RouteLLM: Learning to route LLMs from preference data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:fe4531635b5520d621ff287f4be719e029b8635e10af47669b38005992fff5da","observation_id":"a1d0569f-f4f0-4d59-ae18-5a323a0dd236","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03436","last_updated":"2026-07-07T05:35:41Z","snapshot_observed_at":"2026-08-13T02:54:32.190736Z","submitted_at":"2026-07-03T15:49:40Z","title":"How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03436","snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"How much of the routing gap is real? Decomposing the router-to-oracle gap into reproducible specialist advantage and single- draw label noise,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"cited_paper":"/paper/2607.03436","citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:462be001a7f31577679fd7a9f4dc1d41977b6c9da5bc20a5e48d94654c5bb468","observation_id":"70536be9-9386-4a3f-b144-6f56d5847066","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Enhancing LLM reasoning capabilities through brokered multi-expert reflection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:c8849ad888cdd9787c13d68424181231381dbdd7ae2db1bba68055fd31b0f922","observation_id":"aef4235d-5949-4466-9ed0-a708776dc4c6","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Classifier cascades and trees for minimizing feature evaluation cost,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:eb69179f8a18eead8f21b5fefcc5bac444895b45f28698db6885f5485d3112e0","observation_id":"a9e1a039-b477-4eef-881f-4c6f69cda090","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Classification with a reject option using a hinge loss,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:e730c5776fd31274ce38a6875b4ccc34d1c436a8bb3e65e812c257814c4deebc","observation_id":"67ccf748-9c97-4f2a-b0f8-d7e562aeb212","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Machine learning with a reject option: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:5efe8e17301a438d1cebdaf778f20cce0937987af97cfd6cde0d61a2944b7651","observation_id":"483ceade-1a1a-4805-a8d9-905c4de52069","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"QoS-aware web service rec- ommendation by collaborative filtering,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:befd919c71176c71114acf9265f10180505093f315516abc9049ca513646e090","observation_id":"f85aeb4b-d9ea-422f-817d-f25be22df0b6","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"On the impact of deep neural network calibration on adaptive edge offloading for image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:8ea404c376af54f94387aed6cb83deb7f9dba899267761e9fe6ae7476c33dcf3","observation_id":"8433d7b1-4ff8-48ab-8beb-cb53e0b05219","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Deep neural networks meet computation offloading in mobile edge networks: Applications, taxonomy, and open issues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:3509cc819e25f0a83b007c1ab9d3d6ebefc366d58fa3442de0bbf70316353d71","observation_id":"955714da-735f-40a5-b2dd-be7200ac859d","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Edge-AI: A systematic review on architectures, applications, and challenges,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:a917f7627754748e34fb168ff79993e0281a6821bafe280dd3abb2a4ca6f9715","observation_id":"ed124d94-19a9-4a78-9b39-c0b7915bc23f","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:fbc256cb955b10c4c426f555fe401af8471cdee0ed2bab9bba4cd40f30b672e1","observation_id":"66b65895-def7-4dcd-8bf9-fbf77435f3be","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:3bbd2c4caa0f5a24ff41d3950f247373fb82743841afebfe15ed2d1fdd61ce42","observation_id":"e7701a12-a62e-4a97-9832-3057cded2032","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Ensemble-based uncertainty quantification for reliable large language model classification in social data applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:53df29fe72176f98b588ba5bd8e7c366a6ee9950a0a1207d5c34fedb95b7fa4d","observation_id":"1e919b69-159d-42d3-bca3-4750e8b2c1af","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10657","last_updated":"2025-05-20T14:59:21Z","snapshot_observed_at":"2026-08-16T12:52:00.240537Z","submitted_at":"2025-03-08T04:07:07Z","title":"RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10657","snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"RouterEval: A comprehensive benchmark for routing LLMs to explore model-level scaling up in LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"cited_paper":"/paper/2503.10657","citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:05f3e3b12aa73e1398521ac08d89c30e878deab8280a8b98dab80fc2c9ba7b3a","observation_id":"11c8c7dd-b43e-4970-9362-f215dfb2c6e7","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Beyond the leaderboard: A survey of the science of evaluation, benchmarking, and methodologies for large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:43c0fe0686ebff47c685cd623ac14f3ccc0a20b9a0fa664530e9732291057bd4","observation_id":"0bbafed3-edad-46fb-b8a1-f6604e1f8d34","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"State of what art? A call for multi-prompt LLM eval- uation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:81719e7ea781fcd0c6cc3d8807a3cc37db1bd0f56a1975feb3d09de0f4101915","observation_id":"2a2a6509-aaa9-4b9d-b67a-69398fdaeabb","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Make large language models efficient: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:93b3a2250ac9c9ac3e5500ef47789444988cda877ab38d6237e3ab1f20ad11b1","observation_id":"ba11c932-e4f8-41ee-bdc0-a2167b52e9cf","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"BrownoutServe: SLO-aware inference serving under bursty workloads for MoE-based LLMs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:dce5b9abb965b162267abbaf7c994fde31621e87dce571073f2bc065f32cc1ca","observation_id":"86a4003f-2ff6-4d73-b246-0d3dd21d3327","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"iGniter: Interference-aware GPU resource provisioning for predictable DNN inference in the cloud,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:7268cba7a5df5d50b6a623e470dba963f24233745b86cb57ff35e058c13b6d3e","observation_id":"5a426239-8a7a-4a53-8c3a-1995a6bdfb66","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"Best arm identification in multi-armed bandits,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:ea8d04ed0e0e61d1cf912ed8f91cd1ab6877fabcf122344fb8fdd292660b707c","observation_id":"effe0497-df2f-4ab8-9e8f-20631ace38d0","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"On the complexity of best- arm identification in multi-armed bandit models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:beba9067ffb5e225a7bf3e3f288cef7520195febd0502d4a9554a2b2fe807859","observation_id":"9a8cadeb-b0e1-4799-90f8-f82d8747f15f","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:32:41.000897Z","title":"How can we know when language models know? On the calibration of language models for question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T06:32:41.000897Z"},"links":{"citing_paper":"/paper/2607.08665"},"observation_digest":"sha256:80819c212ab1c8728a5dbc4f0bdf4bff1d095cc58224f28c75d5618881f163d6","observation_id":"5086d72a-818b-4525-a4b0-f6b192f0030a","resolution":{"observed_at":"2026-07-13T06:32:41.000897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08665","last_updated":"2026-07-10T17:35:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T17:01:44.356729Z","submitted_at":"2026-07-09T16:34:15Z","title":"Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.08665."}