{"as_of":"2026-08-13T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec15c98590e25f996307a644587e696cd1cf1e1b97e3985a6bc106795b284988","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:41:01.859522Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07968/citation-record","integrity":"/paper/2608.07968/integrity","json":"/paper/2608.07968/citation-record.json","paper":"/paper/2608.07968"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-12T00:41:01.381687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.381687Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:01470562f3187d0c6b99397646a7a439a4ae6b042b9ad399bbc323aecd92548f","observation_id":"0891c03e-988f-42cd-a3ac-fd3906027c5c","resolution":{"observed_at":"2026-08-12T00:41:01.381687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08939","last_updated":"2024-05-28T04:32:09Z","snapshot_observed_at":"2026-08-11T03:52:08.558792Z","submitted_at":"2024-02-14T04:50:18Z","title":"Premise Order Matters in Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08939","snapshot_observed_at":"2026-08-12T00:41:01.393854Z","title":"Chi, Xuezhi Wang, and Denny Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.393854Z"},"links":{"cited_paper":"/paper/2402.08939","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e5891d9705fb9313fbf2938f1f2ac7b1baba72064f37bf7b8bde80608da06dd6","observation_id":"c36e2aa2-dddd-4b9f-8ad9-d3efbd6dba4a","resolution":{"observed_at":"2026-08-12T00:41:01.393854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.553533Z","title":null,"venue":null,"work_id":"c9b29514-6398-49c1-9766-c09ea87e6783","year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.399787Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:33a112d8cbdb13f5ad8518fac0436bb59bfb9992b5ef6af1377fb0a6ee712ac9","observation_id":"a83981d8-74c8-47f8-a28f-2c9ac2de0c19","resolution":{"observed_at":"2026-08-12T00:41:03.558711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.405041Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.405041Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:182bcfd2a225ddc2722c9ed266071f7dea372379f73e20f142eb5f98cfda778e","observation_id":"fe0929f2-58b3-4975-ad88-f4d9660e598b","resolution":{"observed_at":"2026-08-12T00:41:01.405041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-10T20:21:46.372781Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-12T00:41:01.411594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.411594Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:702341d5bcf08b68b1f1c7a3f7a2c907109ac2d5fa173417299e6977bdfa7a68","observation_id":"24e1e360-8a89-4ce2-8d9d-af3e6c2c3996","resolution":{"observed_at":"2026-08-12T00:41:01.411594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-12T00:41:01.418167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.418167Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:403857b4a8ee94ee61742454d08e06cc75d5df641ac8b65a7e22cb1256569c4e","observation_id":"c57a66f6-4f08-4414-8a31-2b777c9bb3e9","resolution":{"observed_at":"2026-08-12T00:41:01.418167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.424280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.424280Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:eb758cd6837f96c59d072141103bc1156414a594332ffa6c4c0c03953539e59d","observation_id":"d1e7f929-a5dc-4b72-8170-ebab30d6c697","resolution":{"observed_at":"2026-08-12T00:41:01.424280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.430149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.430149Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ed30b003b3737102c1f99d1db484dc1ad7692c6b4ed12c946066b2225af999eb","observation_id":"9e47091e-8d91-4802-81ab-6b8ddc677b58","resolution":{"observed_at":"2026-08-12T00:41:01.430149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.527060Z","title":"Kellerer, U","venue":null,"work_id":"e7bd918b-bfa7-4aa7-acad-80a8753059f0","year":2004},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.451863Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0832f2fa189ab874d7d77331155b7abdae3ba720073f1c53a9f384fd12424e99","observation_id":"c6d51948-8216-4452-8b06-68d01df07c02","resolution":{"observed_at":"2026-08-12T00:41:03.532325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.510846Z","title":null,"venue":null,"work_id":"8cacd773-77a5-4494-8f85-0ff98eb9b142","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.457101Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:3de25f551917e9bed15a167fbca68f50a7f97ef7477540a00f8b4a9bbe405201","observation_id":"3c6dd6a1-36d0-49b6-8aeb-ab5015f5a77e","resolution":{"observed_at":"2026-08-12T00:41:03.516312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13752","last_updated":"2025-06-16T17:57:05Z","snapshot_observed_at":"2026-08-09T05:35:21.916120Z","submitted_at":"2025-06-16T17:57:05Z","title":"Steering LLM Thinking with Budget Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13752","snapshot_observed_at":"2026-08-12T00:41:01.462106Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.462106Z"},"links":{"cited_paper":"/paper/2506.13752","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:55da65e3140e336c1c8b837186a5fe7264ef565fbc6dacdf0f93cf1f7e66f4f4","observation_id":"1e79231b-cca8-42a1-9d4b-4dee816e09aa","resolution":{"observed_at":"2026-08-12T00:41:01.462106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.493521Z","title":null,"venue":null,"work_id":"d1adc33f-bb71-4216-acc4-bb024bbaae32","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.467400Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:616cf63ab1633ce9df058e3274ebe0fc0ccb534f0dbe1d7da12e8213bb873092","observation_id":"0e57ea4b-313a-4452-a4e9-161eb44a12a2","resolution":{"observed_at":"2026-08-12T00:41:03.498825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.486912Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.486912Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:6f58bf9b3ada184d64380e0a58466a949b3ce1a7d411995aed182b0f0b5f818e","observation_id":"f008bbcc-ddb5-42f5-b4c6-d5d72b81d7c3","resolution":{"observed_at":"2026-08-12T00:41:01.486912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-12T00:41:01.491586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.491586Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:adeca1f670bd66432ea6cdf6564ddc666affb9c3e942029f8351a43053c7c0f6","observation_id":"82ece181-3732-4ea9-8ecb-a90cab3e0bf5","resolution":{"observed_at":"2026-08-12T00:41:01.491586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.496684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.496684Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4dae21878f66ddb57c4b11b0e939f870f585042ee6bcc0a295d8511b1ae9e489","observation_id":"dfc92b89-b4be-47bb-a969-985b81d8c48f","resolution":{"observed_at":"2026-08-12T00:41:01.496684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13414","last_updated":"2026-05-13T12:10:05Z","snapshot_observed_at":"2026-08-12T12:38:55.266424Z","submitted_at":"2026-05-13T12:10:05Z","title":"TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13414","snapshot_observed_at":"2026-08-12T00:41:01.501928Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.501928Z"},"links":{"cited_paper":"/paper/2605.13414","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f68ae3836d10ab2f849421358c03917ceb60173730eddead831f0992d20c6ca8","observation_id":"4097c561-8b8b-4b14-9927-e606ce78acc5","resolution":{"observed_at":"2026-08-12T00:41:01.501928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.465098Z","title":null,"venue":null,"work_id":"cfc33bd0-1d91-4a7d-8e01-fb03450bb121","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.507032Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f7c23b80d3d30a975be5f302ddd071cc3e01360114948c954af483064f0dfb89","observation_id":"7d2a0aaa-5ab1-41a0-bff7-27a6ecf49724","resolution":{"observed_at":"2026-08-12T00:41:03.471240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-09T05:13:41.910639Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10541","snapshot_observed_at":"2026-08-12T00:41:01.511851Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.511851Z"},"links":{"cited_paper":"/paper/2507.10541","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:16e96f58032adced640df2942132ec5019ca76e26353ac5c04fa18fbdb6d236c","observation_id":"c6db5c40-fc03-4847-ac89-107798b2046b","resolution":{"observed_at":"2026-08-12T00:41:01.511851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05563","last_updated":"2025-06-23T18:59:37Z","snapshot_observed_at":"2026-08-12T22:28:40.962953Z","submitted_at":"2024-10-07T23:48:52Z","title":"Rational Metareasoning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05563","snapshot_observed_at":"2026-08-12T00:41:01.521998Z","title":"Nicolò De Sabbata, Theodore R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.521998Z"},"links":{"cited_paper":"/paper/2410.05563","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f3900b61d751e1ea1a52daf218d5a597c28eca5f270c7a6d8065994804d4b99d","observation_id":"beebbebd-9086-4016-8b42-1306fe843472","resolution":{"observed_at":"2026-08-12T00:41:01.521998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.543400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.543400Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:049dbcb05647a62855db072bf0231ae1586154e7532e5dca27546200b272073a","observation_id":"1dc18ca5-f88c-4971-a7ee-36d18c3ec20e","resolution":{"observed_at":"2026-08-12T00:41:01.543400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.447589Z","title":null,"venue":null,"work_id":"2205595e-7b6f-44aa-9ffc-096e3508c67b","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.548419Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1089edf11d7a84450978c8f351c16aeb0879f0e12037863f10e58ca26cdf6fbb","observation_id":"bd844c39-f763-4009-9e15-a3f753baf526","resolution":{"observed_at":"2026-08-12T00:41:03.453760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14853","last_updated":"2026-04-16T10:39:22Z","snapshot_observed_at":"2026-07-06T23:02:31.717911Z","submitted_at":"2026-04-16T10:39:22Z","title":"Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14853","snapshot_observed_at":"2026-08-12T00:41:01.568541Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.568541Z"},"links":{"cited_paper":"/paper/2604.14853","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:161da26090233b1165f5d97320f5adaadbcd5ed33ba41ab962ce72dc2134ba14","observation_id":"d4ad9fbb-b4c6-49de-964f-7a84176a9530","resolution":{"observed_at":"2026-08-12T00:41:01.568541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.578422Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.578422Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8a8b3af520994965dd5ccbde1079cea96f2ca2e27a714c9478a613404e951916","observation_id":"dcb8b2a7-93ca-4f65-a19e-8fd4e12ef664","resolution":{"observed_at":"2026-08-12T00:41:01.578422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-12T00:41:01.583289Z","title":"MathArena: Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.583289Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:a4c14d51accead81eb5843aeca625f5455b5fefe81d99922d6675dee7857c76f","observation_id":"b39a9677-0307-4ab6-a7ff-8cf411dd56b2","resolution":{"observed_at":"2026-08-12T00:41:01.583289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.589452Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.589452Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:17c99b9e0b59c1448d3e5dd76f668228faa49b99435bacc395a561e467ab7751","observation_id":"45f94fae-51f0-4902-bd1c-e8990381356b","resolution":{"observed_at":"2026-08-12T00:41:01.589452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.594821Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.594821Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:79e48a05a5b1f7d07b4bf441d33af599fbdf01b78117907a5adeb54a781b5043","observation_id":"9e114142-68e6-4629-954e-0dcb0aead0b3","resolution":{"observed_at":"2026-08-12T00:41:01.594821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.409474Z","title":"The Effect of Question Order on Evaluations of Test Performance: Can the Bias Dissolve? , volume =","venue":null,"work_id":"94ac8668-93cf-4814-9496-70f2733b08bb","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.599467Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8a5f12e9c3988718ec5c811cdbbf5c8d21b692d39895899d4f2cb8cdae22cb8b","observation_id":"3c015ef6-7e48-4ac5-95ca-90e522f7331f","resolution":{"observed_at":"2026-08-12T00:41:03.414589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10229","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.232981Z","title":"Understanding performance in test taking: The role of question difficulty order , journal =","venue":null,"work_id":"4d19f728-028f-4c0f-b991-200339122251","year":2022},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.604549Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4095a274d17ff8846cc5c3cf633c13e17eeec069f68381655e9d3cd491a695fe","observation_id":"ba45cc57-223f-44cf-86dc-15abd0162483","resolution":{"observed_at":"2026-08-12T00:41:02.241180Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-12T00:41:01.609543Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.609543Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:dbd4abbc1eb7980ce3c00b1ab5e8af1e7804a8dd1d8dc4c039281ec3a8957e5e","observation_id":"e8c72946-d379-430f-9aeb-89e3e3c4af94","resolution":{"observed_at":"2026-08-12T00:41:01.609543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T00:41:01.614586Z","title":"Bowman , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.614586Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:7e81a1b0ec248964c03d30264d8105734b152c28eaf09751093b775cda649de7","observation_id":"55998d3f-17e5-4bfd-8587-90bded5b3992","resolution":{"observed_at":"2026-08-12T00:41:01.614586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.619578Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.619578Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ab6e048287831760093cac17afbcdabe9cea42b99918e1f964a9940886f14757","observation_id":"2f470ac4-f768-4691-802c-89033cc50e1a","resolution":{"observed_at":"2026-08-12T00:41:01.619578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.383482Z","title":"Measuring Ability, Speed, or Both?","venue":null,"work_id":"68548e15-a7eb-4ce7-87d5-9dc2dad6dcaa","year":2015},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.625553Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:9dba95ed000b567c336f19280596f36c64e1f1c1b31cb170e0a6a356e5500bc9","observation_id":"795537d0-59c4-476c-86c5-e73905d11ff1","resolution":{"observed_at":"2026-08-12T00:41:03.388812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.367065Z","title":"Psychometrika , volume =","venue":null,"work_id":"987e47a7-5a24-4a64-93c3-7d02ebfb3c62","year":2007},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.630372Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:22ee168953593d9cd11f74c392db5089bf2c5995aee0b2e8f97dd90fe14303bc","observation_id":"350b0fbc-d7b7-4807-b199-e8926f936f96","resolution":{"observed_at":"2026-08-12T00:41:03.372489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.351248Z","title":"2025 , eprint=","venue":null,"work_id":"bd82718e-bfee-45ac-b851-dc9a9cfe5e78","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.635597Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4745dd797adb3f3306d1c8fcc5457f450865293e824a61f1554abd13a3759e2c","observation_id":"001aa04a-5ac8-48ec-a9a2-68fc9acfb8e3","resolution":{"observed_at":"2026-08-12T00:41:03.356293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.640765Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.640765Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:26d9a336f6b4bd23003e3068a1b73f399d4943f628d132c424ba1bddf8768e8f","observation_id":"e1bdc7b8-79cf-400b-9de3-b99a641633e8","resolution":{"observed_at":"2026-08-12T00:41:01.640765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.645577Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.645577Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1048adf7e47962a449da790eed81a594fbe80419155a40a40e3911ed2c0f9743","observation_id":"5bcb5397-d6e6-4001-9c58-d7b5bd071713","resolution":{"observed_at":"2026-08-12T00:41:01.645577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-12T00:41:01.650361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.650361Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:cac9e7216c02a6aca8475273635cd69c375bcdf42107970d9e749cafcf20790e","observation_id":"7e70bca9-47d7-4deb-bc36-406e3eae3244","resolution":{"observed_at":"2026-08-12T00:41:01.650361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09891","last_updated":"2025-01-17T00:41:44Z","snapshot_observed_at":"2026-08-11T23:59:35.704715Z","submitted_at":"2025-01-17T00:41:44Z","title":"Evolving Deeper LLM Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09891","snapshot_observed_at":"2026-08-12T00:41:01.656428Z","title":"Evolving Deeper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.656428Z"},"links":{"cited_paper":"/paper/2501.09891","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:337aeb5d3545b68a93761d206294ccdb06b4b95e5af7818a8463a254d90a71e8","observation_id":"b4f1daf1-95da-463a-b1f1-7908065d13f1","resolution":{"observed_at":"2026-08-12T00:41:01.656428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.314332Z","title":"2024 , eprint=","venue":null,"work_id":"26b16b1b-804e-4e3a-a3a2-9c082fcac576","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.661947Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:73b7b38f9fcb526718bea99223a03bbe64d2b5d639131627a60144bfe0ba9798","observation_id":"2ceba4bb-969b-478e-bb53-43a61de675a4","resolution":{"observed_at":"2026-08-12T00:41:03.319334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.667203Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.667203Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ccf4335fc21e83857b4fab9470086a028987850b9eb8725579e9e929a2439276","observation_id":"0afa5ae3-5579-49a0-8878-ddaf68aca01d","resolution":{"observed_at":"2026-08-12T00:41:01.667203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.672029Z","title":"Proceedings of the 36th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.672029Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e4606445728294856f6b0ee0121699a2cd09a272bc4f4d29af116b7ea245d61e","observation_id":"62adc81c-13e1-4cd9-8521-c94532b63b15","resolution":{"observed_at":"2026-08-12T00:41:01.672029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.1513","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.962523Z","title":"Schoenfeld ' s Anatomy of Mathematical Reasoning by Language Models","venue":null,"work_id":"d6419e15-8c0c-49a2-9181-1423c91c00d7","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.676754Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:d69d66856d6c3683c2c7705db530fc50af1133b69bbfd6092a679ad5ef806443","observation_id":"bccdd1a9-195e-490f-9d73-b5533fa81f27","resolution":{"observed_at":"2026-08-12T00:41:01.967492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.922","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.945329Z","title":"Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld ' s Episode Theory","venue":null,"work_id":"623a1ed1-5111-4af0-8625-70b7ba407b2a","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.681695Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e38f40a4cfa9fd22ad8f27bf789f0c99a740980a963ec00bb6fcf1a805820649","observation_id":"87c1fbc0-91a5-47d6-bc82-08e7a14ae4aa","resolution":{"observed_at":"2026-08-12T00:41:01.951197Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.275745Z","title":"2025 , eprint=","venue":null,"work_id":"ba6f30d5-2f52-459c-8619-bd995b564df3","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.686315Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:c786d8f47bd1e9c2e2ecdba9cd26963275e8a31dc0fe0ccca6a8ccca4bd69f80","observation_id":"c2f0bd4d-10fd-4f94-86c0-51eee048dfce","resolution":{"observed_at":"2026-08-12T00:41:03.280796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06998","last_updated":"2025-06-08T05:08:32Z","snapshot_observed_at":"2026-08-10T00:01:32.411574Z","submitted_at":"2025-06-08T05:08:32Z","title":"What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding","version":1},"cited_work":{"arxiv_id":"2506.06998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06998","snapshot_observed_at":"2026-08-12T00:41:02.729615Z","title":"What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding","venue":"cs.CL","work_id":"3ab58de7-19bd-41b8-a457-ead0cbac882c","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.691063Z"},"links":{"cited_paper":"/paper/2506.06998","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:3371085ffcfb8425a4bbe6b79754d04ccb8c2a6349eeb5aebf8bc3a35092edb1","observation_id":"c9b354db-faa9-44bf-bb77-5634779ce537","resolution":{"observed_at":"2026-08-12T00:41:02.735307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-12T00:41:01.695485Z","title":"Do NOT Think That Much for 2+3=?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.695485Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1b114cba67db1ffa2a8b950748da7b21a784f70c72eff4a1e4eeb183cd89fde6","observation_id":"7f66e0b5-2fe1-4d42-9543-1d71769311f5","resolution":{"observed_at":"2026-08-12T00:41:01.695485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.259485Z","title":"2025 , eprint=","venue":null,"work_id":"f807b976-f478-49c9-afb8-2c26f4718f0f","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.699989Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:29b5140421a28bc042f896999aa9c3b3dfccc08ed5dfddde5205286b0561bfad","observation_id":"3455fa06-2855-4bda-862e-b851fa9c29ce","resolution":{"observed_at":"2026-08-12T00:41:03.264513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.705148Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.705148Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4fcf49d002ea3f6e64c1573c13d850c76a837c48597bb499673c69bf3c2aa32d","observation_id":"5b9e465d-b957-4c2a-b2aa-2170b8c8427a","resolution":{"observed_at":"2026-08-12T00:41:01.705148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.232801Z","title":"2025 , eprint=","venue":null,"work_id":"68b4fe00-b0e6-4b8f-b020-17c48f8d7702","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.709888Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:3c25e5bfec0d88b6f51dffa88978b8d112e876ee46ccedb6ddcfbe4b49684db0","observation_id":"a44707f9-d51e-4c70-a5b6-d4256a2d8496","resolution":{"observed_at":"2026-08-12T00:41:03.238318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-12T17:13:46.909910Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-12T00:41:01.714733Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.714733Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:087944bc05df9d298d0d5eb436e253314e3ebbacd170eea1e73d4281bd0a0e74","observation_id":"98d29c6a-0a6b-4fc7-8ce3-8d88fe6a8eb8","resolution":{"observed_at":"2026-08-12T00:41:01.714733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.215394Z","title":"2024 , eprint=","venue":null,"work_id":"6405e9a7-3d02-4f83-b37c-cf911196bd19","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.719444Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:91bf5c51085f7b26f4de14676da55f6b01f5b58fdc985e9eb08e85cba6e1888c","observation_id":"322d5b22-2436-4e40-a8e9-16bbc7dbf61a","resolution":{"observed_at":"2026-08-12T00:41:03.221633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.199518Z","title":"2025 , eprint=","venue":null,"work_id":"d90c2c63-58fb-42e2-b14a-7f57afdbedb6","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.724229Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:126f27b969d2a44c0113310733260971cbdb61bee7d8e3fbeae6717e43d773d8","observation_id":"4b6aa461-d16e-4b0f-b6e5-8317963f8672","resolution":{"observed_at":"2026-08-12T00:41:03.204686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.729410Z","title":"2505.20258 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.729410Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f3c198c88d282a51881fdc22c1b2ef617bc4f0ea5b4ea286546cb7caa1ce0b11","observation_id":"c748bad4-2fa2-4962-90c6-48c9fb9b5267","resolution":{"observed_at":"2026-08-12T00:41:01.729410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.734397Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.734397Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:06fdf18068590dd5ed20a4b65bc738fd78dccee9971ce6cbf33425f9f0206375","observation_id":"e949ab87-ba76-4f22-aed5-5cbfbe4e212a","resolution":{"observed_at":"2026-08-12T00:41:01.734397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.172500Z","title":"Steering","venue":null,"work_id":"cea86019-859b-41f8-aeb7-c1b9d3df339d","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.741023Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:6fcf6af16bd14547406e36f660faf88fae2b0790a3c231e6b34f2f696d904411","observation_id":"fbd94739-535e-4012-9b3a-ffe34c4b2c87","resolution":{"observed_at":"2026-08-12T00:41:03.177594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-06T13:40:01.864747Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17196","snapshot_observed_at":"2026-08-12T00:41:01.746514Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.746514Z"},"links":{"cited_paper":"/paper/2508.17196","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:22f59ceb8567b3199df56b86cb7d8e3021fdc5b4a410353c39a058e17575bf20","observation_id":"23abf3c3-4f00-4931-a3ac-1772b18e96d5","resolution":{"observed_at":"2026-08-12T00:41:01.746514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-11T04:38:08.656962Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-12T00:41:01.751553Z","title":"Token-Budget-Aware","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.751553Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:5b95cb94cf47e233fd22f4029405032851cc16a3621a6878e81f3d7a0ae1399a","observation_id":"7ffd88c9-8457-48b3-bd33-cca9bd3daf2b","resolution":{"observed_at":"2026-08-12T00:41:01.751553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:41:01.756037Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.756037Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:702c0ee8561b3d0d98ce9fa9a079845043e9a0c05e2c1533ed23ff4dbc256156","observation_id":"959fcbcb-80ee-404e-87c5-b834383b7dea","resolution":{"observed_at":"2026-08-12T00:41:01.756037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T00:41:01.760731Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.760731Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f332b7840ac1d4851cf3f865b36807cc21240fb4b27a4736a0ad4414d43355bf","observation_id":"b883ea27-5b70-493d-8bfa-8f0366f8e815","resolution":{"observed_at":"2026-08-12T00:41:01.760731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T00:41:01.765737Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.765737Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:dafd49562bc391f22767766a77386eb0493f65f7670d4080232606e581f0eda9","observation_id":"02ba01e8-73bc-4b8e-af1c-bded7e17838e","resolution":{"observed_at":"2026-08-12T00:41:01.765737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.156188Z","title":"2025 , school=","venue":null,"work_id":"38314d93-b070-4c85-a701-5319d4d7f750","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.770483Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b243c771071cccf16c3a58b2d9fda13af9518f382ff75c10c549767a95c798d1","observation_id":"38cadad6-4259-4a96-8b7f-7b2136aa0340","resolution":{"observed_at":"2026-08-12T00:41:03.161418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.775466Z","title":"2024 , editor =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.775466Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:fdeef0535c3674d5961b7aadbca895ceaa15719b697523a80bcaaa92ac34f4b0","observation_id":"de346e61-1bbc-4026-bc20-66a0efc73ead","resolution":{"observed_at":"2026-08-12T00:41:01.775466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.130248Z","title":"Vicky and He, Conghui and Wu, Lijun , journal=","venue":null,"work_id":"4edd35d6-f473-4d8b-b8e0-be932caf646a","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.780060Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:9df71e5ed337a33eeadb476a2c3e40e0d05d740c5b69e921125c5a8d9c50c747","observation_id":"59c9d35d-7aa3-4063-a868-836b6b2e5c2d","resolution":{"observed_at":"2026-08-12T00:41:03.135049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.114771Z","title":null,"venue":null,"work_id":"241a1d67-4ea3-4e0b-a5bf-1c2a1a1bdd78","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.785348Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:06d1947fb398158839d42ac3b01060c5d13ce178f08db76b0709e5f9a35d93b4","observation_id":"83b520ca-ec2e-4e2b-bd0b-f03bfd6dd464","resolution":{"observed_at":"2026-08-12T00:41:03.119699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.098657Z","title":"Triage: Evaluating Prospective Metacognitive Control in","venue":null,"work_id":"5d9db299-5bb1-4122-9eee-9816cd035ffc","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.790753Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:c89f295ee339cad44aaf7e7ddd89cb43aec0068446965451d3ca7cb86af07071","observation_id":"c2ab9dbb-bc4a-46fe-9148-3d0a003d66ef","resolution":{"observed_at":"2026-08-12T00:41:03.103967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.796046Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.796046Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:03d9186db5346aeb2d3037a26bb526b3ad3d586966cbde9b2b719d75c001e858","observation_id":"2e15344c-3520-43e3-857e-eb72744a3d88","resolution":{"observed_at":"2026-08-12T00:41:01.796046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.071400Z","title":"2004 , publisher=","venue":null,"work_id":"2c93d2f6-69f4-4c9a-b152-054716fca99d","year":2004},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.800860Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:a7c4b2a4c29d5fc910243dc4daf1ff4f0eee544ee6316785737895b7a4a66389","observation_id":"28dbad17-7757-4a1c-996e-a8c882072226","resolution":{"observed_at":"2026-08-12T00:41:03.076743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.053870Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing: Industry Track , pages=","venue":null,"work_id":"d5c5c966-cbfe-4834-978d-ebb495a67e18","year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.806153Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1f8ad861f9fc6154a0382b4e757e429b26e2ac5af73e85113fb8e707664e58bd","observation_id":"2fd2b7ff-db75-487d-82ef-ab8932557dc4","resolution":{"observed_at":"2026-08-12T00:41:03.059676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.037094Z","title":"Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM ^2 ) , pages=","venue":null,"work_id":"7f8cc238-4db7-4ee4-91f3-37d22db92f4c","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.811123Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0e3f116ca487e311424549c6d52ca3fdcb95bef07563a83cfca3e3fefc442ec4","observation_id":"df540463-70bf-485e-8bca-aecadff2c02c","resolution":{"observed_at":"2026-08-12T00:41:03.042496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.019024Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":"110aeaed-668d-4a57-a0e7-a383a152298f","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.815707Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0ab089e6251b8592abfa875175bee6ab577ec1b846e476a7dfb12a1bee8f41e6","observation_id":"c10b7745-4918-4cb8-913b-893c5a6ce7b6","resolution":{"observed_at":"2026-08-12T00:41:03.024975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.002423Z","title":"2024 , eprint=","venue":null,"work_id":"c7fc72e1-113c-4997-92a6-cc13b8746323","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.820659Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:f28b3b7e5f58f81f2e16189f42c858d815cecef2760963730fb0ec1cb53af5f6","observation_id":"3d865c5b-efd8-4067-a03e-8049daa54a6e","resolution":{"observed_at":"2026-08-12T00:41:03.007398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.826544Z","title":"Reasoning in Token Economies: Budget-Aware Evaluation of LLM Reasoning Strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.826544Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:2b485974489c706aa04cfe16279af07732546e10c28c0fd1329ed351e66fa5e8","observation_id":"35c98bfe-2135-41a1-aa2e-6458714b4200","resolution":{"observed_at":"2026-08-12T00:41:01.826544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-acl.417","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.893781Z","title":"and Ballesteros, Miguel and Chilton, Lydia and Yu, Zhou and Roth, Dan","venue":null,"work_id":"d598fffe-c7d3-4ca1-b790-1aecf8e7bef4","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.831285Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ffbbf192c0a84791b3893b0d02947d2222dbc89f605b47192accf70b90b215ac","observation_id":"adf4188b-1747-4ee4-addf-dbe0e0d42191","resolution":{"observed_at":"2026-08-12T00:41:01.900187Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.985685Z","title":"2026 , eprint=","venue":null,"work_id":"28202cf8-82cb-4da1-bb90-5b4504d4ba69","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.836009Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ca9ea7bc9212eaabb4e189e89af053c346ea285df8ebc5a5eb3952e83d3f1b85","observation_id":"c7787c17-3336-4180-b41d-0e10a91e2453","resolution":{"observed_at":"2026-08-12T00:41:02.991643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.969682Z","title":"2024 , eprint=","venue":null,"work_id":"7871603f-1d1e-46d9-9cfb-543beed9c422","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.840878Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:da7474738595c894efcd69a93454f458c6bc6ce7114f8c1e006ff688bf39cf27","observation_id":"87c1132b-c7f8-47db-b4c4-8d86ccce8c87","resolution":{"observed_at":"2026-08-12T00:41:02.974821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.845697Z","title":"Characterizing Positional Bias in Large Language Models: A Multi-Model Evaluation of Prompt Order Effects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.845697Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:11935d51235473fc36461f49bd90f4742ff2f12f2e298ea7e18cebb3e1ed3fca","observation_id":"299e3819-bc02-4c5a-9cce-e15092b510e0","resolution":{"observed_at":"2026-08-12T00:41:01.845697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.850325Z","title":"Principles of metareasoning , journal =","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.850325Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:7294c2f57dddcac9ccc81234fa47afff4786f2c38bd493baa6f246b84499ec74","observation_id":"1aba4f11-beef-4dbe-bc1e-3d42135e1f73","resolution":{"observed_at":"2026-08-12T00:41:01.850325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.954094Z","title":"2025 , eprint=","venue":null,"work_id":"beeda997-6790-492c-a5a7-5982c64a8a5a","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.854785Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e35451c53232baabcb51a6b90f18408372e17af208da0918037309d637f78d90","observation_id":"b2920928-d2d5-4446-b23c-6b23f33e40ec","resolution":{"observed_at":"2026-08-12T00:41:02.958973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.937049Z","title":"2026 , eprint=","venue":null,"work_id":"f15a32b6-0404-4e76-8fc7-c5628920c9fd","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.859522Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:5e4c2925e8172ce4472009a8e86d0a820fd32253466544b3113607b56916ddc2","observation_id":"f97fd9d8-20b2-43b8-a8ba-735b0db5ee21","resolution":{"observed_at":"2026-08-12T00:41:02.942367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T00:17:26.283041Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":50,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2608.07968."}