{"as_of":"2026-08-08T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc4aaa4cffc797c308c30be9edd49b965cee73122d8a9b52ded9673d76f9443a","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:23.518356Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:10:15.553703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:55.947620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18404","snapshot_observed_at":"2026-08-03T19:10:15.553703Z","title":"Thought calibration: Efficient and confident test-time scaling.arXiv preprint arXiv:2505.18404, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03109","last_updated":"2026-05-28T14:15:57Z","snapshot_observed_at":"2026-08-06T22:36:39.085318Z","submitted_at":"2025-12-02T05:59:18Z","title":"E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T19:10:15.553703Z"},"links":{"cited_paper":"/paper/2505.18404","citing_paper":"/paper/2512.03109"},"observation_digest":"sha256:b0b852fa9556592aeb0466ad5a82e0df533b0ec6a638b9d45ea94ef5af226b23","observation_id":"0bb434ad-6b19-4129-a9c9-0794971002ac","resolution":{"observed_at":"2026-08-03T19:10:15.553703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"cited_work":{"arxiv_id":"2505.18404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18404","snapshot_observed_at":"2026-07-03T20:38:55.947620Z","title":"Thought calibration: Efﬁcient and conﬁdent test-time scaling","venue":null,"work_id":"e0f28ebc-2223-4b1b-81a3-2bbc67cb5cd3","year":2025},"citing_paper":{"arxiv_id":"2512.20012","last_updated":"2026-05-09T02:24:02Z","snapshot_observed_at":"2026-07-06T22:39:52.837578Z","submitted_at":"2025-12-23T03:10:09Z","title":"Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T20:47:59.128618Z"},"links":{"cited_paper":"/paper/2505.18404","citing_paper":"/paper/2512.20012"},"observation_digest":"sha256:af61621303ba398771174d99c229bdd3cacadfe3332f3238043e9ed64641c263","observation_id":"5e3cfcf8-3ebb-458c-b49d-836e39674a95","resolution":{"observed_at":"2026-05-16T20:48:32.150347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"cited_work":{"arxiv_id":"2505.18404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18404","snapshot_observed_at":"2026-07-03T20:38:55.947620Z","title":"Thought calibration: Efﬁcient and conﬁdent test-time scaling","venue":null,"work_id":"e0f28ebc-2223-4b1b-81a3-2bbc67cb5cd3","year":2025},"citing_paper":{"arxiv_id":"2605.12947","last_updated":"2026-05-13T03:30:39Z","snapshot_observed_at":"2026-08-08T09:45:27.775700Z","submitted_at":"2026-05-13T03:30:39Z","title":"When Should an AI Workflow Release? Always-Valid Inference for Black-Box Generate-Verify Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T19:00:55.658993Z"},"links":{"cited_paper":"/paper/2505.18404","citing_paper":"/paper/2605.12947"},"observation_digest":"sha256:7418e102f4a97f83389648989d1a34fc66f54806f81fff2d60a01ab4992b6c68","observation_id":"6c06d2d7-4b16-4f51-88ef-f9fff249c9ff","resolution":{"observed_at":"2026-05-14T19:02:50.281693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"cited_work":{"arxiv_id":"2505.18404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18404","snapshot_observed_at":"2026-07-03T20:38:55.947620Z","title":"Thought calibration: Efﬁcient and conﬁdent test-time scaling","venue":null,"work_id":"e0f28ebc-2223-4b1b-81a3-2bbc67cb5cd3","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.18404","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:5f0f5209571fa6b115278bfd8b31a074970d4db9e7b23eab1d62dd33ea7bb2e8","observation_id":"d9788a92-8813-4e2e-bb27-ca962f2faa01","resolution":{"observed_at":"2026-07-03T20:38:55.949123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18404","snapshot_observed_at":"2026-07-30T18:50:46.081641Z","title":"Thought calibration.arXiv preprint arXiv:2505.18404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26865","last_updated":"2026-07-29T12:47:05Z","snapshot_observed_at":"2026-08-02T19:28:19.003719Z","submitted_at":"2026-07-29T12:47:05Z","title":"Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T18:50:46.081641Z"},"links":{"cited_paper":"/paper/2505.18404","citing_paper":"/paper/2607.26865"},"observation_digest":"sha256:4255de600fe2cc9dd940479d21cdec432e7a819e52eacb766ce0925286c52c36","observation_id":"389dc7f3-29dc-46cf-aa59-77823004f54a","resolution":{"observed_at":"2026-07-30T18:50:46.081641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18404/citation-record","integrity":"/paper/2505.18404/integrity","json":"/paper/2505.18404/citation-record.json","paper":"/paper/2505.18404"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:37:22.674500Z","title":"Advances in Neural Information Processing Systems, 37:114812–114842","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.674500Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:cf2413a27d19e64ec2627d666b5246afd6900e0bf0b771a7e474c74232cbfcfc","observation_id":"0258f757-10db-4251-afb9-63c4cda29bdb","resolution":{"observed_at":"2026-08-07T14:37:22.674500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:24.155424Z","title":"In The Twelfth International Conference on Learning Representa- tions","venue":null,"work_id":"52dd52db-74ee-4dc6-b51e-c133269463e7","year":null},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.828122Z"},"links":{"citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:660e197af56b82237300b161170ca1dd1409f03e855468d9b505b3cb6e2275a6","observation_id":"3bb155b5-1a51-4ea5-a88f-1d46bbf4f350","resolution":{"observed_at":"2026-08-07T14:37:24.233758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-07T14:37:22.927520Z","title":"In The Twelfth Inter- national Conference on Learning Representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.927520Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:bbace094b8513660205197afa463c0cb34223d24f0aa3701dc5a298010b24f06","observation_id":"53af5fe8-d11c-409e-a8dc-794ceffe5efe","resolution":{"observed_at":"2026-08-07T14:37:22.927520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18711","last_updated":"2024-12-05T04:01:28Z","snapshot_observed_at":"2026-07-06T18:21:44.232687Z","submitted_at":"2024-05-29T02:44:12Z","title":"Calibrating Reasoning in Language Models with Internal Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18711","snapshot_observed_at":"2026-08-07T14:37:23.112070Z","title":"In Findings of the Association for Computational Linguistics: EMNLP 2023, pages 2550–2575","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:23.112070Z"},"links":{"cited_paper":"/paper/2405.18711","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:1678fdf5270ad24690b46a0138d5fff6e16834f2e5c6145bd493cc97abf4ec51","observation_id":"8df164f5-697f-43d6-b5ff-144f8a4bbc79","resolution":{"observed_at":"2026-08-07T14:37:23.112070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:37:23.238646Z","title":"arXiv preprint arXiv:2412.15115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:23.238646Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:442314a77ed19b1dfcfecf325880a2b7167d30eeb7e696a36c5267c4adfb2a99","observation_id":"d164c14a-5f06-4ae7-9b61-5609356657d7","resolution":{"observed_at":"2026-08-07T14:37:23.238646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:23.939158Z","title":"lmdeploy natively supports the saving of last layer representations, so it was used for almost all experiments","venue":null,"work_id":"d0d03ea6-9cbb-4746-9563-22177f260cb7","year":null},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:23.426563Z"},"links":{"citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:b05ae30503ca26a3fa4a4abf6232aa78a7f3d030a52990eae12030c4f3fcc613","observation_id":"c4a2d088-2575-4444-8f3d-fda0fc9cc30f","resolution":{"observed_at":"2026-08-07T14:37:24.040421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:23.788289Z","title":"Due to computational constraints, we report the mean over a single run","venue":null,"work_id":"7d0676da-729c-4c7b-9fbe-8c3b9732aed6","year":2025},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:23.518356Z"},"links":{"citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:261b9bb597e826c39b9c41b2576a42c7fdb50d301f300af0664d43432cbeecc7","observation_id":"4f531f36-c6ba-4abe-8755-b4012a6a8f52","resolution":{"observed_at":"2026-08-07T14:37:23.859130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01052","last_updated":"2022-09-29T23:51:57Z","snapshot_observed_at":"2026-08-02T16:58:31.805389Z","submitted_at":"2021-10-03T17:42:03Z","title":"Learn then Test: Calibrating Predictive Algorithms to Achieve Risk Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01052","snapshot_observed_at":"2026-08-07T14:37:22.522797Z","title":"arXiv preprint arXiv:2110.01052","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.522797Z"},"links":{"cited_paper":"/paper/2110.01052","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:c41c06e372ae0a07406e78158984e3fa2c68bb38d405bd3b7e34687c73eef88d","observation_id":"f76a5ef6-a1d7-49d5-83ee-23c09141ce55","resolution":{"observed_at":"2026-08-07T14:37:22.522797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T14:37:22.995288Z","title":"Ad- vances in Neural Information Processing Systems , 35:17456–17472","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.995288Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:35883bcc72f1455715ad2a8302dafa2159116f2ae9759f245245a701c71f64a9","observation_id":"d0b6a32a-9223-464a-bf6b-cb6ed13451a9","resolution":{"observed_at":"2026-08-07T14:37:22.995288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:24.324541Z","title":"In International Conference on Machine Learning, pages 19274–19286","venue":null,"work_id":"b187cb8c-8272-4470-9fae-a0a2edffe313","year":null},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.737261Z"},"links":{"citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:de62fd3f8bb179af7cf1396e9f01dfe74f9adec61f4d94c0e43f5d670779d5da","observation_id":"d9f1127d-cd47-4510-9e02-350d7df22f95","resolution":{"observed_at":"2026-08-07T14:37:24.430785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T14:37:22.580355Z","title":"arXiv preprint arXiv:2412.21187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:22.580355Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:3050cb6486c774e0cb4fb89e8151e71dad275072df1d46f3b1ad76de1441538d","observation_id":"6cbbd8c0-6c99-4e97-a9e2-67089320a0a4","resolution":{"observed_at":"2026-08-07T14:37:22.580355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:23.317044Z","title":"in-progress","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:23.317044Z"},"links":{"citing_paper":"/paper/2505.18404"},"observation_digest":"sha256:3a4f6f7b22c92c2227e243fb6afdf0031e715f9fffd0051b8c6316d3e31f783d","observation_id":"fde1f4ae-9b61-40ed-9d38-0bf9b2fe0258","resolution":{"observed_at":"2026-08-07T14:37:23.317044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18404","last_updated":"2025-05-23T22:17:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:57:19.859536Z","submitted_at":"2025-05-23T22:17:18Z","title":"Thought calibration: Efficient and confident test-time scaling"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 5 inbound Pith citation observations for arXiv:2505.18404."}