{"as_of":"2026-08-08T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02e36532cc5fc83bc3d0e1434fb4534d24f1fa3e155e4e1ebb2ea2bc03e3eb20","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:01:24.806077Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.07965/citation-record","integrity":"/paper/2601.07965/integrity","json":"/paper/2601.07965/citation-record.json","paper":"/paper/2601.07965"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T11:01:24.743506Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.743506Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:7349e8060f8c614d1744aafc5e39593d09fd1564094ba505efe7ecb8d13a92a2","observation_id":"fc12f312-7950-43c5-858d-704d59cb994e","resolution":{"observed_at":"2026-08-03T11:01:24.743506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-02T09:01:28.869881Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-03T11:01:24.768815Z","title":"semanticscholar.org/CorpusID:234357974","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.768815Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:a28714206f7240929f1a300074ec8341625a76c0e75c3dc756ddc960e95f81a8","observation_id":"86135f6c-752f-4013-8ca6-28474a5ee98c","resolution":{"observed_at":"2026-08-03T11:01:24.768815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:01:24.776628Z","title":"Right answer, wrong score: Uncovering the inconsistencies of llm evalua- tion in multiple-choice question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.776628Z"},"links":{"citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:b88157ca17437b0a3571c36707595a744092a1b4a3b26b178a5407d471c4f897","observation_id":"eafcd586-17a1-429c-9787-02612d2d157d","resolution":{"observed_at":"2026-08-03T11:01:24.776628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15789","last_updated":"2023-09-27T17:08:40Z","snapshot_observed_at":"2026-08-06T08:57:12.331150Z","submitted_at":"2023-09-27T17:08:40Z","title":"Large Language Model Routing with Benchmark Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15789","snapshot_observed_at":"2026-08-03T11:01:24.791849Z","title":"Large language model routing with benchmark datasets.arXiv preprint arXiv:2309.15789,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.791849Z"},"links":{"cited_paper":"/paper/2309.15789","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:42b3c1443c687a7b8feb5f8ca29368f51f5772e060b9060fc598c0760bf389c0","observation_id":"3c26f859-c714-42a7-92d5-b3401e2a6eb9","resolution":{"observed_at":"2026-08-03T11:01:24.791849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02047","last_updated":"2024-08-21T01:58:38Z","snapshot_observed_at":"2026-07-06T17:24:45.062473Z","submitted_at":"2024-02-03T05:52:28Z","title":"Calibration and Correctness of Language Models for Code","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02047","snapshot_observed_at":"2026-08-03T11:01:24.795273Z","title":"Calibration and correctness of lan- guage models for code.arXiv preprint arXiv:2402.02047,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.795273Z"},"links":{"cited_paper":"/paper/2402.02047","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:5699967d8d68639980e2ad174b18d37dcfd3e3718fec9e13544d84642075d0b3","observation_id":"f8d6a8c1-7b9d-4d22-b4cd-4d5728ccf61e","resolution":{"observed_at":"2026-08-03T11:01:24.795273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.01988","last_updated":"2022-02-17T17:29:51Z","snapshot_observed_at":"2026-08-05T09:33:30.049725Z","submitted_at":"2020-12-03T14:59:16Z","title":"Wisdom of Committees: An Overlooked Approach To Faster and More Accurate Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.01988","snapshot_observed_at":"2026-08-03T11:01:24.798770Z","title":"Xiaofang Wang, Dan Kondratyuk, Eric Christiansen, Kris M Kitani, Yair Alon, and Elad Eban","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.798770Z"},"links":{"cited_paper":"/paper/2012.01988","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:80833eb575e7fb689182cbb4e423ec727d09e28e3edb761625cc381aa5a55e2a","observation_id":"d5729fa8-63f1-45e1-b4d5-868ca45ef7a7","resolution":{"observed_at":"2026-08-03T11:01:24.798770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T11:01:24.802698Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.802698Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:ea49954335fff2f38154078811819c3f7053bb67f48b8a891161887345ca7d28","observation_id":"2c8b2c39-20e9-41bc-b8e8-e3eec4dee87f","resolution":{"observed_at":"2026-08-03T11:01:24.802698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-03T11:01:24.806077Z","title":"Bigcodebench: Bench- marking code generation with diverse function calls and complex instructions.arXiv preprint arXiv:2406.15877,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.806077Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:74013c1774d09c3c6c62af620936f4ced5978d1ee19afe201f284c5d94f1d646","observation_id":"41ef2409-fc44-421a-ada7-c9a20a9b8881","resolution":{"observed_at":"2026-08-03T11:01:24.806077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01239","last_updated":"2017-12-31T14:53:00Z","snapshot_observed_at":"2026-08-05T10:32:12.591894Z","submitted_at":"2017-11-03T17:07:51Z","title":"Routing Networks: Adaptive Selection of Non-linear Functions for Multi-Task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.01239","snapshot_observed_at":"2026-08-03T11:01:24.788160Z","title":"Routing networks: Adaptive selection of non-linear functions for multi-task learning.arXiv preprint arXiv:1711.01239,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.788160Z"},"links":{"cited_paper":"/paper/1711.01239","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:798c1dda79c4f7d62f89c2f80b4754949638f899a24f624772660825d0e11271","observation_id":"001403d8-cf39-4188-85f0-7d368afee2da","resolution":{"observed_at":"2026-08-03T11:01:24.788160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04656","last_updated":"2021-07-19T20:09:35Z","snapshot_observed_at":"2026-07-06T11:08:07.506240Z","submitted_at":"2021-05-10T20:26:26Z","title":"Distribution-free calibration guarantees for histogram binning without sample splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04656","snapshot_observed_at":"2026-08-03T11:01:24.764633Z","title":"Distribution-free calibration guarantees for histogram binning without sample splitting.ArXiv, abs/2105.04656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.764633Z"},"links":{"cited_paper":"/paper/2105.04656","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:dfebdb6f0657fd7b2278ccdf2071dfb027f83686bf24edc9fae1e69bd379dbe8","observation_id":"efdaadaa-b268-4d9d-8b3b-ab8ea166dc9e","resolution":{"observed_at":"2026-08-03T11:01:24.764633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T11:01:24.757149Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.757149Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:bd7c270f2829c73b021fb6041f8114e1d5efe5034ce3abc0cdf63bc549f7c7e8","observation_id":"032a416e-1e6d-473d-b034-734d9fcddc63","resolution":{"observed_at":"2026-08-03T11:01:24.757149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T11:01:24.772715Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.772715Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:8432ee9650726b348426a0245cd23292eb151fae43a27c1d6625198d550d8fb6","observation_id":"0eff23d6-7889-4ae1-b2f7-a2e347270565","resolution":{"observed_at":"2026-08-03T11:01:24.772715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-03T11:01:24.752769Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.752769Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:3bbaf942aa8b264dcc7f2716c859337c02f30067f88d7c6fe04d738728dd3f49","observation_id":"5dd63219-ba09-42f8-b0d4-c527a50a1aba","resolution":{"observed_at":"2026-08-03T11:01:24.752769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00068","last_updated":"2022-08-22T00:58:03Z","snapshot_observed_at":"2026-07-06T08:33:56.199723Z","submitted_at":"2019-10-31T19:26:33Z","title":"Confident Learning: Estimating Uncertainty in Dataset Labels","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00068","snapshot_observed_at":"2026-08-03T11:01:24.784050Z","title":"Isaac Ong, Amjad Almahairi, Vincent Wu, Wei-Lin Chiang, Tianhao Wu, Joseph E","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.784050Z"},"links":{"cited_paper":"/paper/1911.00068","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:d95cc355d316e3f628050d444e862b2a7ab9cee26f3a1b9cdcd9b82ee9e6f237","observation_id":"5eab5441-4bd9-451b-a161-3eee451cecd3","resolution":{"observed_at":"2026-08-03T11:01:24.784050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-03T11:01:24.748158Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.748158Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:e45b54d215fe4990b96c0639003023e11526462091427d543cb1388f001ee90a","observation_id":"bc5e17c4-cf9f-4aa5-8533-f5416b2bc821","resolution":{"observed_at":"2026-08-03T11:01:24.748158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T11:01:24.760996Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.760996Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:c089ad4fc99d2bec42ea2dfb842dc36d810e8d0642112cca433bf16cc8dca43a","observation_id":"b6fd33e9-cd8f-46b8-ad20-54251afde1d3","resolution":{"observed_at":"2026-08-03T11:01:24.760996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01685","last_updated":"2020-08-07T18:34:21Z","snapshot_observed_at":"2026-08-04T20:23:20.720077Z","submitted_at":"2019-04-02T22:10:44Z","title":"Measuring Calibration in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01685","snapshot_observed_at":"2026-08-03T11:01:24.780243Z","title":"Jeremy Nixon, Michael Dusenberry, Linchuan Zhang, Ghassen Jerfel, and Dustin Tran","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:01:24.780243Z"},"links":{"cited_paper":"/paper/1904.01685","citing_paper":"/paper/2601.07965"},"observation_digest":"sha256:d49a6490e16308b17498ee944f86f71321723d7f3cbd99265209202334152ffe","observation_id":"ff235d6a-c265-4016-9335-efd5a9d28cb3","resolution":{"observed_at":"2026-08-03T11:01:24.780243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.07965","last_updated":"2026-06-28T07:55:15Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T12:01:54.231929Z","submitted_at":"2026-01-12T19:59:03Z","title":"When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2601.07965."}