{"as_of":"2026-08-19T05:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23347bd96e913cf09d5aed18250eddc17c0e139f6dccf633be29ec5f45711f1d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":71,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:08:24.966348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T10:04:51.524003Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2410.06431","last_updated":"2026-05-13T22:22:18Z","snapshot_observed_at":"2026-08-17T07:31:20.176630Z","submitted_at":"2024-10-09T00:09:15Z","title":"Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T19:35:29.917096Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2410.06431"},"observation_digest":"sha256:fa9ab705a0f8c1df4a8950873502622d4c92048b3bce3c18a79e6821d9c50288","observation_id":"0d26e54b-5eda-40e3-9677-e2b3743f9b8e","resolution":{"observed_at":"2026-05-23T19:35:47.081648Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-12T11:15:45.000278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18444","last_updated":"2024-11-27T15:35:32Z","snapshot_observed_at":"2026-08-15T01:23:17.995892Z","submitted_at":"2024-11-27T15:35:32Z","title":"Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:15:45.000278Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2411.18444"},"observation_digest":"sha256:3904c125cb5621185720252df2925f72cdd3856d5c732526a5e014dff9713565","observation_id":"fc857310-d720-44b5-bb35-893cde8ddb83","resolution":{"observed_at":"2026-08-12T11:15:45.000278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-11T20:37:55.127589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-08-16T14:41:18.143042Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-08-11T20:37:55.127589Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2412.05563"},"observation_digest":"sha256:5fc3322c92452a3f191d5849b19ee38e1389f40969de6befdbeb4f8172110c89","observation_id":"43137bf2-977c-4039-a8b6-0eb7b2a8ce5e","resolution":{"observed_at":"2026-08-11T20:37:55.127589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-11T14:40:29.402052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11803","last_updated":"2025-05-23T03:05:52Z","snapshot_observed_at":"2026-08-14T20:30:09.749954Z","submitted_at":"2024-12-16T14:14:27Z","title":"UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T14:40:29.402052Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2412.11803"},"observation_digest":"sha256:675d0e313ca71254b3216ac544d7ac2cd7a01ca262a71eaa974cd35550f0a5f4","observation_id":"a5179813-6feb-4f68-9223-48256d41fb10","resolution":{"observed_at":"2026-08-11T14:40:29.402052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-11T14:04:26.382442Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12509","last_updated":"2025-02-18T15:24:25Z","snapshot_observed_at":"2026-08-16T21:16:12.321849Z","submitted_at":"2024-12-17T03:37:31Z","title":"Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T14:04:26.382442Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2412.12509"},"observation_digest":"sha256:c3a758e6c17ba860b9c74ec402da8b4fe3c4d7f2a433fb0726cf24402ca7a768","observation_id":"cf62d123-8a6a-45f8-bc30-bad822d73584","resolution":{"observed_at":"2026-08-11T14:04:26.382442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-11T12:08:03.466397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14660","last_updated":"2024-12-25T06:05:36Z","snapshot_observed_at":"2026-08-18T13:06:26.993824Z","submitted_at":"2024-12-19T09:10:07Z","title":"Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:08:03.466397Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2412.14660"},"observation_digest":"sha256:40b2156db3cad18f8a2da248158ae1345411d95a8b0f2e6b47c60349016b9bd7","observation_id":"07f3ca1a-7426-4132-8465-b82fc73e1815","resolution":{"observed_at":"2026-08-11T12:08:03.466397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-09T18:14:11.143826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00675","last_updated":"2025-06-03T18:03:32Z","snapshot_observed_at":"2026-08-16T08:44:41.550392Z","submitted_at":"2025-02-02T05:25:03Z","title":"ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:14:11.143826Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2502.00675"},"observation_digest":"sha256:35a67130fa5c40fa0780dee40299bf258ee739cd1088782bdac60bcbdfb3dc51","observation_id":"87c41a14-f868-400d-80a0-aef4748ac421","resolution":{"observed_at":"2026-08-09T18:14:11.143826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-09T15:05:03.762908Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01540","last_updated":"2025-02-03T17:17:26Z","snapshot_observed_at":"2026-08-15T22:40:52.033412Z","submitted_at":"2025-02-03T17:17:26Z","title":"What is a Number, That a Large Language Model May Know It?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T15:05:03.762908Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2502.01540"},"observation_digest":"sha256:b94491ce8ed2e41b098a3fab7e2e343d3f7cf843b618ae83f1476e4afce4069b","observation_id":"bdee8e7b-d2f3-492e-83e9-f59b50f90375","resolution":{"observed_at":"2026-08-09T15:05:03.762908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-08T16:14:57.529618Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10441","last_updated":"2025-02-10T09:19:52Z","snapshot_observed_at":"2026-08-15T16:33:10.713147Z","submitted_at":"2025-02-10T09:19:52Z","title":"AI Alignment at Your Discretion","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-08T16:14:57.529618Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2502.10441"},"observation_digest":"sha256:f7dc142b2f1eb80557d343c78483352f2448cb23d869c073490eabf848669a93","observation_id":"ac08aad5-0d5c-4bb6-bb09-9316d8ea88f8","resolution":{"observed_at":"2026-08-08T16:14:57.529618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-16T12:08:24.966348Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13644","last_updated":"2025-04-18T11:50:30Z","snapshot_observed_at":"2026-08-17T21:11:51.710630Z","submitted_at":"2025-04-18T11:50:30Z","title":"Exploring the Potential for Large Language Models to Demonstrate Rational Probabilistic Beliefs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:08:24.966348Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2504.13644"},"observation_digest":"sha256:d40b4419694765041c44938c1fe7f5cbedd9b85cc6bf916f7e787e7233cf4b0e","observation_id":"bb1c8036-e2fb-453e-9dea-a2e4e2b5f1d0","resolution":{"observed_at":"2026-08-16T12:08:24.966348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-16T11:15:54.228901Z","title":"arXiv preprint arXiv:2305.14975 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16073","last_updated":"2025-04-22T17:52:42Z","snapshot_observed_at":"2026-08-18T12:33:35.484429Z","submitted_at":"2025-04-22T17:52:42Z","title":"Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:15:54.228901Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2504.16073"},"observation_digest":"sha256:8d5ac1c03dbd7a47d475eaddbb85943c751e324c41202ac26d24c367a8f45a25","observation_id":"5f7435d4-a7d6-43bf-8182-a32399b9cf1b","resolution":{"observed_at":"2026-08-16T11:15:54.228901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-16T11:00:20.513220Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16760","last_updated":"2025-04-23T14:33:20Z","snapshot_observed_at":"2026-08-19T03:06:44.760452Z","submitted_at":"2025-04-23T14:33:20Z","title":"Lightweight Latent Verifiers for Efficient Meta-Generation Strategies","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:20.513220Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2504.16760"},"observation_digest":"sha256:ca4475033b3d0da592823146b05ee62ffa3a759eae32dfccaa0ff73735fe97c2","observation_id":"94dc402d-477a-49c4-ac6b-5235c78a8805","resolution":{"observed_at":"2026-08-16T11:00:20.513220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-16T05:52:20.615933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19622","last_updated":"2025-04-28T09:28:42Z","snapshot_observed_at":"2026-08-17T16:30:22.900071Z","submitted_at":"2025-04-28T09:28:42Z","title":"From Evidence to Belief: A Bayesian Epistemology Approach to Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T05:52:20.615933Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2504.19622"},"observation_digest":"sha256:878b2b7b2d1bacde4660f7c5cd91f1f091d31b6c72b8fd1d95fc49335088a9a4","observation_id":"e07cd5e4-985b-4cca-9516-7e2afe1c32c8","resolution":{"observed_at":"2026-08-16T05:52:20.615933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T14:51:10.229493Z","title":"Yanling Wang, Haoyang Li, Hao Zou, Jing Zhang, Xin- lei He, Qi Li, and Ke Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17537","last_updated":"2025-05-23T06:42:06Z","snapshot_observed_at":"2026-08-17T03:03:27.943806Z","submitted_at":"2025-05-23T06:42:06Z","title":"How Knowledge Popularity Influences and Enhances LLM Knowledge Boundary Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:10.229493Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2505.17537"},"observation_digest":"sha256:57e046ccae6d6668d0d4a1cd11d1510249b9698e2505e0041eafd34329b05876","observation_id":"584d44be-ba08-413d-a395-ebfcbd78e2c6","resolution":{"observed_at":"2026-08-07T14:51:10.229493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T14:06:32.927335Z","title":"Miao Xiong, Zhiyuan Hu, Xinyang Lu, Yifei Li, Jie Fu, Junxian He, and Bryan Hooi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20047","last_updated":"2025-05-26T14:34:04Z","snapshot_observed_at":"2026-08-15T22:38:54.183478Z","submitted_at":"2025-05-26T14:34:04Z","title":"Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:32.927335Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2505.20047"},"observation_digest":"sha256:c7ea3a59add1068f69a30e9776a4d127ce670ac056c4afe34f7bd4816fbcf8ea","observation_id":"ec1db97f-76d1-473b-bdd5-ef12a1fd1741","resolution":{"observed_at":"2026-08-07T14:06:32.927335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T13:07:50.296268Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:50.296268Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2505.22660"},"observation_digest":"sha256:b32ac926af10c1dd370f78c9cf31b89c5834bf75487feffd7c050482ce07ca14","observation_id":"b8abcfe2-2940-4745-b144-bcf9713b4ffc","resolution":{"observed_at":"2026-08-07T13:07:50.296268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T12:59:38.624582Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback.arXiv preprint arXiv:2305.14975, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.624582Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:6ba40ea54e15c036dd3a901097ed9c1dcb9632b92697ef87fb522cc2ba3c62e2","observation_id":"1da2abeb-136f-4094-a287-a324fe04db61","resolution":{"observed_at":"2026-08-07T12:59:38.624582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T11:23:47.056892Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02696","last_updated":"2025-06-03T09:44:28Z","snapshot_observed_at":"2026-08-15T18:57:46.741569Z","submitted_at":"2025-06-03T09:44:28Z","title":"Shaking to Reveal: Perturbation-Based Detection of LLM Hallucinations","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:47.056892Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2506.02696"},"observation_digest":"sha256:3f4b132214ccd13db28230fc49f962ef13969e12b985501298b25fd6a8033bb8","observation_id":"f12a8b6b-719e-4ae1-96cc-9777a10f2fe7","resolution":{"observed_at":"2026-08-07T11:23:47.056892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T10:46:27.153092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04494","last_updated":"2025-06-04T22:25:47Z","snapshot_observed_at":"2026-08-16T00:07:48.482895Z","submitted_at":"2025-06-04T22:25:47Z","title":"SQLens: An End-to-End Framework for Error Detection and Correction in Text-to-SQL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:46:27.153092Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2506.04494"},"observation_digest":"sha256:065037fa23c7242c1e4c880d33de17467378c3d7776b05c98b8c93c38b950114","observation_id":"30a7e555-abf9-49aa-ba4c-bc584eb09656","resolution":{"observed_at":"2026-08-07T10:46:27.153092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T05:01:08.078888Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-17T17:31:40.958159Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:08.078888Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2506.09038"},"observation_digest":"sha256:fc07d6a4f3a55a04175ce61dad88c7ad69f44ca965fd87ff4dc66f763c5a5242","observation_id":"619a2cbc-486e-45bc-9b89-0ae08a5ad457","resolution":{"observed_at":"2026-08-07T05:01:08.078888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-06T23:28:22.043040Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18183","last_updated":"2025-07-18T02:39:29Z","snapshot_observed_at":"2026-08-15T08:33:02.736288Z","submitted_at":"2025-06-22T21:46:42Z","title":"Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:22.043040Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2506.18183"},"observation_digest":"sha256:b06c9c4e52735e60f8ae8817c921547f991d3848359d34f7359df787c8955388","observation_id":"54c42534-296b-4e84-9d02-2f824336c9ce","resolution":{"observed_at":"2026-08-06T23:28:22.043040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T10:18:52.921444Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02870","last_updated":"2025-06-06T10:50:08Z","snapshot_observed_at":"2026-08-08T01:09:03.836574Z","submitted_at":"2025-06-06T10:50:08Z","title":"Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.921444Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2507.02870"},"observation_digest":"sha256:f5b4e3b18a92e2e9bbd266ca51bee655b5c40764f4393f9ca153d6a89c018674","observation_id":"ddf5da14-286c-49de-a5d8-df45f05613a0","resolution":{"observed_at":"2026-08-07T10:18:52.921444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-06T20:25:55.114325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03120","last_updated":"2025-07-03T18:57:43Z","snapshot_observed_at":"2026-08-17T04:49:42.885026Z","submitted_at":"2025-07-03T18:57:43Z","title":"How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:55.114325Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2507.03120"},"observation_digest":"sha256:dbaedc68982b6b7ecd44e26ecdfe1e251f5e9e5fbf20b397fa27e848fc3afea3","observation_id":"8294562d-caf4-45f4-873a-df1bceb7a1dd","resolution":{"observed_at":"2026-08-06T20:25:55.114325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-06T19:38:03.045297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05010","last_updated":"2025-07-07T13:48:54Z","snapshot_observed_at":"2026-08-17T13:15:59.034832Z","submitted_at":"2025-07-07T13:48:54Z","title":"Co-DETECT: Collaborative Discovery of Edge Cases in Text Classification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:38:03.045297Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2507.05010"},"observation_digest":"sha256:57852786bdc189e7047cbeb8197a8347ec3840c1212f66721fc7b4e65f9487ae","observation_id":"119cf71b-9e18-4ad7-9f5f-5f35ee6de10d","resolution":{"observed_at":"2026-08-06T19:38:03.045297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-06T18:06:27.408905Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09209","last_updated":"2025-07-12T09:03:30Z","snapshot_observed_at":"2026-08-14T15:19:08.265341Z","submitted_at":"2025-07-12T09:03:30Z","title":"Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:06:27.408905Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2507.09209"},"observation_digest":"sha256:4cd6532c2fcb4a0a4e7a35a7ac43422fcb381848024ca3183c666829efc4a8ce","observation_id":"06be8adb-b560-492c-8f97-a84a51690bcc","resolution":{"observed_at":"2026-08-06T18:06:27.408905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-06T05:23:59.897211Z","title":"D., and Finn, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01862","last_updated":"2025-08-03T17:29:48Z","snapshot_observed_at":"2026-08-16T10:59:57.208854Z","submitted_at":"2025-08-03T17:29:48Z","title":"Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T05:23:59.897211Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2508.01862"},"observation_digest":"sha256:5203881ff703f96e0cccfd7a943ed2718a12e573f1376ac519102c355c830ac1","observation_id":"0e257a96-023e-4eee-8c10-a9eead34d43a","resolution":{"observed_at":"2026-08-06T05:23:59.897211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-15T17:30:45.850281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12040","last_updated":"2025-08-16T13:29:35Z","snapshot_observed_at":"2026-08-16T10:59:06.599919Z","submitted_at":"2025-08-16T13:29:35Z","title":"Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:30:45.850281Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2508.12040"},"observation_digest":"sha256:24cb1b223b8dfa57fff31644b6ea3d023026b2189b447994f67ee8f47c577ee0","observation_id":"cc4418c2-6516-4fcd-80a3-1e771d10e976","resolution":{"observed_at":"2026-08-15T17:30:45.850281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-04T22:48:32.557614Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07159","last_updated":"2025-09-08T19:15:38Z","snapshot_observed_at":"2026-08-12T14:18:34.854452Z","submitted_at":"2025-09-08T19:15:38Z","title":"PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:48:32.557614Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2509.07159"},"observation_digest":"sha256:2286617d65062dd5218b4d8092e2716292fdccc37d6db1884ef146928ced5360","observation_id":"0e6f288c-3cec-4927-bf7e-43380ab7134b","resolution":{"observed_at":"2026-08-04T22:48:32.557614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-04T19:07:41.556896Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Conﬁdence Scores from Language Models Fine-Tuned with Human Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09467","last_updated":"2025-09-11T13:50:23Z","snapshot_observed_at":"2026-08-16T12:49:36.961138Z","submitted_at":"2025-09-11T13:50:23Z","title":"Inteligencia Artificial jur\\'idica y el desaf\\'io de la veracidad: an\\'alisis de alucinaciones, optimizaci\\'on de RAG y principios para una integraci\\'on responsable","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T19:07:41.556896Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2509.09467"},"observation_digest":"sha256:27e6bc5fcc8cc8c0f0b94f01663c28a4e21b8c2e35ecb1d246141909466eee49","observation_id":"cedf85ec-f4cd-42ec-b15c-6094bf857b8e","resolution":{"observed_at":"2026-08-04T19:07:41.556896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-15T16:09:12.519527Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09602","last_updated":"2025-09-11T16:42:22Z","snapshot_observed_at":"2026-08-18T02:07:51.904973Z","submitted_at":"2025-09-11T16:42:22Z","title":"LAVA: Language Model Assisted Verbal Autopsy for Cause-of-Death Determination","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T16:09:12.519527Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2509.09602"},"observation_digest":"sha256:e2714f3e88de0bdc9a3df6e0d93caab094820310b45f507c01e294ccc12068cd","observation_id":"08ebd968-1697-4d2e-83ff-3c215f9ea0ec","resolution":{"observed_at":"2026-08-15T16:09:12.519527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-04T18:25:37.393238Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10004","last_updated":"2025-09-12T06:58:17Z","snapshot_observed_at":"2026-08-09T16:53:26.012699Z","submitted_at":"2025-09-12T06:58:17Z","title":"Unsupervised Hallucination Detection by Inspecting Reasoning Processes","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T18:25:37.393238Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2509.10004"},"observation_digest":"sha256:e57ef06b6d87b76a9aec224dc61e37e07316b62e3a26d5232823a7a227fe9b28","observation_id":"6af8266c-4bf5-4722-9483-fc653b770f7d","resolution":{"observed_at":"2026-08-04T18:25:37.393238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-04T17:41:06.185564Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10753","last_updated":"2025-09-12T23:49:52Z","snapshot_observed_at":"2026-08-17T15:41:24.351229Z","submitted_at":"2025-09-12T23:49:52Z","title":"HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:06.185564Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2509.10753"},"observation_digest":"sha256:c8d8678efd930f8d9b7398e164f332c6d2e60b80e5fae7b6c20909a475c02625","observation_id":"19cc7309-0a75-4058-b68a-2f9250200bdb","resolution":{"observed_at":"2026-08-04T17:41:06.185564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-04T07:02:43.751793Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback.arXiv preprint arXiv:2305.14975,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-13T15:02:10.943195Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:43.751793Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:943082060d52dd7b2fa79f99fa3d071a0d708cbe55016cfe8d13854da41b7838","observation_id":"89b1e2df-80f6-4170-9ac4-b957549c4d8e","resolution":{"observed_at":"2026-08-04T07:02:43.751793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2512.18880","last_updated":"2026-05-10T20:55:34Z","snapshot_observed_at":"2026-07-06T22:39:43.359149Z","submitted_at":"2025-12-21T20:41:36Z","title":"Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T20:15:16.449712Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2512.18880"},"observation_digest":"sha256:1be79f597fa2093fe14f8ed22e50b6a9fe5918e01eef1e9a7e00fcfb517a23d2","observation_id":"7608833d-b797-46e0-a530-5a89453a8397","resolution":{"observed_at":"2026-05-16T20:18:24.059827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-03T06:34:29.961428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22648","last_updated":"2026-05-26T11:07:20Z","snapshot_observed_at":"2026-08-16T07:38:14.972424Z","submitted_at":"2026-01-30T07:07:42Z","title":"UCPO: Uncertainty-Aware Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:34:29.961428Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2601.22648"},"observation_digest":"sha256:897752f221cdadf4da49df437d3bcc541d7d6c4854f396ead4142728b0caa7e6","observation_id":"07c74a56-30da-4241-acee-22357dc2f946","resolution":{"observed_at":"2026-08-03T06:34:29.961428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-03T00:05:11.067751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11719","last_updated":"2026-06-10T14:31:47Z","snapshot_observed_at":"2026-08-13T14:47:41.895681Z","submitted_at":"2026-02-12T08:48:51Z","title":"Uncertainty-aware Generative Recommendation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T00:05:11.067751Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2602.11719"},"observation_digest":"sha256:8835ee90a124a42e7b40ccaba40224d188049950b72d5a8b4e50f46a29b77944","observation_id":"2e84a639-ce49-42db-bf77-d54e9c57ad46","resolution":{"observed_at":"2026-08-03T00:05:11.067751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2603.17839","last_updated":"2026-05-19T10:45:47Z","snapshot_observed_at":"2026-08-16T10:39:50.993651Z","submitted_at":"2026-03-18T15:31:43Z","title":"How do LLMs Compute Verbal Confidence","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T10:38:28.533485Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2603.17839"},"observation_digest":"sha256:9b54b55d0fc2e5e35cfc7ab9cd2e367a215f8a4cc725dc2b0b7ec5a254c91922","observation_id":"e571b856-0a57-4b15-bfc3-fc1a4353dd58","resolution":{"observed_at":"2026-05-21T10:40:00.577255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-12T16:18:54.458115Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:49dbbc8ac04d675c90be2e57f8e129c88247ef55c7680f7fad61b10c25ee5116","observation_id":"c860152e-3ff7-4350-a450-6abed1da25e8","resolution":{"observed_at":"2026-05-21T09:44:05.651338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2604.06389","last_updated":"2026-04-07T19:19:29Z","snapshot_observed_at":"2026-08-13T21:57:48.024763Z","submitted_at":"2026-04-07T19:19:29Z","title":"SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:49:23.092309Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2604.06389"},"observation_digest":"sha256:4e62969701d26b5e545fbb023a80c264ee02d2748f4e50b3873cba20e4f95c68","observation_id":"5b2b2309-44e6-43e7-b6ff-a8093a8480b3","resolution":{"observed_at":"2026-05-10T23:55:49.681288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2604.08588","last_updated":"2026-03-31T19:29:17Z","snapshot_observed_at":"2026-08-03T07:48:54.296680Z","submitted_at":"2026-03-31T19:29:17Z","title":"Act or Escalate? Evaluating Escalation Behavior in Automation with Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T23:25:56.299371Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2604.08588"},"observation_digest":"sha256:6d23997cc1e514f530732d779c66dd61dd8dd0ef1bc6ea9a251932ad62621eca","observation_id":"4c2fd448-564b-408d-a88a-a2548d5532ba","resolution":{"observed_at":"2026-05-13T23:28:26.292726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2604.15827","last_updated":"2026-04-23T15:33:25Z","snapshot_observed_at":"2026-07-31T17:07:10.586782Z","submitted_at":"2026-04-17T08:29:44Z","title":"UsefulBench: Towards Decision-Useful Information as a Target for Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T07:59:42.451677Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2604.15827"},"observation_digest":"sha256:59c515ee2e2b325f8134b42876ee74dce89bc635904ab7365a123b08d98c0faf","observation_id":"d08e21b5-500f-47b5-a3d3-d2a31853ccae","resolution":{"observed_at":"2026-05-10T08:02:25.137836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2604.22215","last_updated":"2026-04-24T04:45:21Z","snapshot_observed_at":"2026-08-11T13:49:42.908620Z","submitted_at":"2026-04-24T04:45:21Z","title":"Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:09:07.770260Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2604.22215"},"observation_digest":"sha256:827cf27fb52881e85111669da0c72e7cae4da006ac7b234c007625477de2aa0a","observation_id":"ee48544c-d7c3-47e2-b33b-eb6dc618992b","resolution":{"observed_at":"2026-05-11T19:21:08.905209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2604.22271","last_updated":"2026-05-01T09:11:21Z","snapshot_observed_at":"2026-08-11T18:53:07.158021Z","submitted_at":"2026-04-24T06:33:32Z","title":"How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:30:51.094216Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2604.22271"},"observation_digest":"sha256:987df11e97e0409d90a7aaff0f2a44cc2d95c8793555a7ab159611403023b90b","observation_id":"8113b983-2179-454c-896e-cce94e929d75","resolution":{"observed_at":"2026-05-11T19:16:06.940805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.00200","last_updated":"2026-05-13T08:01:56Z","snapshot_observed_at":"2026-08-13T10:21:31.533454Z","submitted_at":"2026-04-30T20:26:10Z","title":"Confidence Estimation in Automatic Short Answer Grading with LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T20:22:34.911547Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.00200"},"observation_digest":"sha256:8bb27971146dce802d9ee09ba07447a5e10004e9385647753f8ee9a50000e10d","observation_id":"de793346-1123-4430-bd84-12ce8735d9e8","resolution":{"observed_at":"2026-05-11T15:16:09.529218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.00200","last_updated":"2026-05-13T08:01:56Z","snapshot_observed_at":"2026-08-13T10:21:31.533454Z","submitted_at":"2026-04-30T20:26:10Z","title":"Confidence Estimation in Automatic Short Answer Grading with LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T20:59:33.337511Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.00200"},"observation_digest":"sha256:213c9f7a7b6b7b680fc94995cb31cc358da87b3c1d247062149641215f5213a6","observation_id":"ad7b4369-ef84-4889-932a-bf2d6e516a18","resolution":{"observed_at":"2026-05-14T21:02:59.206738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.02241","last_updated":"2026-05-07T16:11:01Z","snapshot_observed_at":"2026-08-14T10:16:32.913957Z","submitted_at":"2026-05-04T05:33:03Z","title":"Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T16:32:51.205764Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.02241"},"observation_digest":"sha256:d811271310e040bc5c61fd01899119f36a1231fb3040dbc3e32bf15f8f489baa","observation_id":"e9ed1b3e-a20d-4561-8656-57b2b07cc8e0","resolution":{"observed_at":"2026-05-11T16:31:07.311249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.06915","last_updated":"2026-05-26T21:27:44Z","snapshot_observed_at":"2026-08-16T18:20:41.082208Z","submitted_at":"2026-05-07T20:25:02Z","title":"LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:49.859413Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.06915"},"observation_digest":"sha256:ff54831a6e266056668600f110bbdb773edacadac4913e8fd869cf5d1ff5df76","observation_id":"59ac8232-900e-467f-be2e-c0fedc3eede7","resolution":{"observed_at":"2026-05-11T05:00:56.985129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.13595","last_updated":"2026-05-13T14:30:39Z","snapshot_observed_at":"2026-08-12T21:11:25.367048Z","submitted_at":"2026-05-13T14:30:39Z","title":"Inducing Artificial Uncertainty in Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T20:11:44.878211Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.13595"},"observation_digest":"sha256:881aa5176fbca01bf4a556bf3b472c4f452b5e1b170e1e2d62d856cf735f66c2","observation_id":"091a3177-bbad-4bd9-9919-eb95c3726809","resolution":{"observed_at":"2026-05-14T20:12:55.526912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.15416","last_updated":"2026-08-02T00:54:42Z","snapshot_observed_at":"2026-08-16T01:55:44.908168Z","submitted_at":"2026-05-14T21:01:05Z","title":"Margin-Adaptive Confidence Ranking for Reliable LLM Judgement","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-19T16:05:41.505091Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.15416"},"observation_digest":"sha256:ece34d69c2e22b1f23e90d5ab02d2a9e325d70b5927dd794e3f05e8538b30284","observation_id":"8edc7c8f-98b6-4ad1-b7b2-63d67aac3c24","resolution":{"observed_at":"2026-05-19T16:12:39.544765Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.22949","last_updated":"2026-07-31T14:06:03Z","snapshot_observed_at":"2026-08-18T17:20:44.386389Z","submitted_at":"2026-05-21T18:25:05Z","title":"MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T06:09:18.808074Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.22949"},"observation_digest":"sha256:33f52c5ee7ab3d4084add3d17b55dba5914ffe10c25caaccc702ed231f12d834","observation_id":"78049a4b-e569-49a0-ae1c-4b1bc001a279","resolution":{"observed_at":"2026-05-25T06:10:23.641444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.22949","last_updated":"2026-07-31T14:06:03Z","snapshot_observed_at":"2026-08-18T17:20:44.386389Z","submitted_at":"2026-05-21T18:25:05Z","title":"MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T16:38:51.852464Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.22949"},"observation_digest":"sha256:9d37b3068a4aeb5518606fe671675e99c2230aa87583efdb2784f9e9ae0168a9","observation_id":"5e85ed73-3521-409a-9b45-06c43adfaae2","resolution":{"observed_at":"2026-06-30T16:44:56.166499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-03T02:19:38.063144Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.22949","last_updated":"2026-07-31T14:06:03Z","snapshot_observed_at":"2026-08-18T17:20:44.386389Z","submitted_at":"2026-05-21T18:25:05Z","title":"MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:19:38.063144Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.22949"},"observation_digest":"sha256:cdffe1ad5009bd4c81bd7960ca1cd6c8b652aeaade0e2e47fdb32cedb68c5119","observation_id":"142b36c8-98e7-4bc7-8993-b252bd342ebc","resolution":{"observed_at":"2026-08-03T02:19:38.063144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, and Jiechao Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:3035226287c24429678784eb57e4b69a1ac4ea8bccf133a821650934c651939a","observation_id":"c4f7439e-d337-448d-8cf7-f44492eb1078","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.28500","last_updated":"2026-05-27T14:01:30Z","snapshot_observed_at":"2026-08-03T16:15:08.120077Z","submitted_at":"2026-05-27T14:01:30Z","title":"Functional Entropy: Predicting Functional Correctness in LLM-Generated Code with Uncertainty Quantification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T13:23:01.482449Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.28500"},"observation_digest":"sha256:628943442645b7d2efe604907439bf1a55a01d43d30824b4ea0bbfe972089738","observation_id":"e35011d6-a110-4991-bc9a-add26e706319","resolution":{"observed_at":"2026-06-29T13:23:27.683822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.29605","last_updated":"2026-08-17T02:14:52Z","snapshot_observed_at":"2026-08-19T05:20:12.979283Z","submitted_at":"2026-05-28T08:42:12Z","title":"VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T06:53:56.750481Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.29605"},"observation_digest":"sha256:656ea21184942e988680bec92bd402fbf718c3715f65cdba7fd9e929efde10f8","observation_id":"9e1c07db-f4f3-4a79-8465-d045fab9c574","resolution":{"observed_at":"2026-06-29T14:13:30.494545Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2605.30826","last_updated":"2026-05-29T04:26:13Z","snapshot_observed_at":"2026-08-14T14:25:56.929445Z","submitted_at":"2026-05-29T04:26:13Z","title":"Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:04:29.910598Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.30826"},"observation_digest":"sha256:3c059548eee9e43396b7561129d4145d4ca09e15b7e90187a322e57dbd45e45e","observation_id":"a9316994-81e5-4599-ae7a-a6202369a667","resolution":{"observed_at":"2026-07-01T19:16:00.148765Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.00809","last_updated":"2026-06-02T09:30:41Z","snapshot_observed_at":"2026-08-02T12:26:27.107967Z","submitted_at":"2026-05-30T16:49:05Z","title":"NBQ: Next-Best-Question for Dynamic Profiling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T18:34:34.264514Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.00809"},"observation_digest":"sha256:5332dfefd2ef50b8960a69b2939a54d5e3d70ef5af3ed64aaaf93e76f9c34d3d","observation_id":"c081905b-0e32-479a-a5ba-b78c17033301","resolution":{"observed_at":"2026-06-28T20:32:37.910080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.03535","last_updated":"2026-06-02T11:57:27Z","snapshot_observed_at":"2026-08-12T17:13:49.592296Z","submitted_at":"2026-06-02T11:57:27Z","title":"Can LLM Rerankers Predict Their Own Ranking Performance?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T08:19:25.544186Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.03535"},"observation_digest":"sha256:3535cf3d6e5222229cfcf9745ea6a1ab23b0e02eea9341e12ee43741baeb9ba6","observation_id":"5d0c1da4-8c9c-4093-844b-64238ab22f14","resolution":{"observed_at":"2026-07-02T05:16:39.622791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.18158","last_updated":"2026-06-16T16:57:12Z","snapshot_observed_at":"2026-08-13T08:27:57.453143Z","submitted_at":"2026-06-16T16:57:12Z","title":"The Measurement Gap in the Automation of EU Law: Benchmarking Doctrinal Legal Reasoning under the EU AI Act","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T22:16:25.919667Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.18158"},"observation_digest":"sha256:39b72fe59359b57cac1fe1ad8fb37439814c2d2eaf39268068df2f126def5e5e","observation_id":"49cea165-9b97-443f-b295-d6c7a0ba96ea","resolution":{"observed_at":"2026-07-03T23:29:02.480627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.19950","last_updated":"2026-06-18T08:49:11Z","snapshot_observed_at":"2026-08-11T14:24:16.185913Z","submitted_at":"2026-06-18T08:49:11Z","title":"Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T17:49:38.151224Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.19950"},"observation_digest":"sha256:08fc8458d296db7eb4abdec10451dc7833ea8fdca6a207742694b65af71b3b8d","observation_id":"e1eed9f8-467b-4df8-8149-7e599f67cbbd","resolution":{"observed_at":"2026-07-04T03:39:30.312099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.24420","last_updated":"2026-06-23T10:58:08Z","snapshot_observed_at":"2026-08-17T22:37:25.198431Z","submitted_at":"2026-06-23T10:58:08Z","title":"Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:07.754083Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.24420"},"observation_digest":"sha256:5408e0d4a7f934a4a15a8139a63c6c8390d1551e4076a6803e71b2b16820f57d","observation_id":"e622431a-d4eb-401d-a148-c66978bcc057","resolution":{"observed_at":"2026-07-04T17:09:59.431676Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.27023","last_updated":"2026-06-25T13:33:58Z","snapshot_observed_at":"2026-08-16T14:37:34.575900Z","submitted_at":"2026-06-25T13:33:58Z","title":"Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T05:35:35.054964Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.27023"},"observation_digest":"sha256:b1b4760b63b945a3144dc2412db050034a1eb16800c67f9ba6a0c0971b5e4d20","observation_id":"259b9f1f-d222-48c4-baf7-7cb74bc18f70","resolution":{"observed_at":"2026-07-04T12:59:52.905360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2606.29490","last_updated":"2026-06-28T16:39:18Z","snapshot_observed_at":"2026-08-13T04:34:05.057189Z","submitted_at":"2026-06-28T16:39:18Z","title":"Reported Confidence in LLMs Tracks Commitment More Than Correctness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T07:44:53.539382Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2606.29490"},"observation_digest":"sha256:b2463b25abd3f26ca4af1a807cb3bd92d28e9446f3d459e41429bf33d166dddf","observation_id":"b1b13f8b-bcc3-4d38-bb68-fe9cca14be69","resolution":{"observed_at":"2026-06-30T08:04:28.805928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2607.01612","last_updated":"2026-07-02T02:29:33Z","snapshot_observed_at":"2026-08-18T20:04:49.596902Z","submitted_at":"2026-07-02T02:29:33Z","title":"Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-03T14:49:33.364596Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.01612"},"observation_digest":"sha256:5bcc0d2a1f83c0a38dda47045edddb6a35953c870ea68e53465a46273acf273d","observation_id":"bf219580-2e9f-420b-9c2e-50f8b5cd14fc","resolution":{"observed_at":"2026-07-03T14:58:32.561986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2607.06327","last_updated":"2026-07-07T14:25:09Z","snapshot_observed_at":"2026-08-16T23:14:37.738340Z","submitted_at":"2026-07-07T14:25:09Z","title":"Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-08T09:56:07.928172Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.06327"},"observation_digest":"sha256:e92e78caad699c7521d021c528c595a8b38798b9a01ca7767e5ee3d0332d2068","observation_id":"a2034867-06e2-4406-8eb4-5e8bc1ce6a27","resolution":{"observed_at":"2026-07-08T10:04:51.526734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-02T06:37:42.016252Z","title":"arXiv preprint arXiv:2305.14975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12447","last_updated":"2026-07-24T07:10:23Z","snapshot_observed_at":"2026-08-15T11:05:06.604899Z","submitted_at":"2026-07-14T07:24:32Z","title":"The Computational Basis of Confidence in Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:42.016252Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.12447"},"observation_digest":"sha256:10fe62d4acedb458e6a688c883ea4bf80f24f52fc2f41d1814d461245248ca55","observation_id":"02576b22-d371-4fae-a7d4-85bdd210f3b7","resolution":{"observed_at":"2026-08-02T06:37:42.016252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-01T06:03:16.937188Z","title":"arXiv preprint arXiv:2305.14975 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22034","last_updated":"2026-07-24T07:00:32Z","snapshot_observed_at":"2026-08-18T03:04:41.648501Z","submitted_at":"2026-07-24T07:00:32Z","title":"Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T06:03:16.937188Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.22034"},"observation_digest":"sha256:2078c59f21948e9fcd85b6ac4c292c1e0a3827b6dec3d75270c671cc588b0405","observation_id":"40fa64b1-f4d3-4ab8-be2c-ecec87abbdde","resolution":{"observed_at":"2026-08-01T06:03:16.937188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-31T14:56:09.451029Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24440","last_updated":"2026-07-27T13:47:44Z","snapshot_observed_at":"2026-08-18T18:59:26.828958Z","submitted_at":"2026-07-27T13:47:44Z","title":"Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T14:56:09.451029Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.24440"},"observation_digest":"sha256:9d7ed9e5bf250c53b9804c5dee48fbb5e31283a050f759304cd7b9eeea6f6722","observation_id":"f410d905-d7d6-47c2-9bcf-a59056b4edb9","resolution":{"observed_at":"2026-07-31T14:56:09.451029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-31T11:29:22.475836Z","title":"In: Proc","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28317","last_updated":"2026-07-30T14:52:36Z","snapshot_observed_at":"2026-08-17T23:04:17.367987Z","submitted_at":"2026-07-30T14:52:36Z","title":"One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T11:29:22.475836Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2607.28317"},"observation_digest":"sha256:6fee382c1e7b7cccfaf98a921f805d7b169bed1d77be9ac4005ba5845ccba84c","observation_id":"4e4b0f74-8b50-49b1-b90b-1807ef6b6d13","resolution":{"observed_at":"2026-07-31T11:29:22.475836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-12T13:21:40.289944Z","title":"arXiv preprint (2023), https://arxiv.org/abs/2305.14975, arXiv:2305.14975","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10964","last_updated":"2026-08-11T14:28:52Z","snapshot_observed_at":"2026-08-16T10:59:08.735546Z","submitted_at":"2026-08-11T14:28:52Z","title":"CARE: Confidence-Aware Reasoning for Reliable Medical VQA","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:21:40.289944Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2608.10964"},"observation_digest":"sha256:28ec8298b0c7d895cc29ed4c17d4ed273488ef383373b37fd2d73c938e814a98","observation_id":"e044ebba-bf2a-40b4-8c3f-3ae1fe444e5b","resolution":{"observed_at":"2026-08-12T13:21:40.289944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-15T17:37:14.051600Z","title":"McCarley, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13063","last_updated":"2026-08-13T10:25:40Z","snapshot_observed_at":"2026-08-19T04:31:34.979288Z","submitted_at":"2026-08-13T10:25:40Z","title":"Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:14.051600Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2608.13063"},"observation_digest":"sha256:fe4e598bb6d4017c981092a42adf51af668dd5096f862f05a11f8b53a28e78d7","observation_id":"028d454e-2beb-4367-b1fb-0f89be3d99cc","resolution":{"observed_at":"2026-08-15T17:37:14.051600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.14975/citation-record","integrity":"/paper/2305.14975/integrity","json":"/paper/2305.14975/citation-record.json","paper":"/paper/2305.14975"},"outbound":[],"paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 71 inbound Pith citation observations for arXiv:2305.14975."}