{"as_of":"2026-08-06T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:029ed101ae4286d9fd92e721c4bf567673fff8caa5a3225da40c585683cdf070","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T09:43:05.524088Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:44:53.539382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T08:04:28.791842Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"cited_work":{"arxiv_id":"2603.22161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.22161","snapshot_observed_at":"2026-06-30T08:04:28.791842Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","venue":"cs.LG","work_id":"92779bf6-b38e-486c-8a5c-c8cd765fd140","year":2026},"citing_paper":{"arxiv_id":"2606.29490","last_updated":"2026-06-28T16:39:18Z","snapshot_observed_at":"2026-08-04T08:09:00.632813Z","submitted_at":"2026-06-28T16:39:18Z","title":"Reported Confidence in LLMs Tracks Commitment More Than Correctness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:44:53.539382Z"},"links":{"cited_paper":"/paper/2603.22161","citing_paper":"/paper/2606.29490"},"observation_digest":"sha256:043891f60e17e18feb2a5b8eac4f7de402419610c93341516a99aa8a79b02aeb","observation_id":"c486f0ec-ae54-4a30-9aa5-31f3b2cd4f39","resolution":{"observed_at":"2026-06-30T08:04:28.793227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.22161/citation-record","integrity":"/paper/2603.22161/integrity","json":"/paper/2603.22161/citation-record.json","paper":"/paper/2603.22161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent introspective awareness in large language models.https://transformer-circuits","venue":null,"work_id":"93751d54-2534-499a-a7ff-d3d28da4e79a","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:297207301d1b36af0f5a67d19cbe2f34d9b890c07ef860b636973144ad00e480","observation_id":"f7308fc9-0d04-40a0-95c2-172a147433e0","resolution":{"observed_at":"2026-05-21T09:44:06.010719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:4468571e8b8a5adf8e3228daba7fb8bd34d5b7eea97928671fe6a796b1d30225","observation_id":"86e942f4-f9a0-4d2b-bff0-b8cac6159c32","resolution":{"observed_at":"2026-05-21T09:44:05.689507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13284","last_updated":"2025-06-19T22:52:45Z","snapshot_observed_at":"2026-07-06T19:35:08.846184Z","submitted_at":"2024-10-17T07:28:18Z","title":"Learning to Route LLMs with Confidence Tokens","version":3},"cited_work":{"arxiv_id":"2410.13284","doi":"10.48550/arxiv.2410.13284","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to route llms with confidence tokens.arXiv preprint arXiv:2410.13284","venue":"arXiv (Cornell University)","work_id":"75839d27-b2b6-48dd-b74a-76740c88c21f","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2410.13284","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:e71899c18fa70be54c8c0868511f352042765d587a6da05f9e2d26a41b0e889b","observation_id":"3eae1ae1-2b90-47f0-8fef-0bec7d8477ec","resolution":{"observed_at":"2026-05-21T09:44:05.693586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How contextual are contextualized word representations? comparing the geometry of BERT, ELMo, and GPT-2 embeddings","venue":null,"work_id":"712cfbd6-7aeb-496e-964a-92f4a1896b54","year":2019},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:272a85b53705baf228610ffbb5a0f1002b0261c2c78db60ffa14a8d0a39d9213","observation_id":"6b8b511d-cb66-4a6b-9920-2d0dc35e0759","resolution":{"observed_at":"2026-05-21T09:44:05.995667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T07:55:31.586939Z","title":"arXiv preprint arXiv:2510.20487 , year =","venue":null,"work_id":"daeb53de-3885-41f2-9d76-ea0b6900661e","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:149505bba0b9bbf743596f72f9086d7aeee9710b1ab8af31c5da94abb9a55394","observation_id":"4ecf6f20-63b9-4d3a-90bb-e7819b50dd14","resolution":{"observed_at":"2026-05-21T09:44:05.661418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44276dbc-408e-45ad-89fe-4d58c659ca87","year":2065},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:d9579610f6c2b5eefe7a2f5193dcdf0b723aa001e1189e492a77bebac1a9e8a4","observation_id":"a230a5ef-8473-48e2-9756-984cf68c438e","resolution":{"observed_at":"2026-05-21T09:44:06.014528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:8a9978ac0bcd97288c0f7661fad3410e5c37b40beb21bc18995909734c98eb47","observation_id":"e98251f9-7940-4836-8963-eac4a6166453","resolution":{"observed_at":"2026-05-21T09:44:05.704774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":"2509.04664","doi":"10.48550/arxiv.2509.04664","metadata_source":"pith","pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why Language Models Hallucinate","venue":"cs.CL","work_id":"6bfb3eed-1270-492c-8fbe-a5671f3f779c","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:c0ee2d567ab2de4ded9dab31a6ed9a2dba2711f3fe43c8761528ec4d41306b70","observation_id":"6d145a09-a089-4a57-b2ac-73c88462ef51","resolution":{"observed_at":"2026-05-21T09:44:05.686530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-07-06T21:39:56.824255Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"cited_work":{"arxiv_id":"2506.09038","doi":"10.48550/arxiv.2506.09038","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09038","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abstentionbench: Reasoning llms fail on unanswerable questions.arXiv preprint arXiv:2506.09038","venue":"ArXiv.org","work_id":"9f8c5581-0c37-41ab-8abb-1fc7627e1a7e","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2506.09038","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:a8625710e74c02741a7a42b394378ce8fc71a628736cb89668b79ba5d25e1f52","observation_id":"aff98b5a-48b7-42cc-b2d0-b06ea3806efc","resolution":{"observed_at":"2026-05-21T09:44:05.708549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03120","last_updated":"2025-07-03T18:57:43Z","snapshot_observed_at":"2026-07-06T21:52:04.633603Z","submitted_at":"2025-07-03T18:57:43Z","title":"How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.03120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03120","snapshot_observed_at":"2026-07-01T19:36:08.899746Z","title":"M., Markeeva, L., Heyward, J., Banino, A., Mathur, M., Pascanu, R., Osindero, S., De Martino, B., Velickovic, P., et al","venue":null,"work_id":"1a830a37-4ee6-431d-8c0c-f59440590f0e","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2507.03120","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:a5aa0704fcbb42de3a93ca3cc3ffb1329969a5d27f4535877e2634a248b3199a","observation_id":"d1dde2f7-5e39-47fd-983a-ff8358f5b8e5","resolution":{"observed_at":"2026-05-21T09:44:05.642922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16221","last_updated":"2024-09-24T14:25:58Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T06:56:54Z","title":"Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.16221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.16221","snapshot_observed_at":"2026-07-08T19:55:33.960847Z","title":"Do llms know when to not answer? investigating abstention abilities of large language models.arXiv preprint arXiv:2407.16221","venue":"cs.CL","work_id":"fbe2f53d-5ccf-4007-8582-5d2688add694","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2407.16221","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:1af7d6c7e0752efb622a3ea74e7e7492b866c80ed6bb962ef8b44009e0e8c3da","observation_id":"f091fd4c-f072-403c-a475-1c593a7ef720","resolution":{"observed_at":"2026-05-21T09:44:05.697748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-06T00:58:30.657180Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":"2312.06681","doi":"10.48550/arxiv.2312.06681","metadata_source":"pith","pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":"cs.CL","work_id":"3317feaa-e788-45fc-95aa-4ea20028b55b","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:316ca43368e3f6f768cafabdb3021c7723089de93b9a545381c85bfab16569ce","observation_id":"aef1ead6-cfc4-4a16-803c-ad59249925c1","resolution":{"observed_at":"2026-05-21T09:44:05.664653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13213","last_updated":"2025-08-07T01:33:12Z","snapshot_observed_at":"2026-08-03T14:34:50.040904Z","submitted_at":"2024-02-20T18:24:47Z","title":"Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A","version":4},"cited_work":{"arxiv_id":"2402.13213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13213","snapshot_observed_at":"2026-07-02T21:07:23.912546Z","title":"Softmax probabilities (mostly) predict large language model correctness on multiple-choice q&a","venue":null,"work_id":"d46c9875-4f26-41fd-8e58-2bbb5f1f8276","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2402.13213","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:e758d3f6c493ef1dd7b6e788fc2ad34702e283849fbf34f60b5603bb9fdedc66","observation_id":"62e24b5d-6bee-4a4e-b606-6396c400275f","resolution":{"observed_at":"2026-05-21T09:44:05.679600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":"3818b7d0-42d2-4f1b-bdb8-12b54ed8b331","year":2019},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:9430a51b8b0decab76007f49b77215fd80570951a031a9ae8d9b715f7b9099e0","observation_id":"aea92f4e-fd01-4c94-9002-79c85ff8efab","resolution":{"observed_at":"2026-05-21T09:44:06.013588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-04T15:07:29.209129Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:eebab280d4e4407c0cf01f4ea84fa823035c000fb04aa489c01ce1beeeb0b098","observation_id":"c4363e52-b8a2-456a-8a84-b2de1811b75a","resolution":{"observed_at":"2026-05-21T09:44:05.678228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12877","last_updated":"2025-04-14T09:04:45Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-15T08:38:20Z","title":"Improving Instruction-Following in Language Models through Activation Steering","version":2},"cited_work":{"arxiv_id":"2410.12877","doi":"10.48550/arxiv.2410.12877","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12877","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving instruction-following in language models through activation steering.arXiv preprint arXiv:2410.12877","venue":"arXiv (Cornell University)","work_id":"8bd9335e-1da7-44b2-a5b5-92f40e8078fc","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2410.12877","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:77df4825af1ecf64346292b286ce9eab7e1d8f1c2fda308c2306daf3836753a7","observation_id":"5dfb1e7c-45b7-49f4-88b0-b96f06523101","resolution":{"observed_at":"2026-05-21T09:44:05.683170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-07-06T21:33:12.217704Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:6b9d2af9b6217441423a033b9c4599849c4bf774c2b9c11be72222e9627a6503","observation_id":"82d38082-ecdf-401c-8854-f51fd3962bd9","resolution":{"observed_at":"2026-05-21T09:44:05.672258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":"2305.14975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-08T10:04:51.524003Z","title":"Manning, and Chelsea Finn","venue":"cs.CL","work_id":"8617eae9-ad9f-45e0-bb23-49df5b429be6","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:851951e78f61b1805e787a14ce1feadde034828b48a99e901b42e8f38290f6e7","observation_id":"c860152e-3ff7-4350-a450-6abed1da25e8","resolution":{"observed_at":"2026-05-21T09:44:05.651338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17234","last_updated":"2024-10-22T17:54:03Z","snapshot_observed_at":"2026-07-06T19:38:00.663759Z","submitted_at":"2024-10-22T17:54:03Z","title":"Fine-Tuning Large Language Models to Appropriately Abstain with Semantic Entropy","version":1},"cited_work":{"arxiv_id":"2410.17234","doi":"10.48550/arxiv.2410.17234","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning large language models to appropriately abstain with semantic entropy.arXiv preprint arXiv:2410.17234","venue":"arXiv (Cornell University)","work_id":"9301f54f-01de-444a-8341-21367db8fda1","year":null},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2410.17234","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:1b0c1f5fcae416e55308759991a9ba1d0ab5b5c30acb497a15f142966f713653","observation_id":"56a8d8cf-3450-4091-87fd-117dcfb5e0c5","resolution":{"observed_at":"2026-05-21T09:44:05.676218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10960","last_updated":"2024-04-16T23:56:38Z","snapshot_observed_at":"2026-07-06T18:01:14.416754Z","submitted_at":"2024-04-16T23:56:38Z","title":"Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations","version":1},"cited_work":{"arxiv_id":"2404.10960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10960","snapshot_observed_at":"2026-07-04T10:09:44.074543Z","title":"Uncertainty- based abstention in llms improves safety and reduces hallucinations.arXiv preprint arXiv:2404.10960","venue":null,"work_id":"a984aa6e-1672-471e-a85e-c5f862bb76a7","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2404.10960","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:0d95f5e79eb39839cfbc3ab16247a4bcd5d648bd107e7dc76c1e04a213cdc373","observation_id":"f869d2c4-6ddf-4f0a-99f6-b503deed5e67","resolution":{"observed_at":"2026-05-21T09:44:05.657840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":"2308.10248","doi":"10.18653/v1/2024.findings-acl.611","metadata_source":"pith","pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Language Models With Activation Engineering","venue":"cs.CL","work_id":"d525fe06-5560-4e97-86fc-7a0e551f5b17","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:57942ebba6eb0e543972750f92306be4c7b0b132d191b2afd9d0ab999e9d9740","observation_id":"38e1e6ec-1851-41aa-a05d-87d3749a595a","resolution":{"observed_at":"2026-05-21T09:44:05.675051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:fac7974ff60a3964ebf3e0ac33f7e6ee52c28a2ac105b59f5c491b76767bddac","observation_id":"a2229f91-e9b7-4dba-96af-229625db583b","resolution":{"observed_at":"2026-05-21T09:44:05.701288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12452","last_updated":"2024-10-06T05:55:28Z","snapshot_observed_at":"2026-08-01T20:05:44.917389Z","submitted_at":"2024-04-18T18:26:43Z","title":"Characterizing LLM Abstention Behavior in Science QA with Context Perturbations","version":2},"cited_work":{"arxiv_id":"2404.12452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12452","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Characterizing llm abstention behavior in science qa with context perturbations.arXiv preprint arXiv:2404.12452","venue":null,"work_id":"0969b73f-0200-488c-a94b-d3eb81b5e68d","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2404.12452","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:6bd0b9f26b528af3fdd2dd2baf170b00ae7c3ca430f55fba04e2cb9bf3662fd7","observation_id":"3c8e1160-e5ab-45d5-8497-e068c2e1bf4f","resolution":{"observed_at":"2026-05-21T09:44:05.654008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":"2306.13063","doi":"10.48550/arxiv.2306.13063","metadata_source":"pith","pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","venue":"cs.CL","work_id":"7c5c5f6d-fd68-4f65-ac05-5d90308e8bc2","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:cbe51402ae6a37ce1ae1d2d5c7a870dab1098b55c62364adc510585910c76dff","observation_id":"707623d4-48dd-472a-9185-5aafe577e0ac","resolution":{"observed_at":"2026-05-21T09:44:05.672847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:07.82596+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:07.82596+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01563","last_updated":"2024-04-04T11:32:03Z","snapshot_observed_at":"2026-07-06T18:09:00.688840Z","submitted_at":"2024-04-04T11:32:03Z","title":"Mitigating LLM Hallucinations via Conformal Abstention","version":1},"cited_work":{"arxiv_id":"2405.01563","doi":"10.48550/arxiv.2405.01563","metadata_source":"pith","pith_arxiv_id":"2405.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating LLM hallucinations via conformal abstention, 4 2024","venue":"cs.LG","work_id":"b776d949-6f20-4359-bee3-56d21bd58524","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2405.01563","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:9857441eb1c5c4c3f2e06a84a429d6b4613e38922e80cfcfddb7273a7e32f518","observation_id":"8eda5362-cc03-4d7c-b667-aec3e623f73a","resolution":{"observed_at":"2026-05-21T09:44:05.712207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-tuning: Instructing large language models to say ‘i don’t know’","venue":null,"work_id":"d0b48c8d-11ed-433e-a3d3-0350a4d0ada1","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:e2745102800ec470961e23ecf41a3a0d3919ef7e2df4169490957ca939c89dbf","observation_id":"ebf0cbaa-2f24-40b2-b25f-082e3e491f97","resolution":{"observed_at":"2026-05-21T09:44:06.016675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DK carried out the experiments and analysis with input from ND","venue":null,"work_id":"99443f16-031a-4544-b702-0851ae685c43","year":2020},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:c15d540df585ab167e9dccbc3f64013f4f8ac3dea4216dbd84d5fce25fa3cc8d","observation_id":"b2d9cf28-e035-4d59-a349-365a5aeb5922","resolution":{"observed_at":"2026-05-21T09:44:06.018937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"baked in","venue":null,"work_id":"83d89986-6d2a-43d6-88d1-eef7ed1cff5b","year":1955},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:5a338efe67ec00e15f7d1b875e1e705bbfdb6502c7da930bf5074afe48e33e6a","observation_id":"9ede41af-6b12-411e-ad3d-2a945c873704","resolution":{"observed_at":"2026-05-21T09:44:06.005408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"87428db7-3bd4-4880-8896-cfa9aea727e8","year":2017},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:0aea84292084c29735d16ca7df996b35b307a451cbd3536c43f920dff0d8867c","observation_id":"37764020-a0dd-44ef-9e92-3e193a6a1f14","resolution":{"observed_at":"2026-05-21T09:44:06.009862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T:χ 2(1) = 391.82, p < .001 Threshold + Difficulty 9824.5 0.355 – Full (T + Confidence + Difficulty) 9544.4 0.374 vs","venue":null,"work_id":"1d1a20cf-e9f6-49b8-aead-254ff4df960a","year":2017},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:aa7ed238adacfc5d3bfd8f540a9b6cd6447710743b175cc1ca51411a501d9ccd","observation_id":"88975484-71b7-4ea6-a4e1-beeea7248dcc","resolution":{"observed_at":"2026-05-21T09:44:06.002412Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T:χ 2(1) = 445.93, p < .001 Threshold + Difficulty 13540.5 0.109 – Full (T + Confidence + Difficulty) 13206.1 0.132 vs","venue":null,"work_id":"b92f732a-d5df-4a67-bea6-0bd21ef8c57b","year":2017},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:eec13ee290c58ef3caad3f0c46a436a68416dd68b488ba783a6d7aa24de37f7d","observation_id":"0dc13d63-fcf6-41b2-b34c-b98129595c30","resolution":{"observed_at":"2026-05-21T09:44:06.007471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T02:25:28.537505Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":2,"verified_exact":19,"verified_fuzzy":7},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2603.22161."}