Pith. sign in

Paper Citation Record · LEDGER

Causal Evidence that Language Models use Confidence to Drive Behavior

As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2603.22161.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2603.22161 v2

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-21T09:43:05.524088Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-30T07:44:53.539382Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-06-30T08:04:28.791842Z

Reference resolution

31 of 31 outbound references displayed

  • verified exact19
  • verified fuzzy7
  • unresolved2
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f7308fc9-0d04-40a0-95c2-172a147433e0 · outbound

This paper cites Emergent introspective awareness in large language models.https://transformer-circuits.

Causal Evidence that Language Models use Confidence to Drive Behavior Emergent introspective awareness in large language models.https://transformer-circuits

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.010719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:297207301d1b36af0f5a67d19cbe2f34d9b890c07ef860b636973144ad00e480

Observation 86e942f4-f9a0-4d2b-bff0-b8cac6159c32 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Causal Evidence that Language Models use Confidence to Drive Behavior On the Opportunities and Risks of Foundation Models

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.689507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:4468571e8b8a5adf8e3228daba7fb8bd34d5b7eea97928671fe6a796b1d30225

Observation 3eae1ae1-2b90-47f0-8fef-0bec7d8477ec · outbound

This paper cites Learning to Route LLMs with Confidence Tokens.

Causal Evidence that Language Models use Confidence to Drive Behavior Learning to Route LLMs with Confidence Tokens

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.693586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:e71899c18fa70be54c8c0868511f352042765d587a6da05f9e2d26a41b0e889b

Observation 6b8b511d-cb66-4a6b-9920-2d0dc35e0759 · outbound

This paper cites How contextual are contextualized word representations? comparing the geometry of BERT, ELMo, and GPT-2 embeddings.

Causal Evidence that Language Models use Confidence to Drive Behavior How contextual are contextualized word representations? comparing the geometry of BERT, ELMo, and GPT-2 embeddings

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:05.995667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:272a85b53705baf228610ffbb5a0f1002b0261c2c78db60ffa14a8d0a39d9213

Observation 4ecf6f20-63b9-4d3a-90bb-e7819b50dd14 · outbound

This paper cites arXiv preprint arXiv:2510.20487 , year =.

Causal Evidence that Language Models use Confidence to Drive Behavior arXiv preprint arXiv:2510.20487 , year =

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.661418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:149505bba0b9bbf743596f72f9086d7aeee9710b1ab8af31c5da94abb9a55394

Observation a230a5ef-8473-48e2-9756-984cf68c438e · outbound

This paper cites an unresolved cited work.

Causal Evidence that Language Models use Confidence to Drive Behavior Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-05-21T09:44:06.014528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:d9579610f6c2b5eefe7a2f5193dcdf0b723aa001e1189e492a77bebac1a9e8a4

Observation e98251f9-7940-4836-8963-eac4a6166453 · outbound

This paper cites Language Models (Mostly) Know What They Know.

Causal Evidence that Language Models use Confidence to Drive Behavior Language Models (Mostly) Know What They Know

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.704774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:8a9978ac0bcd97288c0f7661fad3410e5c37b40beb21bc18995909734c98eb47

Observation 6d145a09-a089-4a57-b2ac-73c88462ef51 · outbound

This paper cites Why Language Models Hallucinate.

Causal Evidence that Language Models use Confidence to Drive Behavior Why Language Models Hallucinate

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.686530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:c0ee2d567ab2de4ded9dab31a6ed9a2dba2711f3fe43c8761528ec4d41306b70

Observation aff98b5a-48b7-42cc-b2d0-b06ea3806efc · outbound

This paper cites AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions.

Causal Evidence that Language Models use Confidence to Drive Behavior AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.708549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:a8625710e74c02741a7a42b394378ce8fc71a628736cb89668b79ba5d25e1f52

Observation d1dde2f7-5e39-47fd-983a-ff8358f5b8e5 · outbound

This paper cites How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models.

Causal Evidence that Language Models use Confidence to Drive Behavior How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-21T09:44:05.642922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:a5aa0704fcbb42de3a93ca3cc3ffb1329969a5d27f4535877e2634a248b3199a

Observation f091fd4c-f072-403c-a475-1c593a7ef720 · outbound

This paper cites Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models.

Causal Evidence that Language Models use Confidence to Drive Behavior Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.697748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:1af7d6c7e0752efb622a3ea74e7e7492b866c80ed6bb962ef8b44009e0e8c3da

Observation aef1ead6-cfc4-4a16-803c-ad59249925c1 · outbound

This paper cites Steering Llama 2 via Contrastive Activation Addition.

Causal Evidence that Language Models use Confidence to Drive Behavior Steering Llama 2 via Contrastive Activation Addition

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.664653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:316ca43368e3f6f768cafabdb3021c7723089de93b9a545381c85bfab16569ce

Observation 62e24b5d-6bee-4a4e-b606-6396c400275f · outbound

This paper cites Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A.

Causal Evidence that Language Models use Confidence to Drive Behavior Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.679600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:e758d3f6c493ef1dd7b6e788fc2ad34702e283849fbf34f60b5603bb9fdedc66

Observation aea92f4e-fd01-4c94-9002-79c85ff8efab · outbound

This paper cites Sentence-BERT: Sentence embeddings using Siamese BERT-networks.

Causal Evidence that Language Models use Confidence to Drive Behavior Sentence-BERT: Sentence embeddings using Siamese BERT-networks

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.013588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:9430a51b8b0decab76007f49b77215fd80570951a031a9ae8d9b715f7b9099e0

Observation c4363e52-b8a2-456a-8a84-b2de1811b75a · outbound

This paper cites Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting.

Causal Evidence that Language Models use Confidence to Drive Behavior Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.678228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:eebab280d4e4407c0cf01f4ea84fa823035c000fb04aa489c01ce1beeeb0b098

Observation 5dfb1e7c-45b7-49f4-88b0-b96f06523101 · outbound

This paper cites Improving Instruction-Following in Language Models through Activation Steering.

Causal Evidence that Language Models use Confidence to Drive Behavior Improving Instruction-Following in Language Models through Activation Steering

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.683170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:77df4825af1ecf64346292b286ce9eab7e1d8f1c2fda308c2306daf3836753a7

Observation 82d38082-ecdf-401c-8854-f51fd3962bd9 · outbound

This paper cites Revisiting Uncertainty Estimation and Calibration of Large Language Models.

Causal Evidence that Language Models use Confidence to Drive Behavior Revisiting Uncertainty Estimation and Calibration of Large Language Models

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.672258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:6b9d2af9b6217441423a033b9c4599849c4bf774c2b9c11be72222e9627a6503

Observation c860152e-3ff7-4350-a450-6abed1da25e8 · outbound

This paper cites Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback.

Causal Evidence that Language Models use Confidence to Drive Behavior Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-21T09:44:05.651338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:851951e78f61b1805e787a14ce1feadde034828b48a99e901b42e8f38290f6e7

Observation 56a8d8cf-3450-4091-87fd-117dcfb5e0c5 · outbound

This paper cites Fine-Tuning Large Language Models to Appropriately Abstain with Semantic Entropy.

Causal Evidence that Language Models use Confidence to Drive Behavior Fine-Tuning Large Language Models to Appropriately Abstain with Semantic Entropy

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.676218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:1b0c1f5fcae416e55308759991a9ba1d0ab5b5c30acb497a15f142966f713653

Observation f869d2c4-6ddf-4f0a-99f6-b503deed5e67 · outbound

This paper cites Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations.

Causal Evidence that Language Models use Confidence to Drive Behavior Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.657840Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:0d95f5e79eb39839cfbc3ab16247a4bcd5d648bd107e7dc76c1e04a213cdc373

Observation 38e1e6ec-1851-41aa-a05d-87d3749a595a · outbound

This paper cites Steering Language Models With Activation Engineering.

Causal Evidence that Language Models use Confidence to Drive Behavior Steering Language Models With Activation Engineering

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.675051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:57942ebba6eb0e543972750f92306be4c7b0b132d191b2afd9d0ab999e9d9740

Observation a2229f91-e9b7-4dba-96af-229625db583b · outbound

This paper cites Measuring short-form factuality in large language models.

Causal Evidence that Language Models use Confidence to Drive Behavior Measuring short-form factuality in large language models

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.701288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:fac7974ff60a3964ebf3e0ac33f7e6ee52c28a2ac105b59f5c491b76767bddac

Observation 3c8e1160-e5ab-45d5-8497-e068c2e1bf4f · outbound

This paper cites Characterizing LLM Abstention Behavior in Science QA with Context Perturbations.

Causal Evidence that Language Models use Confidence to Drive Behavior Characterizing LLM Abstention Behavior in Science QA with Context Perturbations

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.654008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:6bd0b9f26b528af3fdd2dd2baf170b00ae7c3ca430f55fba04e2cb9bf3662fd7

Observation 707623d4-48dd-472a-9185-5aafe577e0ac · outbound

This paper cites Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs.

Causal Evidence that Language Models use Confidence to Drive Behavior Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-21T09:44:05.672847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:cbe51402ae6a37ce1ae1d2d5c7a870dab1098b55c62364adc510585910c76dff

Observation 8eda5362-cc03-4d7c-b667-aec3e623f73a · outbound

This paper cites Mitigating LLM Hallucinations via Conformal Abstention.

Causal Evidence that Language Models use Confidence to Drive Behavior Mitigating LLM Hallucinations via Conformal Abstention

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:44:05.712207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:9857441eb1c5c4c3f2e06a84a429d6b4613e38922e80cfcfddb7273a7e32f518

Observation ebf0cbaa-2f24-40b2-b25f-082e3e491f97 · outbound

This paper cites R-tuning: Instructing large language models to say ‘i don’t know’.

Causal Evidence that Language Models use Confidence to Drive Behavior R-tuning: Instructing large language models to say ‘i don’t know’

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.016675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:e2745102800ec470961e23ecf41a3a0d3919ef7e2df4169490957ca939c89dbf

Observation b2d9cf28-e035-4d59-a349-365a5aeb5922 · outbound

This paper cites DK carried out the experiments and analysis with input from ND.

Causal Evidence that Language Models use Confidence to Drive Behavior DK carried out the experiments and analysis with input from ND

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.018937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:c15d540df585ab167e9dccbc3f64013f4f8ac3dea4216dbd84d5fce25fa3cc8d

Observation 9ede41af-6b12-411e-ad3d-2a945c873704 · outbound

This paper cites baked in.

Causal Evidence that Language Models use Confidence to Drive Behavior baked in

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.005408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:5a338efe67ec00e15f7d1b875e1e705bbfdb6502c7da930bf5074afe48e33e6a

Observation 37764020-a0dd-44ef-9e92-3e193a6a1f14 · outbound

This paper cites an unresolved cited work.

Causal Evidence that Language Models use Confidence to Drive Behavior Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-05-21T09:44:06.009862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:0aea84292084c29735d16ca7df996b35b307a451cbd3536c43f920dff0d8867c

Observation 88975484-71b7-4ea6-a4e1-beeea7248dcc · outbound

This paper cites T:χ 2(1) = 391.82, p < .001 Threshold + Difficulty 9824.5 0.355 – Full (T + Confidence + Difficulty) 9544.4 0.374 vs.

Causal Evidence that Language Models use Confidence to Drive Behavior T:χ 2(1) = 391.82, p < .001 Threshold + Difficulty 9824.5 0.355 – Full (T + Confidence + Difficulty) 9544.4 0.374 vs

Reference 30

Resolution
malformed identifier
raw_fallback, observed 2026-05-21T09:44:06.002412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:aa7ed238adacfc5d3bfd8f540a9b6cd6447710743b175cc1ca51411a501d9ccd

Observation 0dc13d63-fcf6-41b2-b34c-b98129595c30 · outbound

This paper cites T:χ 2(1) = 445.93, p < .001 Threshold + Difficulty 13540.5 0.109 – Full (T + Confidence + Difficulty) 13206.1 0.132 vs.

Causal Evidence that Language Models use Confidence to Drive Behavior T:χ 2(1) = 445.93, p < .001 Threshold + Difficulty 13540.5 0.109 – Full (T + Confidence + Difficulty) 13206.1 0.132 vs

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T09:44:06.007471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T09:43:05.524088Z digest=sha256:eec13ee290c58ef3caad3f0c46a436a68416dd68b488ba783a6d7aa24de37f7d

Pith citing papers

Observation c486f0ec-ae54-4a30-9aa5-31f3b2cd4f39 · inbound

Reported Confidence in LLMs Tracks Commitment More Than Correctness cites this paper.

Reported Confidence in LLMs Tracks Commitment More Than Correctness Causal Evidence that Language Models use Confidence to Drive Behavior

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-06-30T08:04:28.793227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T07:44:53.539382Z digest=sha256:043891f60e17e18feb2a5b8eac4f7de402419610c93341516a99aa8a79b02aeb