Pith. sign in

Paper Citation Record · LEDGER

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies

As of 21 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.08739.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.08739 v1

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:55:30.393560Z

measured 39 of 39 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T18:23:44.678678Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-10T05:30:23.456663Z

Reference resolution

38 of 38 outbound references displayed

  • verified exact5
  • verified fuzzy3
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-10T05:30:23.456663Z

Outbound references

Observation a733924c-106f-4655-8e8c-71c98e1a739e · outbound

This paper cites Transformers need glasses! Information over-squashing in language tasks.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Transformers need glasses! Information over-squashing in language tasks

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.206042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.206042Z digest=sha256:2e883af5b46dfbcbab7b4a8f9cb6258d938afd2c760ba91d5264639f3af77d9f

Observation e6a2cfb6-78c1-4c5b-9232-f5670eba3b08 · outbound

This paper cites Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.211798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.211798Z digest=sha256:0a3f2a55597da659b6b3490f99f1b28f55e1cd9ed520bb0aef062309f85bbaf1

Observation c5f06101-3f10-438f-8422-08fe507427b7 · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.134546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.221096Z digest=sha256:bb8be34aa0bf284a15ea7885b42ff7b9a90972fc2b75b91617abccc57c9cdc9b

Observation 283dedff-e6e6-4844-8a78-bc6f52442989 · outbound

This paper cites What Does BERT Look At? An Analysis of BERT's Attention.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies What Does BERT Look At? An Analysis of BERT's Attention

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.226418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.226418Z digest=sha256:889facfe804e9744566bf76a7b80ae9dfe604aff5b14a01bd36b4793d5af0919

Observation 226c6591-d60e-4527-8a9b-b62eba8c90ac · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.231641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.231641Z digest=sha256:dd088890fe8bce4ac587f30f61559d28eccbc4daef3cc13b253562a25da97656

Observation 74d589e9-8f46-46a0-82fd-72542bea5cd3 · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.119833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.236283Z digest=sha256:59a12358347bfa41f720ec426e2c855fbe381ac7d2fe4ef934969fa82e5eaccc

Observation 6f69d531-9a34-4972-9e2d-5aa9da9c6be6 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.240978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.240978Z digest=sha256:b8f6e79e33241548628c0121912e1c5e936b5af3a81e8245e0a14f11bc0c7aad

Observation 4a9caec3-14a8-4f89-b197-6c5dcb1d0a19 · outbound

This paper cites When Attention Sink Emerges in Language Models: An Empirical View.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies When Attention Sink Emerges in Language Models: An Empirical View

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.245746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.245746Z digest=sha256:5198727a44a8d2669161d05b9fae2dbe2ed1bd987c92b11599bc6f75bebdd724

Observation 077a36b1-e262-42be-835c-956915f151bf · outbound

This paper cites A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.250184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.250184Z digest=sha256:e848eac17319be1f173de3779fe24728eff2628dce876e50e34f3878cf4e3378

Observation 89600225-6c25-434d-a726-6362d2be766e · outbound

This paper cites Mission: Impossible Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Mission: Impossible Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.255464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.255464Z digest=sha256:8655a58c69eba41ba9abd1706932d6c0806dc4b73f250170d8706b4639747c71

Observation 736c7fb1-7e7c-4a9d-80ab-78ffc46ba80d · outbound

This paper cites Similarity of Neural Network Representations Revisited.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Similarity of Neural Network Representations Revisited

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.260719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.260719Z digest=sha256:4b2253135c4cc0ccc79086d40d569d3121ceb2ccbae67623a20b79af76378cc8

Observation a2171461-cc00-4334-a098-58ca7d770c1e · outbound

This paper cites Revealing the Dark Secrets of BERT.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Revealing the Dark Secrets of BERT

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.265539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.265539Z digest=sha256:234798755016c1b0682f27dfd7b1053436844948d8b1714eb3c204786997e651

Observation 12303b82-072d-40c0-9738-72bfa7997b70 · outbound

This paper cites Learned feature representations are biased by complexity, learning order, position, and more.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Learned feature representations are biased by complexity, learning order, position, and more

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.270899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.270899Z digest=sha256:5c365456901075be9791a6c2748a2720cba5dcce7a10e4038724b36cf4c76e7f

Observation 155f6cd4-8939-43ca-9c1c-8aa3dd05042e · outbound

This paper cites Lanham, A.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lanham, A

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.105143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.276171Z digest=sha256:ff12eebc345c660c619bf00e2d2143f28c41f2c565c3c3b52adead3fdf3c612b

Observation 6c531921-cbbc-4b7e-9aa5-3eefe5df6e2c · outbound

This paper cites Latuske, O.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Latuske, O

Reference 15

Resolution
verified exact
doi, observed 2026-08-15T21:55:30.435744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.282814Z digest=sha256:b124323dfb9243c4fc08fc8a9d4c2df4596660484fca76bbceb74ceb9a0ca176

Observation 8d88fff7-e6d0-4dfc-95c1-87d87ff0e180 · outbound

This paper cites Lindsey, W.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lindsey, W

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.088112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.287661Z digest=sha256:22d4cd236e36c369d0667ef81caf3fb6ba18e8246c6fe4e9c6bf377c8f38e26b

Observation a7902b05-5551-4a13-a88c-706cc0fc8b2e · outbound

This paper cites Lost in the Middle: How Language Models Use Long Contexts.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lost in the Middle: How Language Models Use Long Contexts

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.292686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.292686Z digest=sha256:583954ae7af7fb465e90c79d11e836c8b0a77adefdc7285d4ea86851fba1af27

Observation 016b593b-6917-40b0-8545-660d1adb8cc6 · outbound

This paper cites Decoupled Weight Decay Regularization.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Decoupled Weight Decay Regularization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.297936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.297936Z digest=sha256:bb7e54e155bbc83a765542f7fc2cf2968c862da706cb9bf11fcaafbfbcc8bfd2

Observation 81942729-5e82-4a06-9333-15e05da5822f · outbound

This paper cites Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.827109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.302862Z digest=sha256:ffe7e5a11c61e11c00710a0edd304767406a2733eb150ad4673420eb4eabad01

Observation b855ae7a-9456-401c-8fe7-ab853e01b1dd · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.307534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.307534Z digest=sha256:fa08d164ce0279d138f430653fa9e233ae1f0f98bd63f4c91e68b11bcac6668e

Observation 0eafe867-246e-4e03-9128-04884db05b1a · outbound

This paper cites Matching domain experts by training from scratch on domain knowledge.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Matching domain experts by training from scratch on domain knowledge

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.311841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.311841Z digest=sha256:e5e1aba281fc337594c0a36b3826072d5e1c2a1370189fcc1b886ada0b9f9c6b

Observation 871622b7-2304-4fcb-bae3-8e1e0b4f5c19 · outbound

This paper cites Meet in the Middle: A New Pre-training Paradigm.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Meet in the Middle: A New Pre-training Paradigm

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.317131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.317131Z digest=sha256:220c7eafb6251ce47f29fc17adecbfe2fff2b73e8d574109ac705196aab6ee46

Observation b271b2fc-bcc5-42a6-a855-9baca31ec467 · outbound

This paper cites Arrows of Time for Large Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Arrows of Time for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.321953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.321953Z digest=sha256:73e4b155febff620b87832fac603a1aa17b4a3ad12d54eabc863c82316593b99

Observation 6e509b24-0af0-4b17-bc1a-e906eeadbb6a · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.062315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.327182Z digest=sha256:f199ce430fdf3c8dc275c6746bb98a1f4909001fdfd837013b3b120595e5ffdb

Observation 013b853b-7c57-41e8-b0a9-d34ad3f2b42d · outbound

This paper cites cosFormer: Rethinking Softmax in Attention.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies cosFormer: Rethinking Softmax in Attention

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.331848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.331848Z digest=sha256:3658c48a67d80e6ba875c7308110f167c524ddebe4896709e16cb3b86dea158d

Observation 45aa393a-bb3e-4b2e-a8c7-ff1a13097f2a · outbound

This paper cites Radford, J.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Radford, J

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.046371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.336911Z digest=sha256:12d3b2d3f62c25d0c42ef39bbee3b5fdf8620d21a66d7f6b86c18e0ced444901

Observation 7f201636-f24f-49d3-8a1b-319559322fbc · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Neural Machine Translation of Rare Words with Subword Units

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.341699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.341699Z digest=sha256:aef588fe66f6b5b5b09c8fff38e2cbdbb9e7c3cdd5be51f9d891cbb35817f530

Observation 1713c8ba-a2b2-489c-926d-4e148165744f · outbound

This paper cites Attention Is All You Need.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Attention Is All You Need

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.346577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.346577Z digest=sha256:c6dbfff97bf0cbb3670afb77ad4a7883fb7d0de415df9dc15b5770663480e0f8

Observation 5e3be619-132c-4ac4-a7c9-26a60b4d3020 · outbound

This paper cites Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.351411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.351411Z digest=sha256:d070fe54e47ab5d17f5c93cf0aa23f16e4335e6686f17f477f28cbee40d38242

Observation 51d575bc-2163-42e5-b37e-3c8813050433 · outbound

This paper cites On the Emergence of Position Bias in Transformers.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies On the Emergence of Position Bias in Transformers

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.356153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.356153Z digest=sha256:2deea1019b597d834b5a0645235b595030191bb1e8371257f491318259d2ed12

Observation 95184366-bf6f-4443-a025-0a7c9f62aefe · outbound

This paper cites Efficient Streaming Language Models with Attention Sinks.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Efficient Streaming Language Models with Attention Sinks

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.360829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.360829Z digest=sha256:a10c86a2262f35ea65571b8edb067272de1a1295f196cef5589f6ddfe165a93b

Observation 806f137d-e5f3-4fd8-9c8e-b5a11054d98b · outbound

This paper cites XLNet: Generalized Autoregressive Pretraining for Language Understanding.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies XLNet: Generalized Autoregressive Pretraining for Language Understanding

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.365513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.365513Z digest=sha256:9754b9a84d4752dfbe0f6bb06d224c709c200591e940db3741057eae07f7c52a

Observation 0f2cc1dd-b0f3-4a06-98b3-da7ea2a7b94d · outbound

This paper cites Reverse Modeling in Large Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Reverse Modeling in Large Language Models

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.645448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.370292Z digest=sha256:539d7bfcdb68126045e0de6e46c719320a4a3d7e56cac1716f29660db75e422d

Observation cb7ced7d-ba12-4b48-bdbf-06d6db0d3e7e · outbound

This paper cites Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.374903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.374903Z digest=sha256:3960717db1ccf77e087abdfbba1b839975c9d6d70f0113cfd2d30444aa7a68e6

Observation 5e85dba0-d948-460a-802c-3b72210c70af · outbound

This paper cites Yáñez, X.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Yáñez, X

Reference 35

Resolution
verified exact
raw_fallback, observed 2026-08-15T21:55:30.609067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.380352Z digest=sha256:b97310f8308c51cc2ef0125ac4fe04954359ced7df6c964b78af5d6879996a45

Observation c9b3e881-bbd8-4776-a662-4730bcf52513 · outbound

This paper cites What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.492374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.385010Z digest=sha256:a9d69ccf19b6b0a92d674c4095b626dfae0a14054c548bab4710331a83d60a3d

Observation f08cd0ed-77c0-48e7-8617-d1630e0cc30f · outbound

This paper cites Regularizing Neural Machine Translation by Target-bidirectional Agreement.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Regularizing Neural Machine Translation by Target-bidirectional Agreement

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.389249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.389249Z digest=sha256:a626e87363a27e13857e8bd0a182ff5bccfcbc7b71627d002fb4a64a1ae6de77

Observation 8b85d7fd-90ed-4166-a1c3-c4b06af2131d · outbound

This paper cites How do language models learn facts? Dynamics, curricula and hallucinations.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies How do language models learn facts? Dynamics, curricula and hallucinations

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.393560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.393560Z digest=sha256:3728da169c92581cafd8b243aa5b9d3d78c0f9b402045875999157a04d3ee823

Pith citing papers

Observation 92ccb8a3-a49e-4abf-b3eb-504bb67d7f05 · inbound

Do Tabular Foundation Models Agree with Themselves? cites this paper.

Do Tabular Foundation Models Agree with Themselves? Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies

Reference 22

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T18:23:44.793071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-07T18:23:44.678678Z digest=sha256:cbf0b5567e62ecadc8d46e80be55efc4bb44d751a5f4a27cca6322d548385e76