Pith. sign in

Paper Citation Record · LEDGER

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies

As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.08739.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.08739 v1

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:55:30.393560Z

measured 39 of 39 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T18:23:44.678678Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-10T05:30:23.456663Z

Reference resolution

38 of 38 outbound references displayed

  • verified exact5
  • verified fuzzy3
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-10T05:30:23.456663Z

Outbound references

Observation a733924c-106f-4655-8e8c-71c98e1a739e · outbound

This paper cites Transformers need glasses! Information over-squashing in language tasks.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Transformers need glasses! Information over-squashing in language tasks

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.206042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.206042Z digest=sha256:b2a8fdc71112726ed40a56e41e2de67abc9b5e13cfaed2a7dec039b826282f4f

Observation e6a2cfb6-78c1-4c5b-9232-f5670eba3b08 · outbound

This paper cites Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.211798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.211798Z digest=sha256:a114d7d04b9e5eb02acb7934ec60e09586a5d9a804f2117d0b5012f01dcb702c

Observation c5f06101-3f10-438f-8422-08fe507427b7 · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.134546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.221096Z digest=sha256:185a2abe769da426636bf7d763adc0612dfa91c23c317f3512a907403d90f714

Observation 283dedff-e6e6-4844-8a78-bc6f52442989 · outbound

This paper cites What Does BERT Look At? An Analysis of BERT's Attention.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies What Does BERT Look At? An Analysis of BERT's Attention

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.226418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.226418Z digest=sha256:c2a0e13b1b64b3706d4d42394b0143486e9de0e1373b288f6a4101ab3b6c124e

Observation 226c6591-d60e-4527-8a9b-b62eba8c90ac · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.231641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.231641Z digest=sha256:5fee3477a8247d737ad4a687851dc232971221d27db1146906cb041f246d8ae4

Observation 74d589e9-8f46-46a0-82fd-72542bea5cd3 · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.119833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.236283Z digest=sha256:d64a3adb9103202bd654cce74af2259ce7b753f8ac7e246716c6cbeb87a335f4

Observation 6f69d531-9a34-4972-9e2d-5aa9da9c6be6 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.240978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.240978Z digest=sha256:1a99f159887fc7563beed39258f87e4bc7f523f01986ace25c2cba5af75211ee

Observation 4a9caec3-14a8-4f89-b197-6c5dcb1d0a19 · outbound

This paper cites When Attention Sink Emerges in Language Models: An Empirical View.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies When Attention Sink Emerges in Language Models: An Empirical View

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.245746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.245746Z digest=sha256:d4b3ad39c6ccb38b6b6977c81bd259b9a37721b85ba50ed7af659360a82ceb69

Observation 077a36b1-e262-42be-835c-956915f151bf · outbound

This paper cites A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.250184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.250184Z digest=sha256:c80d647925251c2c90ca02aa911716f1984536432fa0e9f72f742149c93c586b

Observation 89600225-6c25-434d-a726-6362d2be766e · outbound

This paper cites Mission: Impossible Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Mission: Impossible Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.255464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.255464Z digest=sha256:cbf588517f0ad5bb01ca2ddb627067b2e3670511faff69073b71951e018b1db7

Observation 736c7fb1-7e7c-4a9d-80ab-78ffc46ba80d · outbound

This paper cites Similarity of Neural Network Representations Revisited.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Similarity of Neural Network Representations Revisited

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.260719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.260719Z digest=sha256:ed871b8e2fa2487cb40e321addab58a5891e12de838ff3ed8e291610831130dc

Observation a2171461-cc00-4334-a098-58ca7d770c1e · outbound

This paper cites Revealing the Dark Secrets of BERT.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Revealing the Dark Secrets of BERT

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.265539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.265539Z digest=sha256:d33c173b5ea62b1e1e27da3acb63c13bfc1fb4d230b18db68b2ed7c48f1336f5

Observation 12303b82-072d-40c0-9738-72bfa7997b70 · outbound

This paper cites Learned feature representations are biased by complexity, learning order, position, and more.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Learned feature representations are biased by complexity, learning order, position, and more

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.270899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.270899Z digest=sha256:42c3cf5ed16dba89307626012b63fe8d22690d8c8b96f3abede65d43c3d4b2e0

Observation 155f6cd4-8939-43ca-9c1c-8aa3dd05042e · outbound

This paper cites Lanham, A.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lanham, A

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.105143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.276171Z digest=sha256:d050a7b0a78da00746d0609a914601c6d6a3520cd372381a26eae003298d6492

Observation 6c531921-cbbc-4b7e-9aa5-3eefe5df6e2c · outbound

This paper cites Latuske, O.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Latuske, O

Reference 15

Resolution
verified exact
doi, observed 2026-08-15T21:55:30.435744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.282814Z digest=sha256:80fdb3c152c9e425f9db988851b7f462a7532ffac80d2e8dcc22141f367d8559

Observation 8d88fff7-e6d0-4dfc-95c1-87d87ff0e180 · outbound

This paper cites Lindsey, W.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lindsey, W

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.088112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.287661Z digest=sha256:1a72d120bd2f6f62784784172dedb35ad01bf183e72d6cb43574dba3efd8f36f

Observation a7902b05-5551-4a13-a88c-706cc0fc8b2e · outbound

This paper cites Lost in the Middle: How Language Models Use Long Contexts.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Lost in the Middle: How Language Models Use Long Contexts

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.292686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.292686Z digest=sha256:803a8ae9d3b0fcdffc3d6a04a7eb792e453c7ae181353ecba88d4585254b1a3d

Observation 016b593b-6917-40b0-8545-660d1adb8cc6 · outbound

This paper cites Decoupled Weight Decay Regularization.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Decoupled Weight Decay Regularization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.297936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.297936Z digest=sha256:4c3da299ffb3f13a7d563dc1faaa7bfbf6dbec5ca83a5a0033c64b74cf8c317f

Observation 81942729-5e82-4a06-9333-15e05da5822f · outbound

This paper cites Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.827109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.302862Z digest=sha256:1ef198c031dc49a26a4f7feea96178e5cd8edc51cf193c93b699b5da0fcd4335

Observation b855ae7a-9456-401c-8fe7-ab853e01b1dd · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.307534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.307534Z digest=sha256:2617fffbebcf0b54d9e5965982db3045918ba58b91235e6f682a664ea5aeadf5

Observation 0eafe867-246e-4e03-9128-04884db05b1a · outbound

This paper cites Matching domain experts by training from scratch on domain knowledge.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Matching domain experts by training from scratch on domain knowledge

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.311841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.311841Z digest=sha256:d8f68a77afc8b6e1af991b926d1a91e6da3a1a62db81e27160d3ad1d4522dcd4

Observation 871622b7-2304-4fcb-bae3-8e1e0b4f5c19 · outbound

This paper cites Meet in the Middle: A New Pre-training Paradigm.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Meet in the Middle: A New Pre-training Paradigm

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.317131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.317131Z digest=sha256:e4828281e04541f67f90791129832fee81fbb60714e4a9b89bc2c2326214ccb3

Observation b271b2fc-bcc5-42a6-a855-9baca31ec467 · outbound

This paper cites Arrows of Time for Large Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Arrows of Time for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.321953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.321953Z digest=sha256:ef5e0e71694f77d9cef69aa7e96bd0d4f0856458bf811f4bb3fe58621ae7f446

Observation 6e509b24-0af0-4b17-bc1a-e906eeadbb6a · outbound

This paper cites an unresolved cited work.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:31.062315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.327182Z digest=sha256:482775549f77cd9e0eab383103b3fc77b199ba8dca7eba086a197d3bd085cef6

Observation 013b853b-7c57-41e8-b0a9-d34ad3f2b42d · outbound

This paper cites cosFormer: Rethinking Softmax in Attention.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies cosFormer: Rethinking Softmax in Attention

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.331848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.331848Z digest=sha256:33a6712ef9cc3c1af0258fae57dce16c4a32276f2d286a7384bcfd7952285b82

Observation 45aa393a-bb3e-4b2e-a8c7-ff1a13097f2a · outbound

This paper cites Radford, J.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Radford, J

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:55:31.046371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.336911Z digest=sha256:4036ca61be48e1362c9c423f5fcba10a93784778f5fb68cb723e57b5ed96a32e

Observation 7f201636-f24f-49d3-8a1b-319559322fbc · outbound

This paper cites Neural Machine Translation of Rare Words with Subword Units.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Neural Machine Translation of Rare Words with Subword Units

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.341699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.341699Z digest=sha256:83b2301c1f24b5c3ff406a7607e2b2805643128939650c3c4cf97bffddc22a78

Observation 1713c8ba-a2b2-489c-926d-4e148165744f · outbound

This paper cites Attention Is All You Need.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Attention Is All You Need

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.346577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.346577Z digest=sha256:eb023429da4a0f3079c71b0a012cc39097759573088ef61d2b002e8a0ebd5d84

Observation 5e3be619-132c-4ac4-a7c9-26a60b4d3020 · outbound

This paper cites Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.351411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.351411Z digest=sha256:15dc67d300ffdd2dd2b41e5370774654158c05ca9e826ec8db14dd0d001b9cf0

Observation 51d575bc-2163-42e5-b37e-3c8813050433 · outbound

This paper cites On the Emergence of Position Bias in Transformers.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies On the Emergence of Position Bias in Transformers

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.356153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.356153Z digest=sha256:241620958d8a904252687b2cff4ecdd4fbb99538dea63d9b40b5fd0a8accbade

Observation 95184366-bf6f-4443-a025-0a7c9f62aefe · outbound

This paper cites Efficient Streaming Language Models with Attention Sinks.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Efficient Streaming Language Models with Attention Sinks

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.360829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.360829Z digest=sha256:45e2a56ebf74efd0b19865c2e1565f7a277d85692501bc925b91e64037cb2869

Observation 806f137d-e5f3-4fd8-9c8e-b5a11054d98b · outbound

This paper cites XLNet: Generalized Autoregressive Pretraining for Language Understanding.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies XLNet: Generalized Autoregressive Pretraining for Language Understanding

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.365513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.365513Z digest=sha256:4ecb8a7ffc2c8b8a5e8d97e9d54daf9730edd99cbba09f9b3dc7b389b9754325

Observation 0f2cc1dd-b0f3-4a06-98b3-da7ea2a7b94d · outbound

This paper cites Reverse Modeling in Large Language Models.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Reverse Modeling in Large Language Models

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.645448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.370292Z digest=sha256:05f18d6248bcaadb8060d438d831ae29594d113e965c7191d9d835a3b5de88e8

Observation cb7ced7d-ba12-4b48-bdbf-06d6db0d3e7e · outbound

This paper cites Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.374903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.374903Z digest=sha256:5fbbbfd28f116c72a079a0261fc573192174117d46fb9f406a651f885e091c4f

Observation 5e85dba0-d948-460a-802c-3b72210c70af · outbound

This paper cites Yáñez, X.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Yáñez, X

Reference 35

Resolution
verified exact
raw_fallback, observed 2026-08-15T21:55:30.609067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.380352Z digest=sha256:e1a18b3fc70fd2a9dae95d87cbc992bf5ab4f5171417e8f3ae6364129973211e

Observation c9b3e881-bbd8-4776-a662-4730bcf52513 · outbound

This paper cites What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:30.492374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:30.385010Z digest=sha256:e70a46ec187b1e048778f8be249ba3ff8c1ca1046d69821d2440393bcf6a7393

Observation f08cd0ed-77c0-48e7-8617-d1630e0cc30f · outbound

This paper cites Regularizing Neural Machine Translation by Target-bidirectional Agreement.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies Regularizing Neural Machine Translation by Target-bidirectional Agreement

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.389249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.389249Z digest=sha256:51508f2d63e3754cd4c90533a4ae9e4ee8c6f04b3c6107fffdcc81181802c5ce

Observation 8b85d7fd-90ed-4166-a1c3-c4b06af2131d · outbound

This paper cites How do language models learn facts? Dynamics, curricula and hallucinations.

Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies How do language models learn facts? Dynamics, curricula and hallucinations

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:30.393560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:30.393560Z digest=sha256:f68b66a07cf423cba237ec902d7e864c3d8d27dae26c20702ddc6d67d7180edd

Pith citing papers

Observation 92ccb8a3-a49e-4abf-b3eb-504bb67d7f05 · inbound

Do Tabular Foundation Models Agree with Themselves? cites this paper.

Do Tabular Foundation Models Agree with Themselves? Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies

Reference 22

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T18:23:44.793071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T18:23:44.678678Z digest=sha256:e9726ca265693b96193408494cd59c9891f3c06fa480dea555bd5bb7f34d197a