{"as_of":"2026-08-17T20:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28021becd99e0a6cada36479d270fb7eed94a461fd3f56577d8e37e14ec2c687","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:55:30.393560Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:23:44.678678Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-10T05:30:23.456663Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-10T05:30:23.456663Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"cited_work":{"arxiv_id":"2505.08739","doi":"10.48550/arxiv.2505.08739","metadata_source":"pith","pith_arxiv_id":"2505.08739","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","venue":"cs.CL","work_id":"e4217b79-8469-4555-8650-5f6f4ccb8b9c","year":2025},"citing_paper":{"arxiv_id":"2608.06004","last_updated":"2026-08-06T13:09:54Z","snapshot_observed_at":"2026-08-14T21:01:18.715161Z","submitted_at":"2026-08-06T13:09:54Z","title":"Do Tabular Foundation Models Agree with Themselves?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T18:23:44.678678Z"},"links":{"cited_paper":"/paper/2505.08739","citing_paper":"/paper/2608.06004"},"observation_digest":"sha256:e9726ca265693b96193408494cd59c9891f3c06fa480dea555bd5bb7f34d197a","observation_id":"92ccb8a3-a49e-4abf-b3eb-504bb67d7f05","resolution":{"observed_at":"2026-08-07T18:23:44.793071Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.08739/citation-record","integrity":"/paper/2505.08739/integrity","json":"/paper/2505.08739/citation-record.json","paper":"/paper/2505.08739"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04267","last_updated":"2024-10-24T23:12:55Z","snapshot_observed_at":"2026-08-16T13:45:26.445561Z","submitted_at":"2024-06-06T17:14:44Z","title":"Transformers need glasses! Information over-squashing in language tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04267","snapshot_observed_at":"2026-08-15T21:55:30.206042Z","title":"Barbero, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.206042Z"},"links":{"cited_paper":"/paper/2406.04267","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:b2a8fdc71112726ed40a56e41e2de67abc9b5e13cfaed2a7dec039b826282f4f","observation_id":"a733924c-106f-4655-8e8c-71c98e1a739e","resolution":{"observed_at":"2026-08-15T21:55:30.206042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12929","last_updated":"2023-11-09T14:05:51Z","snapshot_observed_at":"2026-08-16T15:21:55.951351Z","submitted_at":"2023-06-22T14:39:04Z","title":"Quantizable Transformers: Removing Outliers by Helping Attention Heads Do Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12929","snapshot_observed_at":"2026-08-15T21:55:30.211798Z","title":"Bondarenko, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.211798Z"},"links":{"cited_paper":"/paper/2306.12929","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:a114d7d04b9e5eb02acb7934ec60e09586a5d9a804f2117d0b5012f01dcb702c","observation_id":"e6a2cfb6-78c1-4c5b-9232-f5670eba3b08","resolution":{"observed_at":"2026-08-15T21:55:30.211798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.129168Z","title":null,"venue":null,"work_id":"7d956de9-2f66-4811-993b-db59e7d8d643","year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.221096Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:185a2abe769da426636bf7d763adc0612dfa91c23c317f3512a907403d90f714","observation_id":"c5f06101-3f10-438f-8422-08fe507427b7","resolution":{"observed_at":"2026-08-15T21:55:31.134546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-15T21:55:30.226418Z","title":"Clark, U","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.226418Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:c2a0e13b1b64b3706d4d42394b0143486e9de0e1373b288f6a4101ab3b6c124e","observation_id":"283dedff-e6e6-4844-8a78-bc6f52442989","resolution":{"observed_at":"2026-08-15T21:55:30.226418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T21:55:30.231641Z","title":"Devlin, M.-W","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.231641Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:5fee3477a8247d737ad4a687851dc232971221d27db1146906cb041f246d8ae4","observation_id":"226c6591-d60e-4527-8a9b-b62eba8c90ac","resolution":{"observed_at":"2026-08-15T21:55:30.231641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.115595Z","title":null,"venue":null,"work_id":"23ea1a71-c44e-44ad-8818-8c0321ade157","year":1994},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.236283Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:d64a3adb9103202bd654cce74af2259ce7b753f8ac7e246716c6cbeb87a335f4","observation_id":"74d589e9-8f46-46a0-82fd-72542bea5cd3","resolution":{"observed_at":"2026-08-15T21:55:31.119833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T21:55:30.240978Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.240978Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:1a99f159887fc7563beed39258f87e4bc7f523f01986ace25c2cba5af75211ee","observation_id":"6f69d531-9a34-4972-9e2d-5aa9da9c6be6","resolution":{"observed_at":"2026-08-15T21:55:30.240978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-17T16:25:55.906179Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-15T21:55:30.245746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.245746Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:d4b3ad39c6ccb38b6b6977c81bd259b9a37721b85ba50ed7af659360a82ceb69","observation_id":"4a9caec3-14a8-4f89-b197-6c5dcb1d0a19","resolution":{"observed_at":"2026-08-15T21:55:30.245746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-15T21:55:30.250184Z","title":"Huang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.250184Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:c80d647925251c2c90ca02aa911716f1984536432fa0e9f72f742149c93c586b","observation_id":"077a36b1-e262-42be-835c-956915f151bf","resolution":{"observed_at":"2026-08-15T21:55:30.250184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06416","last_updated":"2024-08-02T21:59:03Z","snapshot_observed_at":"2026-08-16T14:28:01.889687Z","submitted_at":"2024-01-12T07:24:26Z","title":"Mission: Impossible Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06416","snapshot_observed_at":"2026-08-15T21:55:30.255464Z","title":"Kallini, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.255464Z"},"links":{"cited_paper":"/paper/2401.06416","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:cbf588517f0ad5bb01ca2ddb627067b2e3670511faff69073b71951e018b1db7","observation_id":"89600225-6c25-434d-a726-6362d2be766e","resolution":{"observed_at":"2026-08-15T21:55:30.255464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00414","last_updated":"2019-07-19T14:59:45Z","snapshot_observed_at":"2026-08-14T16:38:38.742173Z","submitted_at":"2019-05-01T17:57:26Z","title":"Similarity of Neural Network Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00414","snapshot_observed_at":"2026-08-15T21:55:30.260719Z","title":"Kornblith, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.260719Z"},"links":{"cited_paper":"/paper/1905.00414","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:ed871b8e2fa2487cb40e321addab58a5891e12de838ff3ed8e291610831130dc","observation_id":"736c7fb1-7e7c-4a9d-80ab-78ffc46ba80d","resolution":{"observed_at":"2026-08-15T21:55:30.260719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08593","last_updated":"2019-09-11T16:26:37Z","snapshot_observed_at":"2026-08-17T02:29:34.177459Z","submitted_at":"2019-08-21T04:27:38Z","title":"Revealing the Dark Secrets of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08593","snapshot_observed_at":"2026-08-15T21:55:30.265539Z","title":"Kovaleva, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.265539Z"},"links":{"cited_paper":"/paper/1908.08593","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:d33c173b5ea62b1e1e27da3acb63c13bfc1fb4d230b18db68b2ed7c48f1336f5","observation_id":"a2171461-cc00-4334-a098-58ca7d770c1e","resolution":{"observed_at":"2026-08-15T21:55:30.265539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05847","last_updated":"2024-09-20T23:11:44Z","snapshot_observed_at":"2026-08-16T13:54:00.160846Z","submitted_at":"2024-05-09T15:34:15Z","title":"Learned feature representations are biased by complexity, learning order, position, and more","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05847","snapshot_observed_at":"2026-08-15T21:55:30.270899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.270899Z"},"links":{"cited_paper":"/paper/2405.05847","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:42c3cf5ed16dba89307626012b63fe8d22690d8c8b96f3abede65d43c3d4b2e0","observation_id":"12303b82-072d-40c0-9738-72bfa7997b70","resolution":{"observed_at":"2026-08-15T21:55:30.270899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.098906Z","title":"Lanham, A","venue":null,"work_id":"55b24830-a3f3-4c96-a308-8e9475f7cf7a","year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.276171Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:d050a7b0a78da00746d0609a914601c6d6a3520cd372381a26eae003298d6492","observation_id":"155f6cd4-8939-43ca-9c1c-8aa3dd05042e","resolution":{"observed_at":"2026-08-15T21:55:31.105143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1523/jneurosci.0276-15.2015","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:30.429482Z","title":"Latuske, O","venue":null,"work_id":"f5ebb6b1-1c6d-403a-bc3c-e8550a6b0699","year":2015},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.282814Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:80fdb3c152c9e425f9db988851b7f462a7532ffac80d2e8dcc22141f367d8559","observation_id":"6c531921-cbbc-4b7e-9aa5-3eefe5df6e2c","resolution":{"observed_at":"2026-08-15T21:55:30.435744Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.082695Z","title":"Lindsey, W","venue":null,"work_id":"fd4fe14a-a55d-4d57-b059-895463243ed0","year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.287661Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:1a72d120bd2f6f62784784172dedb35ad01bf183e72d6cb43574dba3efd8f36f","observation_id":"8d88fff7-e6d0-4dfc-95c1-87d87ff0e180","resolution":{"observed_at":"2026-08-15T21:55:31.088112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-15T21:55:30.292686Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.292686Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:803a8ae9d3b0fcdffc3d6a04a7eb792e453c7ae181353ecba88d4585254b1a3d","observation_id":"a7902b05-5551-4a13-a88c-706cc0fc8b2e","resolution":{"observed_at":"2026-08-15T21:55:30.292686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T21:55:30.297936Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.297936Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:4c3da299ffb3f13a7d563dc1faaa7bfbf6dbec5ca83a5a0033c64b74cf8c317f","observation_id":"016b593b-6917-40b0-8545-660d1adb8cc6","resolution":{"observed_at":"2026-08-15T21:55:30.297936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11061","last_updated":"2024-11-17T12:48:24Z","snapshot_observed_at":"2026-08-15T13:30:54.441439Z","submitted_at":"2024-11-17T12:48:24Z","title":"Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text","version":1},"cited_work":{"arxiv_id":"2411.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11061","snapshot_observed_at":"2026-08-15T21:55:30.821831Z","title":"Beyond Human-Like Processing: Large Language Models Perform Equivalently on Forward and Backward Scientific Text","venue":"cs.CL","work_id":"534dfa93-4b69-44dc-b1cc-9739a3b19824","year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.302862Z"},"links":{"cited_paper":"/paper/2411.11061","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:1ef198c031dc49a26a4f7feea96178e5cd8edc51cf193c93b699b5da0fcd4335","observation_id":"81942729-5e82-4a06-9333-15e05da5822f","resolution":{"observed_at":"2026-08-15T21:55:30.827109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:30.307534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.307534Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:2617fffbebcf0b54d9e5965982db3045918ba58b91235e6f682a664ea5aeadf5","observation_id":"b855ae7a-9456-401c-8fe7-ab853e01b1dd","resolution":{"observed_at":"2026-08-15T21:55:30.307534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09395","last_updated":"2024-07-02T16:42:48Z","snapshot_observed_at":"2026-08-17T15:44:26.027883Z","submitted_at":"2024-05-15T14:50:51Z","title":"Matching domain experts by training from scratch on domain knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09395","snapshot_observed_at":"2026-08-15T21:55:30.311841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.311841Z"},"links":{"cited_paper":"/paper/2405.09395","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:d8f68a77afc8b6e1af991b926d1a91e6da3a1a62db81e27160d3ad1d4522dcd4","observation_id":"0eafe867-246e-4e03-9128-04884db05b1a","resolution":{"observed_at":"2026-08-15T21:55:30.311841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07295","last_updated":"2023-03-13T17:17:11Z","snapshot_observed_at":"2026-08-16T15:48:36.718414Z","submitted_at":"2023-03-13T17:17:11Z","title":"Meet in the Middle: A New Pre-training Paradigm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07295","snapshot_observed_at":"2026-08-15T21:55:30.317131Z","title":"Nguyen, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.317131Z"},"links":{"cited_paper":"/paper/2303.07295","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:e4828281e04541f67f90791129832fee81fbb60714e4a9b89bc2c2326214ccb3","observation_id":"871622b7-2304-4fcb-bae3-8e1e0b4f5c19","resolution":{"observed_at":"2026-08-15T21:55:30.317131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17505","last_updated":"2024-07-24T12:57:56Z","snapshot_observed_at":"2026-08-16T14:23:02.045441Z","submitted_at":"2024-01-30T23:46:35Z","title":"Arrows of Time for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17505","snapshot_observed_at":"2026-08-15T21:55:30.321953Z","title":"Papadopoulos, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.321953Z"},"links":{"cited_paper":"/paper/2401.17505","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:ef5e0e71694f77d9cef69aa7e96bd0d4f0856458bf811f4bb3fe58621ae7f446","observation_id":"b271b2fc-bcc5-42a6-a855-9baca31ec467","resolution":{"observed_at":"2026-08-15T21:55:30.321953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.057360Z","title":null,"venue":null,"work_id":"95c349cc-2030-42db-b5d7-057008c1d7ad","year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.327182Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:482775549f77cd9e0eab383103b3fc77b199ba8dca7eba086a197d3bd085cef6","observation_id":"6e509b24-0af0-4b17-bc1a-e906eeadbb6a","resolution":{"observed_at":"2026-08-15T21:55:31.062315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08791","last_updated":"2022-02-17T17:53:48Z","snapshot_observed_at":"2026-08-16T17:20:30.741976Z","submitted_at":"2022-02-17T17:53:48Z","title":"cosFormer: Rethinking Softmax in Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08791","snapshot_observed_at":"2026-08-15T21:55:30.331848Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.331848Z"},"links":{"cited_paper":"/paper/2202.08791","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:33a6712ef9cc3c1af0258fae57dce16c4a32276f2d286a7384bcfd7952285b82","observation_id":"013b853b-7c57-41e8-b0a9-d34ad3f2b42d","resolution":{"observed_at":"2026-08-15T21:55:30.331848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:31.041905Z","title":"Radford, J","venue":null,"work_id":"4194b167-d75f-40e0-ae39-fc03193def67","year":2019},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.336911Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:4036ca61be48e1362c9c423f5fcba10a93784778f5fb68cb723e57b5ed96a32e","observation_id":"45aa393a-bb3e-4b2e-a8c7-ff1a13097f2a","resolution":{"observed_at":"2026-08-15T21:55:31.046371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-15T21:55:30.341699Z","title":"Sennrich, B","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.341699Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:83b2301c1f24b5c3ff406a7607e2b2805643128939650c3c4cf97bffddc22a78","observation_id":"7f201636-f24f-49d3-8a1b-319559322fbc","resolution":{"observed_at":"2026-08-15T21:55:30.341699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T21:55:30.346577Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.346577Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:eb023429da4a0f3079c71b0a012cc39097759573088ef61d2b002e8a0ebd5d84","observation_id":"1713c8ba-a2b2-489c-926d-4e148165744f","resolution":{"observed_at":"2026-08-15T21:55:30.346577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-08-16T17:36:35.256420Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-15T21:55:30.351411Z","title":"Warner, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.351411Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:15dc67d300ffdd2dd2b41e5370774654158c05ca9e826ec8db14dd0d001b9cf0","observation_id":"5e3be619-132c-4ac4-a7c9-26a60b4d3020","resolution":{"observed_at":"2026-08-15T21:55:30.351411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01951","last_updated":"2025-08-09T19:48:07Z","snapshot_observed_at":"2026-08-14T08:00:15.667954Z","submitted_at":"2025-02-04T02:53:07Z","title":"On the Emergence of Position Bias in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01951","snapshot_observed_at":"2026-08-15T21:55:30.356153Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.356153Z"},"links":{"cited_paper":"/paper/2502.01951","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:241620958d8a904252687b2cff4ecdd4fbb99538dea63d9b40b5fd0a8accbade","observation_id":"51d575bc-2163-42e5-b37e-3c8813050433","resolution":{"observed_at":"2026-08-15T21:55:30.356153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-15T21:55:30.360829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.360829Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:45e2a56ebf74efd0b19865c2e1565f7a277d85692501bc925b91e64037cb2869","observation_id":"95184366-bf6f-4443-a025-0a7c9f62aefe","resolution":{"observed_at":"2026-08-15T21:55:30.360829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-15T21:55:30.365513Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.365513Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:4ecb8a7ffc2c8b8a5e8d97e9d54daf9730edd99cbba09f9b3dc7b389b9754325","observation_id":"806f137d-e5f3-4fd8-9c8e-b5a11054d98b","resolution":{"observed_at":"2026-08-15T21:55:30.365513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09817","last_updated":"2025-02-23T12:25:25Z","snapshot_observed_at":"2026-08-16T13:09:55.253895Z","submitted_at":"2024-10-13T12:24:03Z","title":"Reverse Modeling in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.09817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09817","snapshot_observed_at":"2026-08-15T21:55:30.640703Z","title":"Reverse Modeling in Large Language Models","venue":"cs.CL","work_id":"a3ff9323-d267-4ed6-80aa-5a765bb6926a","year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.370292Z"},"links":{"cited_paper":"/paper/2410.09817","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:05f18d6248bcaadb8060d438d831ae29594d113e965c7191d9d835a3b5de88e8","observation_id":"0f2cc1dd-b0f3-4a06-98b3-da7ea2a7b94d","resolution":{"observed_at":"2026-08-15T21:55:30.645448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15765","last_updated":"2024-06-22T07:00:43Z","snapshot_observed_at":"2026-08-16T13:40:33.481359Z","submitted_at":"2024-06-22T07:00:43Z","title":"Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15765","snapshot_observed_at":"2026-08-15T21:55:30.374903Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.374903Z"},"links":{"cited_paper":"/paper/2406.15765","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:5fbbbfd28f116c72a079a0261fc573192174117d46fb9f406a651f885e091c4f","observation_id":"cb7ced7d-ba12-4b48-bdbf-06d6db0d3e7e","resolution":{"observed_at":"2026-08-15T21:55:30.374903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.08083","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:30.599712Z","title":"Yáñez, X","venue":null,"work_id":"f85a1740-9807-4ec2-b2af-9699e500d1c1","year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.380352Z"},"links":{"citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:e1a18b3fc70fd2a9dae95d87cbc992bf5ab4f5171417e8f3ae6364129973211e","observation_id":"5e85dba0-d948-460a-802c-3b72210c70af","resolution":{"observed_at":"2026-08-15T21:55:30.609067Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18435","last_updated":"2025-06-27T19:00:20Z","snapshot_observed_at":"2026-08-16T12:55:16.290441Z","submitted_at":"2025-02-25T18:30:25Z","title":"What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?","version":3},"cited_work":{"arxiv_id":"2502.18435","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18435","snapshot_observed_at":"2026-08-15T21:55:30.485669Z","title":"What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?","venue":"cs.CL","work_id":"de1fe5c6-55c4-412e-a572-6ce8c91631ec","year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.385010Z"},"links":{"cited_paper":"/paper/2502.18435","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:e70a46ec187b1e048778f8be249ba3ff8c1ca1046d69821d2440393bcf6a7393","observation_id":"c9b3e881-bbd8-4776-a662-4730bcf52513","resolution":{"observed_at":"2026-08-15T21:55:30.492374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04064","last_updated":"2018-11-12T19:08:27Z","snapshot_observed_at":"2026-08-14T18:41:59.228290Z","submitted_at":"2018-08-13T05:03:42Z","title":"Regularizing Neural Machine Translation by Target-bidirectional Agreement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04064","snapshot_observed_at":"2026-08-15T21:55:30.389249Z","title":"Zhang, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.389249Z"},"links":{"cited_paper":"/paper/1808.04064","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:51508f2d63e3754cd4c90533a4ae9e4ee8c6f04b3c6107fffdcc81181802c5ce","observation_id":"f08cd0ed-77c0-48e7-8617-d1630e0cc30f","resolution":{"observed_at":"2026-08-15T21:55:30.389249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21676","last_updated":"2025-07-24T14:04:20Z","snapshot_observed_at":"2026-08-17T04:40:59.288358Z","submitted_at":"2025-03-27T16:43:45Z","title":"How do language models learn facts? Dynamics, curricula and hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21676","snapshot_observed_at":"2026-08-15T21:55:30.393560Z","title":"Zucchet, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:30.393560Z"},"links":{"cited_paper":"/paper/2503.21676","citing_paper":"/paper/2505.08739"},"observation_digest":"sha256:f68b66a07cf423cba237ec902d7e864c3d8d27dae26c20702ddc6d67d7180edd","observation_id":"8b85d7fd-90ed-4166-a1c3-c4b06af2131d","resolution":{"observed_at":"2026-08-15T21:55:30.393560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08739","last_updated":"2025-05-13T16:52:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:00:51.445749Z","submitted_at":"2025-05-13T16:52:19Z","title":"Probability Consistency in Large Language Models: Theoretical Foundations Meet Empirical Discrepancies"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":5,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.08739."}