Pith. sign in

Paper Citation Record · LEDGER

DateLogicQA: Benchmarking Temporal Biases in Large Language Models

As of 14 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2412.13377.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.13377 v2

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T13:15:34.146881Z

measured 34 of 34 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

34 of 34 outbound references displayed

  • verified exact2
  • verified fuzzy0
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3639ad6f-dd8e-40a9-a876-24108bfd38f3 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.896020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.896020Z digest=sha256:433e241e220e1671acebac3e186957c0d1e887c4d16073b5b95bbea637df28b0

Observation 8aedaf6f-161c-4481-a29f-e2fb9fcb5c84 · outbound

This paper cites Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.906119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.906119Z digest=sha256:a773a7cee94437cd446573a09f57176a061e7a9edcd8ba2e707e6e86f5d7ad5a

Observation 9fc3bbaa-8027-43ad-bd5e-a5fe445b4bb0 · outbound

This paper cites Interleaving Text and Number Embeddings to Solve Mathemathics Problems.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Interleaving Text and Number Embeddings to Solve Mathemathics Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.916058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.916058Z digest=sha256:fd06d05beeec384578e36337dd45609d269b19dcd06c980a2b9ca13d717a37b0

Observation 97527c4e-83c1-4901-a767-2b65809ed6cd · outbound

This paper cites Language Models are Few-Shot Learners.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Language Models are Few-Shot Learners

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.926142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.926142Z digest=sha256:4bd69bbed5336b338491e461ca842d4721dd46ff42f4e3e1666a2c2ea024756b

Observation c119f560-f1b9-43e7-a5e4-8218a36ca753 · outbound

This paper cites an unresolved cited work.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-11T13:15:35.193150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T13:15:33.936438Z digest=sha256:a28b05ec1f966e93c3768b590dc9296faa4969b027384781bd6d1110bc7ab293

Observation 7aee0ba4-1ff6-4d6e-8096-11e1307845a2 · outbound

This paper cites The Llama 3 Herd of Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models The Llama 3 Herd of Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.950116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.950116Z digest=sha256:4d62bef0fde0dbaee8c221762dbe56834012b394ea38778a0077e3689120fbdf

Observation 71a21248-58c0-4b15-b128-e53497781a7f · outbound

This paper cites Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.958984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.958984Z digest=sha256:197081b274fee935ac020220738d7d25291f41b994ae80eacabe4531b1951f63

Observation 6e3ca96a-2f64-43f2-b1e8-aba675c3728e · outbound

This paper cites The Foundations of Tokenization: Statistical and Computational Concerns.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models The Foundations of Tokenization: Statistical and Computational Concerns

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.965512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.965512Z digest=sha256:d91b84ff33e04546829af82a5e4e4d836b05505e886fc36982e68efd7dc826de

Observation dbc92e88-ef04-4bc5-b659-bfcae7782adb · outbound

This paper cites Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.972335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.972335Z digest=sha256:51ae3121dd9384f844d41a0de3655a1b46586daa44dcb68d06f2df5485e2173e

Observation 3fd843bf-131e-4b3d-b4b1-e20564763615 · outbound

This paper cites ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-11T13:15:34.899502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T13:15:33.979494Z digest=sha256:83b02c15c08ea7ce3ada9b8830c32f31424737cc894d248e4c2d9e6da8690cdc

Observation 2987062f-3985-42a0-a9cb-056ad6299ac4 · outbound

This paper cites Mistral 7B.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Mistral 7B

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:33.986876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:33.986876Z digest=sha256:2afc21bd433fc729d035719a6f5af17d4d91e88748cb16d5bbbc59da7d04061d

Observation 944cfa6d-db69-4621-8944-3bdc666b68ce · outbound

This paper cites Unveiling Divergent Inductive Biases of LLMs on Temporal Data.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Unveiling Divergent Inductive Biases of LLMs on Temporal Data

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-11T13:15:34.835666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T13:15:33.993447Z digest=sha256:9c788e8703a4dece720954445bdc6e24bdcba81e68661e4a8780dee4d7072ae2

Observation fa736ab2-de03-4c11-8350-8e09cf6cfe70 · outbound

This paper cites How Much Can RAG Help the Reasoning of LLM?.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models How Much Can RAG Help the Reasoning of LLM?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.000208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.000208Z digest=sha256:5748ababdfd44ab4cb89fba887f4d8bb8d63f5b6015178970a123770fd05b04e

Observation 8ae945cd-9f66-458f-988a-f1c6598b495d · outbound

This paper cites an unresolved cited work.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.013279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.013279Z digest=sha256:ee30c08d064d6f29e742df27c1405016771f371ce1315f3bc001c7605523ba59

Observation 57d51d96-236e-4787-968d-e1868fe302c0 · outbound

This paper cites GPT-4o System Card.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models GPT-4o System Card

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.018741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.018741Z digest=sha256:13bb32e1deeb6e90fcfde03bddd7b100b8bc51ec1acf28fe583c857de6bfb840

Observation fba74f2c-468e-4b91-81bf-1651dd6b1fe1 · outbound

This paper cites GPT-4 Technical Report.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models GPT-4 Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.024810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.024810Z digest=sha256:a07dd964d9f70fe3d86e461d078c36c66ab82279a03d8708640b0b6e4412f7c9

Observation 636290a4-b8b9-4fbb-8001-f49995829f29 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.030121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.030121Z digest=sha256:b3a37f44841746b27af5300d95f76a8c35e32cbad0ef54bc6ded376f466f26b5

Observation 8a3e9f07-f25e-4dec-a811-0f0467f5ba75 · outbound

This paper cites Toward a Theory of Tokenization in LLMs.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Toward a Theory of Tokenization in LLMs

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.035803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.035803Z digest=sha256:cba060ae9816b218955989c004f91aa8c17fd616390519ff6cf76a9bce0ee1cd

Observation 19f79244-ef34-435c-b3bb-2031095571a3 · outbound

This paper cites Tokenization Is More Than Compression.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Tokenization Is More Than Compression

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.043441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.043441Z digest=sha256:bccc323ef5cbb616825f04aaca86ac8c0b77340f7304d789d48433cbb744c455

Observation 05777839-e349-420c-a538-6129381bf7b8 · outbound

This paper cites Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.049927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.049927Z digest=sha256:cb5dece397c0e67b323c0d49529cb099ce3632fc0eec3e4f63cf01cc458bcbe3

Observation c155b720-4643-4d42-8301-16958bdbc26d · outbound

This paper cites Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.055526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.055526Z digest=sha256:ef9f8fb16f5c0ca387d4b708df00f4a44feb6e4e08eb2a915770a15c32e82891

Observation 3f5d0477-e022-40ff-a80e-37d32c300c29 · outbound

This paper cites Timo: Towards Better Temporal Reasoning for Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Timo: Towards Better Temporal Reasoning for Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.067071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.067071Z digest=sha256:0e21fed5483e91c852dee4ccecc12802526f94e65468c2e83c841c97de1f2d87

Observation 642a10b6-5547-44ee-bf74-42a85c14a254 · outbound

This paper cites Towards Benchmarking and Improving the Temporal Reasoning Capability of Large Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Towards Benchmarking and Improving the Temporal Reasoning Capability of Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.074398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.074398Z digest=sha256:3762cd992a760c93043ce7015794a624716a644fd7868ea3380b7f7a4119ad39

Observation 7e495ff7-ce5e-4682-a39e-176386d8d9ab · outbound

This paper cites Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.080489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.080489Z digest=sha256:0891f499d7e40f3ae62aa7c3726f1ef645e7bd44399c79d866590b30167cf2ec

Observation b93222fa-ecdb-4722-8f49-f8977a63048f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.086852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.086852Z digest=sha256:ee0a6b4499d1a59232500fdb2906ddb92918c3c5de6cda28f3eabb068eca4145

Observation 7532a3f1-0dff-4fab-9292-29a4748c7b09 · outbound

This paper cites RedPajama: an Open Dataset for Training Large Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models RedPajama: an Open Dataset for Training Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.092546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.092546Z digest=sha256:28e8c440fb1dcb96b510d4c41b82befd4d36f93cc3c2bf057e0e8681c44ab28c

Observation f0d11fb6-33d9-4827-abe4-d78f3f42b4ed · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.098672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.098672Z digest=sha256:6e46ff62e9d3d89df109a5e9aceca7102a933cff2111fb0e64b6df00a7a680d0

Observation 46188d41-63d4-4085-9ad6-7bb571f10584 · outbound

This paper cites Large Language Models Can Learn Temporal Reasoning.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Large Language Models Can Learn Temporal Reasoning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.110311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.110311Z digest=sha256:16b455348088701af64833abd9c0386976c9cca5310c5ea70f96cd53b8e8a881

Observation 04418d5d-aaf7-4fc5-b174-6fa8b5ada241 · outbound

This paper cites Qwen2 Technical Report.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Qwen2 Technical Report

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.115800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.115800Z digest=sha256:15aabd71aa8b0569979b08f31c7a6c3f7fbab039af3c64fa34394330cb6237d8

Observation b58aa1b7-0ef2-4de4-b481-44d4731dba0c · outbound

This paper cites Counting Ability of Large Language Models and Impact of Tokenization.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Counting Ability of Large Language Models and Impact of Tokenization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.122508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.122508Z digest=sha256:021fd81237384a8726dcf20e93fe52aa70b89f912a29814880f997f033cbe77d

Observation 3023a51d-8a30-4aac-bea4-2c022352ab68 · outbound

This paper cites Set the Clock: Temporal Alignment of Pretrained Language Models.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Set the Clock: Temporal Alignment of Pretrained Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.128539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.128539Z digest=sha256:33b2a200b8c1f858adce95910338028cea17eb158dedc4408cedcc4fea0fbe14

Observation c708fd36-8ff6-4453-993a-89f6ff0f3e44 · outbound

This paper cites Is Your LLM Outdated? A Deep Look at Temporal Generalization.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models Is Your LLM Outdated? A Deep Look at Temporal Generalization

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.134349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.134349Z digest=sha256:02da6b482bc1c898e7a35daa9df1983ca1f42e95416d53ae1c33cddde46884e2

Observation 95d20336-e61f-40df-b686-cb350ea3d46b · outbound

This paper cites URL: " 'urlintro :=.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models URL: " 'urlintro :=

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.140307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.140307Z digest=sha256:d7fec4eb705072ed80e94cd9efe5d555aa48d5d5a459403bb63025c576094dd4

Observation 1e2a6139-a951-448c-aa38-5fb57a2a1efc · outbound

This paper cites write newline.

DateLogicQA: Benchmarking Temporal Biases in Large Language Models write newline

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T13:15:34.146881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T13:15:34.146881Z digest=sha256:cf3702a33e5694bae5439a329137d7ed6883684590ea6c0023dd32338a130d09

Pith citing papers

No inbound Pith citation observations are available.