{"as_of":"2026-08-15T01:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:411ff252863a32b86d4bb3989abaa73b7b9a4771174ae2a286896668c39c0f0e","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:15:34.146881Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.13377/citation-record","integrity":"/paper/2412.13377/integrity","json":"/paper/2412.13377/citation-record.json","paper":"/paper/2412.13377"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T13:15:33.896020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.896020Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:433e241e220e1671acebac3e186957c0d1e887c4d16073b5b95bbea637df28b0","observation_id":"3639ad6f-dd8e-40a9-a876-24108bfd38f3","resolution":{"observed_at":"2026-08-11T13:15:33.896020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13707","last_updated":"2023-05-23T05:46:45Z","snapshot_observed_at":"2026-08-13T11:35:56.858678Z","submitted_at":"2023-05-23T05:46:45Z","title":"Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13707","snapshot_observed_at":"2026-08-11T13:15:33.906119Z","title":"Mortensen, Noah A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.906119Z"},"links":{"cited_paper":"/paper/2305.13707","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:a773a7cee94437cd446573a09f57176a061e7a9edcd8ba2e707e6e86f5d7ad5a","observation_id":"8aedaf6f-161c-4481-a29f-e2fb9fcb5c84","resolution":{"observed_at":"2026-08-11T13:15:33.906119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19353","last_updated":"2024-10-25T07:21:57Z","snapshot_observed_at":"2026-08-14T04:00:50.608243Z","submitted_at":"2024-10-25T07:21:57Z","title":"Interleaving Text and Number Embeddings to Solve Mathemathics Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19353","snapshot_observed_at":"2026-08-11T13:15:33.916058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.916058Z"},"links":{"cited_paper":"/paper/2410.19353","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:fd06d05beeec384578e36337dd45609d269b19dcd06c980a2b9ca13d717a37b0","observation_id":"9fc3bbaa-8027-43ad-bd5e-a5fe445b4bb0","resolution":{"observed_at":"2026-08-11T13:15:33.916058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T13:15:33.926142Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.926142Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:4bd69bbed5336b338491e461ca842d4721dd46ff42f4e3e1666a2c2ea024756b","observation_id":"97527c4e-83c1-4901-a767-2b65809ed6cd","resolution":{"observed_at":"2026-08-11T13:15:33.926142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:15:35.186721Z","title":null,"venue":null,"work_id":"cfa05ac7-82d3-427a-bc6d-64a9ceb891b1","year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.936438Z"},"links":{"citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:a28b05ec1f966e93c3768b590dc9296faa4969b027384781bd6d1110bc7ab293","observation_id":"c119f560-f1b9-43e7-a5e4-8218a36ca753","resolution":{"observed_at":"2026-08-11T13:15:35.193150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T13:15:33.950116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.950116Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:4d62bef0fde0dbaee8c221762dbe56834012b394ea38778a0077e3689120fbdf","observation_id":"7aee0ba4-1ff6-4d6e-8096-11e1307845a2","resolution":{"observed_at":"2026-08-11T13:15:33.950116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-14T15:08:05.651354Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-11T13:15:33.958984Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.958984Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:d5b86348f11c59b96e2cf9f72321246de761d1e915e932401fa2ab0f68367289","observation_id":"71a21248-58c0-4b15-b128-e53497781a7f","resolution":{"observed_at":"2026-08-11T13:15:33.958984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11606","last_updated":"2025-04-03T15:07:13Z","snapshot_observed_at":"2026-08-12T23:21:12.839917Z","submitted_at":"2024-07-16T11:12:28Z","title":"The Foundations of Tokenization: Statistical and Computational Concerns","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11606","snapshot_observed_at":"2026-08-11T13:15:33.965512Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.965512Z"},"links":{"cited_paper":"/paper/2407.11606","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:d91b84ff33e04546829af82a5e4e4d836b05505e886fc36982e68efd7dc826de","observation_id":"6e3ca96a-2f64-43f2-b1e8-aba675c3728e","resolution":{"observed_at":"2026-08-11T13:15:33.965512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06265","last_updated":"2024-06-22T16:00:49Z","snapshot_observed_at":"2026-08-14T01:40:35.896634Z","submitted_at":"2024-03-10T17:02:53Z","title":"Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06265","snapshot_observed_at":"2026-08-11T13:15:33.972335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.972335Z"},"links":{"cited_paper":"/paper/2403.06265","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:51ae3121dd9384f844d41a0de3655a1b46586daa44dcb68d06f2df5485e2173e","observation_id":"dbc92e88-ef04-4bc5-b659-bfcae7782adb","resolution":{"observed_at":"2026-08-11T13:15:33.972335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04335","last_updated":"2024-10-06T03:01:07Z","snapshot_observed_at":"2026-08-12T22:29:55.996464Z","submitted_at":"2024-10-06T03:01:07Z","title":"ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model","version":1},"cited_work":{"arxiv_id":"2410.04335","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04335","snapshot_observed_at":"2026-08-11T13:15:34.892740Z","title":"ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model","venue":"cs.CL","work_id":"6ebe62c5-a420-4f59-b640-8e64d0954de5","year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.979494Z"},"links":{"cited_paper":"/paper/2410.04335","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:83b02c15c08ea7ce3ada9b8830c32f31424737cc894d248e4c2d9e6da8690cdc","observation_id":"3fd843bf-131e-4b3d-b4b1-e20564763615","resolution":{"observed_at":"2026-08-11T13:15:34.899502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T13:15:33.986876Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.986876Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:2afc21bd433fc729d035719a6f5af17d4d91e88748cb16d5bbbc59da7d04061d","observation_id":"2987062f-3985-42a0-a9cb-056ad6299ac4","resolution":{"observed_at":"2026-08-11T13:15:33.986876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01453","last_updated":"2024-04-01T19:56:41Z","snapshot_observed_at":"2026-08-14T23:40:03.109687Z","submitted_at":"2024-04-01T19:56:41Z","title":"Unveiling Divergent Inductive Biases of LLMs on Temporal Data","version":1},"cited_work":{"arxiv_id":"2404.01453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01453","snapshot_observed_at":"2026-08-11T13:15:34.827086Z","title":"Unveiling Divergent Inductive Biases of LLMs on Temporal Data","venue":"cs.CL","work_id":"ebff9e6a-db92-4002-824b-f4d59c421752","year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:33.993447Z"},"links":{"cited_paper":"/paper/2404.01453","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:e1b0906308e47fc06fd3a48d390567689022e76f81d1edf9f7678bc9b18e4bde","observation_id":"944cfa6d-db69-4621-8944-3bdc666b68ce","resolution":{"observed_at":"2026-08-11T13:15:34.835666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02338","last_updated":"2024-10-04T14:59:04Z","snapshot_observed_at":"2026-08-14T07:06:03.634694Z","submitted_at":"2024-10-03T09:48:09Z","title":"How Much Can RAG Help the Reasoning of LLM?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02338","snapshot_observed_at":"2026-08-11T13:15:34.000208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.000208Z"},"links":{"cited_paper":"/paper/2410.02338","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:5748ababdfd44ab4cb89fba887f4d8bb8d63f5b6015178970a123770fd05b04e","observation_id":"fa736ab2-de03-4c11-8350-8e09cf6cfe70","resolution":{"observed_at":"2026-08-11T13:15:34.000208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:15:34.013279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.013279Z"},"links":{"citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:ee30c08d064d6f29e742df27c1405016771f371ce1315f3bc001c7605523ba59","observation_id":"8ae945cd-9f66-458f-988a-f1c6598b495d","resolution":{"observed_at":"2026-08-11T13:15:34.013279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T13:15:34.018741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.018741Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:13bb32e1deeb6e90fcfde03bddd7b100b8bc51ec1acf28fe583c857de6bfb840","observation_id":"57d51d96-236e-4787-968d-e1868fe302c0","resolution":{"observed_at":"2026-08-11T13:15:34.018741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T13:15:34.024810Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.024810Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:a07dd964d9f70fe3d86e461d078c36c66ab82279a03d8708640b0b6e4412f7c9","observation_id":"fba74f2c-468e-4b91-81bf-1651dd6b1fe1","resolution":{"observed_at":"2026-08-11T13:15:34.024810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-11T13:15:34.030121Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.030121Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:b3a37f44841746b27af5300d95f76a8c35e32cbad0ef54bc6ded376f466f26b5","observation_id":"636290a4-b8b9-4fbb-8001-f49995829f29","resolution":{"observed_at":"2026-08-11T13:15:34.030121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08335","last_updated":"2025-04-10T06:00:58Z","snapshot_observed_at":"2026-08-13T00:32:05.429828Z","submitted_at":"2024-04-12T09:01:14Z","title":"Toward a Theory of Tokenization in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08335","snapshot_observed_at":"2026-08-11T13:15:34.035803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.035803Z"},"links":{"cited_paper":"/paper/2404.08335","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:cba060ae9816b218955989c004f91aa8c17fd616390519ff6cf76a9bce0ee1cd","observation_id":"8a3e9f07-f25e-4dec-a811-0f0467f5ba75","resolution":{"observed_at":"2026-08-11T13:15:34.035803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18376","last_updated":"2024-10-07T13:17:03Z","snapshot_observed_at":"2026-08-15T01:30:15.699997Z","submitted_at":"2024-02-28T14:52:15Z","title":"Tokenization Is More Than Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18376","snapshot_observed_at":"2026-08-11T13:15:34.043441Z","title":"Schmidt, Varshini Reddy, Haoran Zhang, Alec Alameddine, Omri Uzan, Yuval Pinter, and Chris Tanner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.043441Z"},"links":{"cited_paper":"/paper/2402.18376","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:641a0606cfd8a16ecad3da19e8529561059f3a7c8381d0c33c853894e26abcba","observation_id":"19f79244-ef34-435c-b3bb-2031095571a3","resolution":{"observed_at":"2026-08-11T13:15:34.043441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14903","last_updated":"2024-02-22T18:14:09Z","snapshot_observed_at":"2026-08-13T04:12:40.706623Z","submitted_at":"2024-02-22T18:14:09Z","title":"Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14903","snapshot_observed_at":"2026-08-11T13:15:34.049927Z","title":"Singh and DJ Strouse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.049927Z"},"links":{"cited_paper":"/paper/2402.14903","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:cb5dece397c0e67b323c0d49529cb099ce3632fc0eec3e4f63cf01cc458bcbe3","observation_id":"05777839-e349-420c-a538-6129381bf7b8","resolution":{"observed_at":"2026-08-11T13:15:34.049927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-13T04:29:45.563095Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-11T13:15:34.055526Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.055526Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:ef9f8fb16f5c0ca387d4b708df00f4a44feb6e4e08eb2a915770a15c32e82891","observation_id":"c155b720-4643-4d42-8301-16958bdbc26d","resolution":{"observed_at":"2026-08-11T13:15:34.055526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14192","last_updated":"2024-08-19T03:47:16Z","snapshot_observed_at":"2026-08-14T21:57:48.704206Z","submitted_at":"2024-06-20T10:52:14Z","title":"Timo: Towards Better Temporal Reasoning for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14192","snapshot_observed_at":"2026-08-11T13:15:34.067071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.067071Z"},"links":{"cited_paper":"/paper/2406.14192","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:7f4307b2701868151eb6f45b1b7f1fc2e25641ff6166d3ba12b285b3c28b33f7","observation_id":"3f5d0477-e022-40ff-a80e-37d32c300c29","resolution":{"observed_at":"2026-08-11T13:15:34.067071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08952","last_updated":"2023-06-27T05:39:25Z","snapshot_observed_at":"2026-08-13T11:16:54.831316Z","submitted_at":"2023-06-15T08:44:41Z","title":"Towards Benchmarking and Improving the Temporal Reasoning Capability of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08952","snapshot_observed_at":"2026-08-11T13:15:34.074398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.074398Z"},"links":{"cited_paper":"/paper/2306.08952","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:3762cd992a760c93043ce7015794a624716a644fd7868ea3380b7f7a4119ad39","observation_id":"642a10b6-5547-44ee-bf74-42a85c14a254","resolution":{"observed_at":"2026-08-11T13:15:34.074398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09821","last_updated":"2024-07-12T16:37:14Z","snapshot_observed_at":"2026-08-13T05:23:56.219567Z","submitted_at":"2023-11-16T11:49:29Z","title":"Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09821","snapshot_observed_at":"2026-08-11T13:15:34.080489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.080489Z"},"links":{"cited_paper":"/paper/2311.09821","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:0891f499d7e40f3ae62aa7c3726f1ef645e7bd44399c79d866590b30167cf2ec","observation_id":"7e495ff7-ce5e-4682-a39e-176386d8d9ab","resolution":{"observed_at":"2026-08-11T13:15:34.080489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T13:15:34.086852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.086852Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:ee0a6b4499d1a59232500fdb2906ddb92918c3c5de6cda28f3eabb068eca4145","observation_id":"b93222fa-ecdb-4722-8f49-f8977a63048f","resolution":{"observed_at":"2026-08-11T13:15:34.086852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-14T07:55:53.745138Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-11T13:15:34.092546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.092546Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:28e8c440fb1dcb96b510d4c41b82befd4d36f93cc3c2bf057e0e8681c44ab28c","observation_id":"7532a3f1-0dff-4fab-9292-29a4748c7b09","resolution":{"observed_at":"2026-08-11T13:15:34.092546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-11T13:15:34.098672Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.098672Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:6e46ff62e9d3d89df109a5e9aceca7102a933cff2111fb0e64b6df00a7a680d0","observation_id":"f0d11fb6-33d9-4827-abe4-d78f3f42b4ed","resolution":{"observed_at":"2026-08-11T13:15:34.098672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06853","last_updated":"2024-10-08T15:55:37Z","snapshot_observed_at":"2026-08-13T04:43:42.826987Z","submitted_at":"2024-01-12T19:00:26Z","title":"Large Language Models Can Learn Temporal Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06853","snapshot_observed_at":"2026-08-11T13:15:34.110311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.110311Z"},"links":{"cited_paper":"/paper/2401.06853","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:16b455348088701af64833abd9c0386976c9cca5310c5ea70f96cd53b8e8a881","observation_id":"46188d41-63d4-4085-9ad6-7bb571f10584","resolution":{"observed_at":"2026-08-11T13:15:34.110311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T13:15:34.115800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.115800Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:15aabd71aa8b0569979b08f31c7a6c3f7fbab039af3c64fa34394330cb6237d8","observation_id":"04418d5d-aaf7-4fc5-b174-6fa8b5ada241","resolution":{"observed_at":"2026-08-11T13:15:34.115800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19730","last_updated":"2024-10-29T03:48:33Z","snapshot_observed_at":"2026-08-12T22:14:56.624847Z","submitted_at":"2024-10-25T17:56:24Z","title":"Counting Ability of Large Language Models and Impact of Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19730","snapshot_observed_at":"2026-08-11T13:15:34.122508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.122508Z"},"links":{"cited_paper":"/paper/2410.19730","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:021fd81237384a8726dcf20e93fe52aa70b89f912a29814880f997f033cbe77d","observation_id":"b58aa1b7-0ef2-4de4-b481-44d4731dba0c","resolution":{"observed_at":"2026-08-11T13:15:34.122508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16797","last_updated":"2024-06-09T19:47:15Z","snapshot_observed_at":"2026-08-13T04:09:49.368417Z","submitted_at":"2024-02-26T18:10:56Z","title":"Set the Clock: Temporal Alignment of Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16797","snapshot_observed_at":"2026-08-11T13:15:34.128539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.128539Z"},"links":{"cited_paper":"/paper/2402.16797","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:33b2a200b8c1f858adce95910338028cea17eb158dedc4408cedcc4fea0fbe14","observation_id":"3023a51d-8a30-4aac-bea4-2c022352ab68","resolution":{"observed_at":"2026-08-11T13:15:34.128539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08460","last_updated":"2025-04-02T07:20:24Z","snapshot_observed_at":"2026-08-14T02:34:25.381436Z","submitted_at":"2024-05-14T09:31:31Z","title":"Is Your LLM Outdated? A Deep Look at Temporal Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08460","snapshot_observed_at":"2026-08-11T13:15:34.134349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.134349Z"},"links":{"cited_paper":"/paper/2405.08460","citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:02da6b482bc1c898e7a35daa9df1983ca1f42e95416d53ae1c33cddde46884e2","observation_id":"c708fd36-8ff6-4453-993a-89f6ff0f3e44","resolution":{"observed_at":"2026-08-11T13:15:34.134349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:15:34.140307Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.140307Z"},"links":{"citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:d7fec4eb705072ed80e94cd9efe5d555aa48d5d5a459403bb63025c576094dd4","observation_id":"95d20336-e61f-40df-b686-cb350ea3d46b","resolution":{"observed_at":"2026-08-11T13:15:34.140307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:15:34.146881Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:15:34.146881Z"},"links":{"citing_paper":"/paper/2412.13377"},"observation_digest":"sha256:cf3702a33e5694bae5439a329137d7ed6883684590ea6c0023dd32338a130d09","observation_id":"1e2a6139-a951-448c-aa38-5fb57a2a1efc","resolution":{"observed_at":"2026-08-11T13:15:34.146881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.13377","last_updated":"2025-05-19T12:29:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T18:41:22.578688Z","submitted_at":"2024-12-17T23:25:47Z","title":"DateLogicQA: Benchmarking Temporal Biases in Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2412.13377."}