{"as_of":"2026-08-09T07:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5a2aadcdd64ac1554f16031cc6391e7ff29cbcdff0d3b6fb3e8bec95f7875da","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:47:12.799685Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:30.787818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:170edfeb0a65c0f59349ef3b51c5d61fe3f6b099ba558a8a4548f7eb97f4d341","observation_id":"701b9690-42cd-4c21-a48b-c459aed6ca9f","resolution":{"observed_at":"2026-05-22T22:22:12.276239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T14:47:12.799685Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning.arXiv preprint arXiv:2406.09170, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17572","last_updated":"2025-05-23T07:30:57Z","snapshot_observed_at":"2026-08-07T21:56:03.875890Z","submitted_at":"2025-05-23T07:30:57Z","title":"USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning of LLMs as Urban Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:12.799685Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.17572"},"observation_digest":"sha256:2cb2a9a201169492f658727ea68ab42ad6213404c5d6ebd68b7e52031d67a9b4","observation_id":"a59d186c-7fc3-48c5-9aa1-90e8e9f54f9b","resolution":{"observed_at":"2026-08-07T14:47:12.799685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T14:17:06.234436Z","title":"Fatemi, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19533","last_updated":"2025-05-26T05:39:57Z","snapshot_observed_at":"2026-08-08T00:00:45.680749Z","submitted_at":"2025-05-26T05:39:57Z","title":"ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:06.234436Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.19533"},"observation_digest":"sha256:7f744b53e93675712835227a5adf37facc07a0b075a387be338abe1e3bab53e9","observation_id":"936d4ef5-3030-4be6-aaef-a88066aa067a","resolution":{"observed_at":"2026-08-07T14:17:06.234436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T13:19:31.936216Z","title":"Test of time: A benchmark for eval- uating llms on temporal reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22112","last_updated":"2025-05-28T08:40:55Z","snapshot_observed_at":"2026-08-08T15:38:31.731296Z","submitted_at":"2025-05-28T08:40:55Z","title":"Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:31.936216Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2505.22112"},"observation_digest":"sha256:bdb68b8292781b6e1108824ddd1007eefe26ad78e34100f7a8e0b091827cbb1f","observation_id":"d0eaca58-7d6f-46f1-aefc-b450aff8d67c","resolution":{"observed_at":"2026-08-07T13:19:31.936216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T10:55:00.683628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03984","last_updated":"2025-06-04T14:14:28Z","snapshot_observed_at":"2026-08-07T10:47:36.847544Z","submitted_at":"2025-06-04T14:14:28Z","title":"Around the World in 24 Hours: Probing LLM Knowledge of Time and Place","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:00.683628Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.03984"},"observation_digest":"sha256:0516d013be00fdd0c88a541d5a5f189b02c8bae0dd91e3ed86deea7985a0ee64","observation_id":"a7b3db6e-b99f-4219-b7f5-47935a16ef79","resolution":{"observed_at":"2026-08-07T10:55:00.683628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T05:42:48.795828Z","title":"Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07270","last_updated":"2025-06-08T20:13:33Z","snapshot_observed_at":"2026-08-08T14:54:50.787376Z","submitted_at":"2025-06-08T20:13:33Z","title":"Question Answering under Temporal Conflict: Evaluating and Organizing Evolving Knowledge with LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:42:48.795828Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.07270"},"observation_digest":"sha256:d72bdd3ec1d9dbe053c8e6b9093e8b495367ec0b4c1609b42b7893da461c9961","observation_id":"ef337db1-38f1-45d4-9584-580608afbe32","resolution":{"observed_at":"2026-08-07T05:42:48.795828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T04:33:10.361435Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-08T11:51:34.890409Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:10.361435Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:86f237d3d4994806ada310c4368a06409e5886089b16deb68d0264243d9d114b","observation_id":"257705c7-de3a-4bd4-beb8-34177dabd9b4","resolution":{"observed_at":"2026-08-07T04:33:10.361435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T01:06:09.583331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.583331Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e4314e9d3c3c1ccd7a6c6a4a1320ac43fbbd0536a9836775ef81172163b96df9","observation_id":"008eed55-694a-4f47-b6c7-f3108658c80e","resolution":{"observed_at":"2026-08-07T01:06:09.583331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-06T21:07:06.179002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00914","last_updated":"2025-07-01T16:18:29Z","snapshot_observed_at":"2026-08-08T07:46:11.219377Z","submitted_at":"2025-07-01T16:18:29Z","title":"Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:06.179002Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2507.00914"},"observation_digest":"sha256:df07c278b9ed9911862a7b1a6e2ae81d3dbe21b86f4750879df1f8a1b7b201f5","observation_id":"ae106fff-8865-4154-b1c8-e276fe35ec00","resolution":{"observed_at":"2026-08-06T21:07:06.179002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-05T12:12:58.671594Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01822","last_updated":"2025-09-01T22:58:57Z","snapshot_observed_at":"2026-08-06T21:12:25.731075Z","submitted_at":"2025-09-01T22:58:57Z","title":"When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:12:58.671594Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2509.01822"},"observation_digest":"sha256:fe0fda61f87fc757922396105f83f169b4d4029db5262d7ad045537ce4977abd","observation_id":"6fff8a26-24ac-41e9-92b6-df2e3a05366c","resolution":{"observed_at":"2026-08-05T12:12:58.671594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-04T07:01:39.776350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27544","last_updated":"2026-06-06T10:28:21Z","snapshot_observed_at":"2026-08-07T09:42:51.433478Z","submitted_at":"2025-10-31T15:17:55Z","title":"TempoBench: Evaluating Temporal Causal Reasoning in Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T07:01:39.776350Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2510.27544"},"observation_digest":"sha256:8c1f61fcc684287a79994666170570ec19400343f91c4864709ce1de2fa03a58","observation_id":"c67c6b83-db5a-435f-892a-17f3e41efe8e","resolution":{"observed_at":"2026-08-04T07:01:39.776350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-02T21:18:01.280536Z","title":"Test of time: A benchmark for evaluating LLMs on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-03T11:13:09.928353Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.280536Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:e419f2e74e39f25c4524ab29a2c19df6490659afd63d466fc5794cb263e760b9","observation_id":"526f11c0-2670-4579-98da-bf6a8271bf3f","resolution":{"observed_at":"2026-08-02T21:18:01.280536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.08766","last_updated":"2026-05-09T07:51:03Z","snapshot_observed_at":"2026-08-02T11:50:07.900845Z","submitted_at":"2026-05-09T07:51:03Z","title":"UserGPT Technical Report","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T03:10:51.555653Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.08766"},"observation_digest":"sha256:e39844aca880954a734d70b463204cf20becf321f3a90e0919753a549e7c5898","observation_id":"37ce2429-69dd-49b2-8572-ac186b57fc03","resolution":{"observed_at":"2026-05-12T03:11:18.733342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.18380","last_updated":"2026-05-18T13:26:14Z","snapshot_observed_at":"2026-08-02T08:42:16.384161Z","submitted_at":"2026-05-18T13:26:14Z","title":"QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:18:08.326304Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.18380"},"observation_digest":"sha256:ef73a25eed52b8a10d109ec20e627a98963286a6c3de18e7d01edc12228313ca","observation_id":"934c5d4d-7a78-4616-8dd7-b5f02c674d6a","resolution":{"observed_at":"2026-05-20T11:18:13.589100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2605.25180","last_updated":"2026-05-24T17:20:45Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:20:45Z","title":"DateSAT: A Framework for Solving Date and Period Constraints","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T23:40:46.386350Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2605.25180"},"observation_digest":"sha256:ed80c2a7a333e8f99335640a074824ad9d6d89de04e0b91e3d5c6d8e7d7c95ca","observation_id":"94b808d1-1c5e-4460-b603-3ca3912f676e","resolution":{"observed_at":"2026-06-29T23:44:02.905459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:292069309a2e875b296c030d10996049ef06c5f3447f13b4e55ec29aeff8114e","observation_id":"b9a4bcb1-7ead-46b3-a648-b8d1b0ebdf04","resolution":{"observed_at":"2026-07-01T14:05:47.163039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"Test of time: A benchmark for evaluating llms on temporal reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:e51c315f597b008713ec5767c221235b6c4f8bb9e0075045fea3c085c7ccd5bb","observation_id":"c330128e-aa3c-4114-86bb-0ddb63591bdc","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:ee2ac12beca7faf8828a0adfac3c97655449f15355ebaefd87e9609231c219a9","observation_id":"eac11a36-2567-455d-8e75-e941472b1e9c","resolution":{"observed_at":"2026-07-03T05:57:41.660552Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.20959","last_updated":"2026-08-05T19:11:41Z","snapshot_observed_at":"2026-08-09T06:09:58.946689Z","submitted_at":"2026-06-18T21:56:18Z","title":"Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T17:35:09.053339Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.20959"},"observation_digest":"sha256:9f4fe342c894d1ec454d24d8012933980644391694fb29f45e34a8944b2833a6","observation_id":"e658e87e-c84b-450e-bac7-6044229ab2c6","resolution":{"observed_at":"2026-07-04T03:49:30.789947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-02T10:48:06.378923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20959","last_updated":"2026-08-05T19:11:41Z","snapshot_observed_at":"2026-08-09T06:09:58.946689Z","submitted_at":"2026-06-18T21:56:18Z","title":"Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T10:48:06.378923Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.20959"},"observation_digest":"sha256:63655aa7a4e3afcf406a9e570fc869ce5c3f363ddd6da808e28719c86297a050","observation_id":"56df4af4-6623-441c-9983-a6bfa62726ee","resolution":{"observed_at":"2026-08-02T10:48:06.378923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":"2406.09170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-07-04T03:49:30.787818Z","title":"Fatemi, M","venue":null,"work_id":"c900dc78-2091-4b54-a1a4-b4080469bcbf","year":2024},"citing_paper":{"arxiv_id":"2606.27378","last_updated":"2026-05-07T04:04:25Z","snapshot_observed_at":"2026-07-07T00:01:34.696890Z","submitted_at":"2026-05-07T04:04:25Z","title":"Formalizing Latent Thoughts: Four Axioms of Thought Representation in LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T23:50:48.584391Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2606.27378"},"observation_digest":"sha256:7f2fd305aecf1d93eae77916a5abd10d984a284e3b5c3252d6af9970863a754c","observation_id":"7d0781ab-3bc1-4bfd-80c5-66fde80ecc12","resolution":{"observed_at":"2026-07-01T13:15:45.637923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.09170/citation-record","integrity":"/paper/2406.09170/integrity","json":"/paper/2406.09170/citation-record.json","paper":"/paper/2406.09170"},"outbound":[],"paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2406.09170."}