{"as_of":"2026-08-13T06:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc1ee5ddfdba836e9b138b0f3cd5e47e2a990ce031117ed45078ddfd0c9adaec","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:12:43.381851Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.17970/citation-record","integrity":"/paper/2412.17970/integrity","json":"/paper/2412.17970/citation-record.json","paper":"/paper/2412.17970"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:12:43.754023Z","title":"Which modality should I use - text, motif, or image? : Understanding graphs with large language models","venue":null,"work_id":"19384af8-7463-4797-89f8-974d27208263","year":2024},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.278589Z"},"links":{"citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:17cab027029cdf00288ac1b9b3f32d0b7c716ec7971ef33a86b78e7dac05e57a","observation_id":"4e321e14-b6e4-4359-9ae2-ae5a99b319c6","resolution":{"observed_at":"2026-08-11T05:12:43.761628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15066","last_updated":"2023-07-11T15:08:00Z","snapshot_observed_at":"2026-08-05T16:16:01.066507Z","submitted_at":"2023-05-24T11:53:19Z","title":"GPT4Graph: Can Large Language Models Understand Graph Structured Data ? An Empirical Evaluation and Benchmarking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15066","snapshot_observed_at":"2026-08-11T05:12:43.284336Z","title":"Gpt4graph: Can large language models understand graph structured data ? an empirical evalua- tion and benchmarking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.284336Z"},"links":{"cited_paper":"/paper/2305.15066","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:3c4b59ede9967eb121056a970a113f8db4f6620b495319637cd218715b034e7f","observation_id":"cce26841-3931-42dd-a016-4695e79722ef","resolution":{"observed_at":"2026-08-11T05:12:43.284336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T05:12:43.296105Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.296105Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:9019eafea2fa2d49a2c78f637914a0a4d8e29cf9f5da7f64ed327c78d7681938","observation_id":"ddbb3e12-ee5a-4089-9ef8-8fe37ba65873","resolution":{"observed_at":"2026-08-11T05:12:43.296105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13121","last_updated":"2024-06-19T00:28:58Z","snapshot_observed_at":"2026-08-12T23:39:40.547591Z","submitted_at":"2024-06-19T00:28:58Z","title":"Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13121","snapshot_observed_at":"2026-08-11T05:12:43.308046Z","title":"Jinhyuk Lee, Anthony Chen, Zhuyun Dai, Dheeru Dua, Devendra Singh Sachan, Michael Boratko, Yi Luan, S´ebastien MR Arnold, Vincent Perot, Siddharth Dalmia, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.308046Z"},"links":{"cited_paper":"/paper/2406.13121","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:a5dd8c09e37be9c284bac4de47fafddafbfe6dcebcd8c139dc7d87cfae046ee6","observation_id":"e7abd8f6-3351-44fa-8e1f-cfe5ef9951e2","resolution":{"observed_at":"2026-08-11T05:12:43.308046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-07T21:24:23.287695Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-11T05:12:43.313289Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.313289Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:018eeb89410fbe0eb4c3ed3b293cfb0a408fc890e4979538731709676f958427","observation_id":"efe915b9-89b2-45f7-a9c2-a6c82c355041","resolution":{"observed_at":"2026-08-11T05:12:43.313289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-11T05:12:43.323516Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.323516Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:7fd3564926a7a12e76d402f9d0c1adc3faf4df0a990e8be6d3a8a3ea9804a4c0","observation_id":"410715b7-b360-46f4-8897-74b558352d82","resolution":{"observed_at":"2026-08-11T05:12:43.323516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T05:12:43.329468Z","title":"Mathvista: Evaluat- ing mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.329468Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:b7cd08b882e73b7ee387ee2520978ff492fef92cf7f7ebdaffe2c68c8a7da6e8","observation_id":"7ec14147-348a-42af-a786-60faa50d9ce3","resolution":{"observed_at":"2026-08-11T05:12:43.329468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19131","last_updated":"2024-06-27T12:34:52Z","snapshot_observed_at":"2026-08-12T23:33:42.281548Z","submitted_at":"2024-06-27T12:34:52Z","title":"CELLO: Causal Evaluation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19131","snapshot_observed_at":"2026-08-11T05:12:43.334604Z","title":"Chen Meiqi, Peng Bo, Zhang Yan, and Lu Chaochao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.334604Z"},"links":{"cited_paper":"/paper/2406.19131","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:1eb12e39a669a00e8a3d5a7ad7939d03db86fa2f2705d04488cf666981624a41","observation_id":"4e205a35-27de-4950-8d71-61de680c88c3","resolution":{"observed_at":"2026-08-11T05:12:43.334604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:12:43.339710Z","title":"doi: 10.1162/tacl a 00446","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.339710Z"},"links":{"citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:b4bdbddb43a6d86aaac29e35ceadf8fd3f78ea4bc27e0afd7ecf8582fbafad10","observation_id":"db5fc4f9-a60e-4e3f-8d4b-8368119f7a73","resolution":{"observed_at":"2026-08-11T05:12:43.339710Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T05:12:43.355171Z","title":"Gpqa: A graduate- level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.355171Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:88a022043bfe1d6a865c7aebae9134594a88d650b7ab4e10a2a5c1df3b25403e","observation_id":"bbdea996-a866-4be3-bbbd-a7927e5fec55","resolution":{"observed_at":"2026-08-11T05:12:43.355171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12856","last_updated":"2024-12-19T21:25:57Z","snapshot_observed_at":"2026-08-13T00:02:54.773738Z","submitted_at":"2024-05-21T15:13:12Z","title":"LLM Processes: Numerical Predictive Distributions Conditioned on Natural Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12856","snapshot_observed_at":"2026-08-11T05:12:43.360460Z","title":"Llm processes: Numerical predictive distributions conditioned on natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.360460Z"},"links":{"cited_paper":"/paper/2405.12856","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:4aff707f179a0db33c91ec771df55f1e8196d95e0c728cd0a6ba358842f36762","observation_id":"882aeca8-3b24-46d1-bc10-8f1058cb3e44","resolution":{"observed_at":"2026-08-11T05:12:43.360460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00622","last_updated":"2024-05-01T16:43:21Z","snapshot_observed_at":"2026-08-13T00:17:30.877564Z","submitted_at":"2024-05-01T16:43:21Z","title":"Causal Evaluation of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00622","snapshot_observed_at":"2026-08-11T05:12:43.365536Z","title":"Causal evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.365536Z"},"links":{"cited_paper":"/paper/2405.00622","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:24757525fcf55bcb2ea46f2c578de50535203d173fc0f8cbb287dea6625b3337","observation_id":"03a001b8-ab05-49cf-8762-f2a6f9e3f65c","resolution":{"observed_at":"2026-08-11T05:12:43.365536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:12:43.370932Z","title":"URL https: //www.kaggle.com/m/3301","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.370932Z"},"links":{"citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:54e92b7c76adb3d59f40c0ef0335eccd2c259c9df86d656060777c2c465e2947","observation_id":"b9d36e33-eac4-4069-b3f4-806d1e71fc7b","resolution":{"observed_at":"2026-08-11T05:12:43.370932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08311","last_updated":"2026-06-28T18:56:02Z","snapshot_observed_at":"2026-08-12T23:44:27.510177Z","submitted_at":"2024-06-12T15:12:49Z","title":"Causality for Tabular Data Synthesis: A High-Order Structure Causal Benchmark Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08311","snapshot_observed_at":"2026-08-11T05:12:43.375998Z","title":"Causality for tabular data synthesis: A high-order structure causal bench- mark framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.375998Z"},"links":{"cited_paper":"/paper/2406.08311","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:9d0149e39690c9d536d061f2b6a606969cf09ede7dc4e03bed2d86315cf45c9b","observation_id":"6cc21b9c-a814-47ff-8612-ebe2951d6a21","resolution":{"observed_at":"2026-08-11T05:12:43.375998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02130","last_updated":"2024-10-31T12:27:33Z","snapshot_observed_at":"2026-08-13T04:27:47.658853Z","submitted_at":"2024-02-03T12:19:47Z","title":"GITA: Graph to Visual and Textual Integration for Vision-Language Graph Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02130","snapshot_observed_at":"2026-08-11T05:12:43.381851Z","title":"Rendering graphs for graph reasoning in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.381851Z"},"links":{"cited_paper":"/paper/2402.02130","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:27b96b238d4b5e59ed7bb3bded400ffd6cfc091c3b1664acc740cb6a7fb3dc01","observation_id":"3a74b270-bf06-45eb-afd1-f0f17112696a","resolution":{"observed_at":"2026-08-11T05:12:43.381851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:12:43.349932Z","title":"doi: 10.3115/v1/P15-1142","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.349932Z"},"links":{"citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:2197d444df12984d43a43115248f2feb28db7de9c0d5b83e653e2eeec3310489","observation_id":"e8517cd0-0800-479a-abca-ef29594ac560","resolution":{"observed_at":"2026-08-11T05:12:43.349932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T05:12:43.301848Z","title":"doi: 10.18653/v1/P17-1167","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.301848Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:630eb0d97a0cddd68ab85874c233e5b1c7c3c04e6761b9387b26bd765d6e57a2","observation_id":"b50c1fa0-d44f-413b-9fca-8e79188792fe","resolution":{"observed_at":"2026-08-11T05:12:43.301848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T05:12:43.272640Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.272640Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:ad88fdeebe2ef8cdc5cd9586d89917cb65ecbb341aab9ee8974ec58cd93c7dde","observation_id":"44acbef8-94bc-49bf-896c-66c3d8321ee3","resolution":{"observed_at":"2026-08-11T05:12:43.272640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:12:43.344468Z","title":"doi: 10.18653/v1/2020.emnlp-main.89","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.344468Z"},"links":{"citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:8d79797aef058d39802bb7efa12c54dd146492f36b7d3a3483b2669230f40e55","observation_id":"1388eede-7ba2-46c9-989c-07deafe7eef6","resolution":{"observed_at":"2026-08-11T05:12:43.344468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T05:12:43.260483Z","title":"neurips.cc/paper_files/paper/2021/file/ 68d30a9594728bc39aa24be94b319d21-Paper-round1.pdf","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.260483Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:feaafa25f332a964fa0e115629d88d22dc860534aafc0291143d256f269df07e","observation_id":"839995f1-f280-4122-8ade-a246f0db9a3c","resolution":{"observed_at":"2026-08-11T05:12:43.260483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11224","last_updated":"2023-09-09T03:14:10Z","snapshot_observed_at":"2026-08-13T06:28:51.928685Z","submitted_at":"2023-08-22T06:32:07Z","title":"Evaluating Large Language Models on Graphs: Performance Insights and Comparative Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11224","snapshot_observed_at":"2026-08-11T05:12:43.318435Z","title":"Evaluating large language models on graphs: Performance insights and comparative analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.318435Z"},"links":{"cited_paper":"/paper/2308.11224","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:f7cff4149d18e99352f377f72d8873e13516aa2409e8cfca6ca767778600970d","observation_id":"f6152efc-e87d-4250-ac75-cc54b726fc34","resolution":{"observed_at":"2026-08-11T05:12:43.318435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06665","last_updated":"2024-04-29T23:21:33Z","snapshot_observed_at":"2026-08-13T04:24:59.939091Z","submitted_at":"2024-02-06T17:15:33Z","title":"The Essential Role of Causality in Foundation World Models for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06665","snapshot_observed_at":"2026-08-11T05:12:43.289901Z","title":"The es- sential role of causality in foundation world models for ‘ied ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.289901Z"},"links":{"cited_paper":"/paper/2402.06665","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:355bc3e01c2a5991f7f42881d3709a1454aeb1d61c7c662a499cbad585bae0dd","observation_id":"ac627b00-9b4d-48eb-baa4-a5df380691f4","resolution":{"observed_at":"2026-08-11T05:12:43.289901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T05:12:43.266768Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:43.266768Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.17970"},"observation_digest":"sha256:886cc230b69e30f4aadff8a34e9beaebc74c13cbfb3352f0b25fe779b441277f","observation_id":"54801bf9-0f58-4a8c-87cf-6bfa13526d57","resolution":{"observed_at":"2026-08-11T05:12:43.266768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17970","last_updated":"2024-12-23T20:34:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T03:01:40.180264Z","submitted_at":"2024-12-23T20:34:32Z","title":"CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.17970."}