{"as_of":"2026-08-22T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66a7c244c7a2cb3e21c862de85dc38e28ba323c7e27ad883a02fe7db75914e64","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:28:32.604663Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.20094/citation-record","integrity":"/paper/2602.20094/integrity","json":"/paper/2602.20094/citation-record.json","paper":"/paper/2602.20094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.285976Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.285976Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:dd8b6d8bbd95f7115f53978db239ffd07fa4b1217fc84c67cbf23dbcefe3ec5b","observation_id":"444102c9-d976-42f0-81ee-6415153441ab","resolution":{"observed_at":"2026-08-02T21:28:27.285976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-02T21:28:27.395576Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.395576Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:590d04f6c0eeb0aa7613ff4ee05fd63dd1426198ccf3278094922374d9852d3f","observation_id":"35585572-0841-44bf-9f39-3707ba7ab471","resolution":{"observed_at":"2026-08-02T21:28:27.395576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-02T21:28:27.487796Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.487796Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:3122b28ab4edb9c6f96892d0c9661c8373e10058ec21489146f65f01be88f4e1","observation_id":"508b6ffb-7421-4b78-a4e3-3b2ccd8a0942","resolution":{"observed_at":"2026-08-02T21:28:27.487796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13171","last_updated":"2024-12-17T18:50:33Z","snapshot_observed_at":"2026-08-13T23:47:35.674752Z","submitted_at":"2024-12-17T18:50:33Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13171","snapshot_observed_at":"2026-08-02T21:28:27.629580Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.629580Z"},"links":{"cited_paper":"/paper/2412.13171","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:1510d624cc98c0705e895744bffeeb0c5cc03f79ceeefff45be96307409507c6","observation_id":"d79121e9-a8d1-4579-a90a-b1fbb355c584","resolution":{"observed_at":"2026-08-02T21:28:27.629580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-02T21:28:27.724206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.724206Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:73a4a77d1bc78b4c0275f1a545246d2e136e3f887c1697e38cce7e83ffcdf31e","observation_id":"ee81a2aa-293f-43c1-a42d-dba12d620b74","resolution":{"observed_at":"2026-08-02T21:28:27.724206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18654","last_updated":"2023-10-31T16:35:07Z","snapshot_observed_at":"2026-08-20T10:11:32.963879Z","submitted_at":"2023-05-29T23:24:14Z","title":"Faith and Fate: Limits of Transformers on Compositionality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18654","snapshot_observed_at":"2026-08-02T21:28:27.829113Z","title":"Hwang, Soumya Sanyal, Sean Welleck, Xiang Ren, Allyson Ettinger, Zaid Harchaoui, and Yejin Choi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.829113Z"},"links":{"cited_paper":"/paper/2305.18654","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:7b6c48c141b7dc3434471dd9f6761349361ca9a97eb1f8ed2728c37fd220de78","observation_id":"9530f4a8-1c49-43f5-8cc1-b90169b01c69","resolution":{"observed_at":"2026-08-02T21:28:27.829113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-08-14T19:15:59.926210Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-08-02T21:28:27.945902Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.945902Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:1e14a22f74261a908f400b76403f910095335e717699409bbc2fa84852164f2f","observation_id":"374a17b5-d4b4-46e0-846b-0ae5e60c206b","resolution":{"observed_at":"2026-08-02T21:28:27.945902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-02T21:28:28.112794Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.112794Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:51765395daf547b070ae677756d3b20f63253b8ebe91fd4f2726b0cfff4b0037","observation_id":"409ae78a-3877-4fb7-a5d1-35b8c77b7a1b","resolution":{"observed_at":"2026-08-02T21:28:28.112794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-02T21:28:28.247400Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.247400Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:d6042b747df39146747ccb1f1ea0a77a2b5755d3d8c67264d4a12164c39b1769","observation_id":"f46f3787-abe3-4273-a118-6e2cec6d0712","resolution":{"observed_at":"2026-08-02T21:28:28.247400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04350","last_updated":"2024-01-17T14:41:55Z","snapshot_observed_at":"2026-08-19T14:34:38.350307Z","submitted_at":"2023-12-07T15:12:12Z","title":"CLadder: Assessing Causal Reasoning in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04350","snapshot_observed_at":"2026-08-02T21:28:28.357546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.357546Z"},"links":{"cited_paper":"/paper/2312.04350","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:74fb3d2746fab4339e8d1b94520135de600fdd5141a1a90ecf44d25bf04eef85","observation_id":"5b9ef10a-a905-4e17-8464-4dbbadf730df","resolution":{"observed_at":"2026-08-02T21:28:28.357546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05836","last_updated":"2024-04-17T04:27:10Z","snapshot_observed_at":"2026-08-20T18:08:43.065544Z","submitted_at":"2023-06-09T12:09:15Z","title":"Can Large Language Models Infer Causation from Correlation?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05836","snapshot_observed_at":"2026-08-02T21:28:28.474621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.474621Z"},"links":{"cited_paper":"/paper/2306.05836","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:290f054b7a8fbd394fed79e50eb5f2ded1e7c8b2f54f9a6ff05378b5ee31dafd","observation_id":"371c6f11-7fb1-4dc7-a58c-e02e8bb71772","resolution":{"observed_at":"2026-08-02T21:28:28.474621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.596512Z","title":"Vempala, and Edwin Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.596512Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:9a92c432c7d644594a66c184237e63c61bb376212c2e7240484510ee0ea4c74a","observation_id":"20a1dc24-66ae-47c0-bfa9-95305058af98","resolution":{"observed_at":"2026-08-02T21:28:28.596512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-14T16:24:35.878503Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-02T21:28:28.817584Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.817584Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:734cd7b0986d9504be207602e0a3fd615b8d9389662c114bcbc3ac98ea9a34a3","observation_id":"e01ed153-2563-4630-8a16-1afec74ff88f","resolution":{"observed_at":"2026-08-02T21:28:28.817584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-21T01:37:45.112714Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-02T21:28:28.909396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.909396Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:87ac1a5122a9744275f71d609ab166729a0a04d45fd8120413dd61f3ad162680","observation_id":"3a880997-7594-437d-9142-389a1a25083d","resolution":{"observed_at":"2026-08-02T21:28:28.909396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00050","last_updated":"2024-08-20T17:16:20Z","snapshot_observed_at":"2026-08-20T16:29:28.996870Z","submitted_at":"2023-04-28T19:00:43Z","title":"Causal Reasoning and Large Language Models: Opening a New Frontier for Causality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00050","snapshot_observed_at":"2026-08-02T21:28:28.998405Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.998405Z"},"links":{"cited_paper":"/paper/2305.00050","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:b6051d04b4a56bac9d82d0fec29571c310e374c3888c77fafc6cefdac2013267","observation_id":"11ed277b-15a1-4c57-a9e8-ca668a703f22","resolution":{"observed_at":"2026-08-02T21:28:28.998405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.109706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.109706Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:dde00ce548c4d7e859590c9fcc5faac78c7f2b332416d4f5bef0e53d8e80e5bc","observation_id":"2c9313f1-acf3-4cb1-96fc-44485e921e38","resolution":{"observed_at":"2026-08-02T21:28:29.109706Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.230205Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.230205Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:759f538514cbd41249858dc6e896b22bfdf45d47419929db19cdb453107ae9f7","observation_id":"65579159-ead4-4ef4-81fd-3052e15b6874","resolution":{"observed_at":"2026-08-02T21:28:29.230205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05852","last_updated":"2019-12-15T17:32:45Z","snapshot_observed_at":"2026-08-17T14:26:11.663079Z","submitted_at":"2019-08-16T05:36:04Z","title":"Reasoning Over Paragraph Effects in Situations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05852","snapshot_observed_at":"2026-08-02T21:28:29.445259Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.445259Z"},"links":{"cited_paper":"/paper/1908.05852","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:779176d75371b28e7c901d5b554a0ae025b2c5d976f521af14383c35eff86613","observation_id":"490db0b7-c364-406a-b98e-157a86db53c0","resolution":{"observed_at":"2026-08-02T21:28:29.445259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-02T21:28:29.591603Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.591603Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:cf33569f1cf581a20e77e425c998c5a5058ac65359a31e14806135ef93618c61","observation_id":"08f646d6-d882-456f-be5f-40f9c8e8e9c6","resolution":{"observed_at":"2026-08-02T21:28:29.591603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T21:28:29.733317Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.733317Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:05acd678dfd5c1d24b81615cd259459009fd5d1e6c89d657678e6d79d701d3ca","observation_id":"a542ca86-d654-4025-a6a3-5bd78d1fde64","resolution":{"observed_at":"2026-08-02T21:28:29.733317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.817709Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.817709Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:08c1912f1e0f9d6db091c33ee10ed0d50876d9163d4c28f2de44498bfb5b3e27","observation_id":"8193bed8-8a4e-4fe2-a69b-bcb59b8a6139","resolution":{"observed_at":"2026-08-02T21:28:29.817709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.01007","last_updated":"2019-06-24T16:02:01Z","snapshot_observed_at":"2026-08-16T17:23:43.914526Z","submitted_at":"2019-02-04T01:54:19Z","title":"Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.01007","snapshot_observed_at":"2026-08-02T21:28:30.109233Z","title":"Thomas McCoy, Ellie Pavlick, and Tal Linzen","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.109233Z"},"links":{"cited_paper":"/paper/1902.01007","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:eaaa1d9f9c275174d6b62f6c10792b7f4b5d349a5a093a9af1f5b1c2beab1fee","observation_id":"563c914a-79d1-4e0d-9890-825df855cad5","resolution":{"observed_at":"2026-08-02T21:28:30.109233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00164","last_updated":"2023-11-30T19:55:51Z","snapshot_observed_at":"2026-08-19T05:53:51.283979Z","submitted_at":"2023-11-30T19:55:51Z","title":"Towards Accurate Differential Diagnosis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00164","snapshot_observed_at":"2026-08-02T21:28:30.233235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.233235Z"},"links":{"cited_paper":"/paper/2312.00164","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:4db4ba127fe30301b7be287dc01af241d9c8ac2e64d1019302ae9c561938e84e","observation_id":"14ae17a9-97a0-431c-be7c-dab6bbd3aca2","resolution":{"observed_at":"2026-08-02T21:28:30.233235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.388188Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.388188Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:dc6f6c184465b3370a725f41fa67b5a0158b6ee1759562aca78df66fb01284e7","observation_id":"85456f3e-418e-4817-9fbe-5051774b8090","resolution":{"observed_at":"2026-08-02T21:28:30.388188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.499605Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.499605Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:3e2b1a6c609793e602c1e65a3876fc14ac38d445af91094bfb32d8d51f15a4b6","observation_id":"18f7c1a6-d410-440f-ba6b-4546e1b14154","resolution":{"observed_at":"2026-08-02T21:28:30.499605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.807373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.807373Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:5c438337e80f8e96afec39d980e425570f77bb8ff06b8b67392a50798a0e9b73","observation_id":"e0ec1fe3-177c-4eee-80f4-c218e48b8080","resolution":{"observed_at":"2026-08-02T21:28:30.807373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13138","last_updated":"2022-12-26T14:28:24Z","snapshot_observed_at":"2026-08-18T17:55:17.693956Z","submitted_at":"2022-12-26T14:28:24Z","title":"Large Language Models Encode Clinical Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13138","snapshot_observed_at":"2026-08-02T21:28:30.988995Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.988995Z"},"links":{"cited_paper":"/paper/2212.13138","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:b96dcb6890ccc4aaa372394cd195682af587ae8279865925e012106aac712da8","observation_id":"929ea29e-39d4-4de0-92ca-dc0d89007ff4","resolution":{"observed_at":"2026-08-02T21:28:30.988995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-02T21:28:31.091238Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.091238Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:8d3cb0ca2dafd6886ae56a2c1a94215b8c1dc22e0c49494b9155583d850e91b2","observation_id":"4c0aaf51-26a8-4fba-95cd-e6e0708aa674","resolution":{"observed_at":"2026-08-02T21:28:31.091238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.3215","last_updated":"2014-12-14T20:59:51Z","snapshot_observed_at":"2026-08-14T23:19:57.426044Z","submitted_at":"2014-09-10T19:55:35Z","title":"Sequence to Sequence Learning with Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.3215","snapshot_observed_at":"2026-08-02T21:28:31.216464Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.216464Z"},"links":{"cited_paper":"/paper/1409.3215","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:abf7efe3af5acd67c640a8535d52d6b1fb1a1f1629f4c08f6c14e0e3237ccf1f","observation_id":"fc069c05-b0bd-4221-b544-158ee11e3da1","resolution":{"observed_at":"2026-08-02T21:28:31.216464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-02T21:28:31.360209Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.360209Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:f0952df010f3c6ab324188a25a0a89ba5121c80953073b8b283cfe3f1eb23387","observation_id":"ca28bac1-26e0-4ea7-a93b-e25bb87b7302","resolution":{"observed_at":"2026-08-02T21:28:31.360209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.504833Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.504833Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:1f845dd4fff086584d74810b21024db726af07d92c27f184aa8512b84ec5fbd6","observation_id":"88855721-f0d7-479a-b17f-dc1d37a1bea8","resolution":{"observed_at":"2026-08-02T21:28:31.504833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-02T21:28:31.686056Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.686056Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:021571f10010de7e7366db6b93956d88fb2f3ab9d20ecbfe52783fbbd29525ff","observation_id":"6df7c48e-c415-49ee-aac3-a7870eb28d81","resolution":{"observed_at":"2026-08-02T21:28:31.686056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.820408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.820408Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:16791b4410150d8c252affaa0344d42ebeee03edaea0f291bdd2ec594737d76b","observation_id":"e1ffc3d5-3564-4b32-9889-5be2166c571d","resolution":{"observed_at":"2026-08-02T21:28:31.820408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-02T21:28:32.068731Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.068731Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:7e71f641dac0c6602d1a2465347a4cc4402a018670e27a848f6d6240053b2c94","observation_id":"046c8a47-10f0-43d3-953b-9b709ddfe31c","resolution":{"observed_at":"2026-08-02T21:28:32.068731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-02T21:28:32.239379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.239379Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:3b0b50ffe1e59bfa99de0123d4e25dd6a080ff1cf1d1b8fb7778eadd13218110","observation_id":"e431ab9f-3a51-4e3a-affa-11fd2fec7ae6","resolution":{"observed_at":"2026-08-02T21:28:32.239379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.456551Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.456551Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:03d26b359a56087e914e5867223b81508d3cd67e7ff6f7957feb0c8a98091ac9","observation_id":"f373acf8-07f7-47db-9acc-50c9dd06a3e8","resolution":{"observed_at":"2026-08-02T21:28:32.456551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19048","last_updated":"2025-01-23T16:01:22Z","snapshot_observed_at":"2026-08-19T17:13:32.469261Z","submitted_at":"2024-12-26T04:05:28Z","title":"Jasper and Stella: distillation of SOTA embedding models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19048","snapshot_observed_at":"2026-08-02T21:28:32.604663Z","title":"skewness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.604663Z"},"links":{"cited_paper":"/paper/2412.19048","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:69c99a875941cd9b9b14a3e2a67330e29d65c5ee7692d11b14098042f47c5772","observation_id":"1ce28efc-0d74-45ff-9f7d-57d90c5545e1","resolution":{"observed_at":"2026-08-02T21:28:32.604663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.670338Z","title":"InAAAI Spring Symposium on Log- ical Formalizations of Commonsense Reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.670338Z"},"links":{"citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:0dc949e5741787b99ab86e6fb5c5e4bb22aa6df9f772da3e157789a77f1e5b42","observation_id":"dbd5d8bd-0019-4758-a8c2-a5bada1dede9","resolution":{"observed_at":"2026-08-02T21:28:30.670338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00661","last_updated":"2020-05-02T00:09:16Z","snapshot_observed_at":"2026-08-18T19:33:38.559641Z","submitted_at":"2020-05-02T00:09:16Z","title":"On Faithfulness and Factuality in Abstractive Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00661","snapshot_observed_at":"2026-08-02T21:28:29.953871Z","title":"arXiv:2005.00661 [cs.CL] https://arxiv.org/abs/2005.00661","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.953871Z"},"links":{"cited_paper":"/paper/2005.00661","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:cc8b3fd8cc67866434e1fe19852a57f4f6576bb1e6cc76bbc89a47f16116a18a","observation_id":"593cd700-37bc-4688-83ad-e4c85365aae5","resolution":{"observed_at":"2026-08-02T21:28:29.953871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01024","last_updated":"2021-06-02T08:43:12Z","snapshot_observed_at":"2026-08-16T18:20:20.081016Z","submitted_at":"2021-06-02T08:43:12Z","title":"Why Machine Reading Comprehension Models Learn Shortcuts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01024","snapshot_observed_at":"2026-08-02T21:28:29.353517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.353517Z"},"links":{"cited_paper":"/paper/2106.01024","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:ae430b63f8bf4cee734749f6de5e3772902832298eae8cc27fc8fafe06f79de7","observation_id":"ae85eebb-31f5-4720-ab91-06b4d99a1bce","resolution":{"observed_at":"2026-08-02T21:28:29.353517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-08-20T16:25:21.186877Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-02T21:28:28.700868Z","title":"arXiv:2509.04664 [cs.CL] https: //arxiv.org/abs/2509.04664","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.700868Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2602.20094"},"observation_digest":"sha256:c37cb33e0d4f14e1b9fb2ba723ffad6317cd27d32bef94ba3c305028496c06ed","observation_id":"20a21ab7-11a8-4640-84c5-1d9208206532","resolution":{"observed_at":"2026-08-02T21:28:28.700868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.20094","last_updated":"2026-06-25T19:27:55Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T20:13:05.570213Z","submitted_at":"2026-02-23T18:06:15Z","title":"CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2602.20094."}