{"as_of":"2026-08-09T08:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d334b290d8bfad05a713bb047263819553b6f52530610d91921b287a47fdee3","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:51:15.504623Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06655/citation-record","integrity":"/paper/2502.06655/integrity","json":"/paper/2502.06655/citation-record.json","paper":"/paper/2502.06655"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T14:51:15.341060Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.341060Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:c4c0b6403ceb7b8ff7fea5161e5ab7776eb5c28e1a90f26336addec58e9f50ac","observation_id":"3b4409f8-0ba5-488f-a87f-87c585bf5257","resolution":{"observed_at":"2026-08-08T14:51:15.341060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T14:51:15.366197Z","title":"org/abs/2402, 10669","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.366197Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:51fc577dcbb78f8b8fe74ef664fe4ab8c3452672c12476e737bdbc33d249c2e6","observation_id":"6f31d78a-fdb8-4696-9c3f-572500fe735a","resolution":{"observed_at":"2026-08-08T14:51:15.366197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11457","last_updated":"2024-08-21T17:23:03Z","snapshot_observed_at":"2026-08-05T15:10:51.512972Z","submitted_at":"2024-04-17T15:05:03Z","title":"Bias and Unfairness in Information Retrieval Systems: New Challenges in the LLM Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11457","snapshot_observed_at":"2026-08-08T14:51:15.378498Z","title":"Unify- ing bias and unfairness in information retrieval: A survey of challenges and opportunities with large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.378498Z"},"links":{"cited_paper":"/paper/2404.11457","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:88c128793d422b76ab7db9a3ffff2f04187674c562da0359482bd90e8a028338","observation_id":"9a3aa460-0158-40b5-a0e4-024c112f9eaa","resolution":{"observed_at":"2026-08-08T14:51:15.378498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14890","last_updated":"2024-02-12T17:30:25Z","snapshot_observed_at":"2026-07-06T17:07:19.721701Z","submitted_at":"2023-12-22T18:07:44Z","title":"NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14890","snapshot_observed_at":"2026-08-08T14:51:15.383999Z","title":"Nphard- eval: Dynamic benchmark on reasoning ability of large language models via complexity classes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.383999Z"},"links":{"cited_paper":"/paper/2312.14890","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:66ff165af3ef1dfe935eb9b3fa3a467460a40e9b1361ffb6bc89bc9cbba5a034","observation_id":"fc4c9d7f-1845-4048-833c-52fbfdf98479","resolution":{"observed_at":"2026-08-08T14:51:15.383999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03738","last_updated":"2023-11-13T17:50:22Z","snapshot_observed_at":"2026-08-07T07:55:04.700807Z","submitted_at":"2023-04-07T17:14:00Z","title":"Should ChatGPT be Biased? Challenges and Risks of Bias in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03738","snapshot_observed_at":"2026-08-08T14:51:15.389935Z","title":"Should chatgpt be biased? challenges and risks of bias in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.389935Z"},"links":{"cited_paper":"/paper/2304.03738","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:f11a6a828c81852f203b21e93bf785b1eba4d43a7a23b61f6c97f22e197c5c63","observation_id":"47abcf14-5598-461a-91cf-003ed3205f83","resolution":{"observed_at":"2026-08-08T14:51:15.389935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-08T14:51:15.395521Z","title":"L., Shen, J., Hu, J., Han, X., Huang, Y ., Zhang, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.395521Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:378185783a193c8c1e9786086b59e78ca38824bfe31e018480a0375ce50f30eb","observation_id":"98d7e468-59d7-4412-9762-3a346131bc1c","resolution":{"observed_at":"2026-08-08T14:51:15.395521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T14:51:15.400935Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.400935Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:0031771f7b598f9620c25a4b12adc8cfa0ff27a7b6e97f1faf6e32514d4a0f9b","observation_id":"92115fe6-1869-4852-b587-e4e35eba4996","resolution":{"observed_at":"2026-08-08T14:51:15.400935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:51:16.007645Z","title":"Does data contamination make a difference? insights from intentionally contaminating pre-training data for language models","venue":null,"work_id":"e688d1f2-216b-4c0e-bc45-aec4eba9b6fa","year":2024},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.405782Z"},"links":{"citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:4b335b3790822a7ee1a7f999245a2e66b131267449c22734c56893d921c0176c","observation_id":"cf07b56c-9562-4a43-a90a-cfadc57ea01f","resolution":{"observed_at":"2026-08-08T14:51:16.014831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-08T14:51:15.410849Z","title":"Deduplicating train- ing data makes language models better","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.410849Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:d78bbf8afb79df6babba9d52a88b8145740f4fc1f7b27a3b3e7b303a8168295b","observation_id":"1618b515-b5b2-43a2-bc67-6ac3d2c5ac4d","resolution":{"observed_at":"2026-08-08T14:51:15.410849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15147","last_updated":"2024-04-06T15:20:18Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:52:06Z","title":"S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15147","snapshot_observed_at":"2026-08-08T14:51:15.415940Z","title":"S3eval: A synthetic, scalable, systematic evalua- tion suite for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.415940Z"},"links":{"cited_paper":"/paper/2310.15147","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:11c1f266470ddaf55404cbe6a0db9d4e104bb29d8923732fecd30ef64fc75fa3","observation_id":"d291a9b5-6e1c-49d9-b7c1-70ce3558911b","resolution":{"observed_at":"2026-08-08T14:51:15.415940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17589","last_updated":"2024-01-29T02:11:01Z","snapshot_observed_at":"2026-07-06T16:39:04.459332Z","submitted_at":"2023-10-26T17:11:42Z","title":"An Open Source Data Contamination Report for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17589","snapshot_observed_at":"2026-08-08T14:51:15.421100Z","title":"An open source data contamination report for llama series models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.421100Z"},"links":{"cited_paper":"/paper/2310.17589","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:371609e325326e9ef6c385e7a7b0ca1d7a8918a4fa45a66277dc9ccfa8b8a3b4","observation_id":"2f5b0c50-5873-4c8b-ae0f-29c48757c09d","resolution":{"observed_at":"2026-08-08T14:51:15.421100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T14:51:15.426227Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.426227Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:d98d405c6134daa501873422fbf9fd234cc4a910910bdb7b9bbe0d44184771c6","observation_id":"eaeada13-0cc4-4762-9209-69f34cdc99f6","resolution":{"observed_at":"2026-08-08T14:51:15.426227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09880","last_updated":"2024-10-14T02:11:29Z","snapshot_observed_at":"2026-08-05T15:21:23.913810Z","submitted_at":"2024-02-15T11:08:10Z","title":"Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09880","snapshot_observed_at":"2026-08-08T14:51:15.436864Z","title":"R., Susnjak, T., Arachchilage, N., Liu, T., Wat- ters, P., and Halgamuge, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.436864Z"},"links":{"cited_paper":"/paper/2402.09880","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:a569353a8c1b505de8892e555aaca48588c05dd9202d4b2d1fab56e2c202c60e","observation_id":"46ecd899-cc2d-42fc-91b0-27259ba69af6","resolution":{"observed_at":"2026-08-08T14:51:15.436864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01790","last_updated":"2025-02-28T02:40:58Z","snapshot_observed_at":"2026-08-07T05:21:59.292674Z","submitted_at":"2024-09-03T11:09:44Z","title":"Training on the Benchmark Is Not All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01790","snapshot_observed_at":"2026-08-08T14:51:15.442357Z","title":"Training on the benchmark is not all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.442357Z"},"links":{"cited_paper":"/paper/2409.01790","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:d4abc983757e690d561a7f0ac1e6010179db904b18c8357104074b3711ea335c","observation_id":"11a417e7-a81b-403a-b639-4071f017c38e","resolution":{"observed_at":"2026-08-08T14:51:15.442357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04811","last_updated":"2024-03-06T21:45:35Z","snapshot_observed_at":"2026-08-09T02:53:12.730289Z","submitted_at":"2024-03-06T21:45:35Z","title":"Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04811","snapshot_observed_at":"2026-08-08T14:51:15.447817Z","title":"Riddell, M., Ni, A., and Cohan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.447817Z"},"links":{"cited_paper":"/paper/2403.04811","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:921631e1813198aae613aa0f10b399a42efeb3b4f29dae91b7f37dc8827cf99f","observation_id":"9ce1ddb3-57b9-482a-9d4c-84c632a00216","resolution":{"observed_at":"2026-08-08T14:51:15.447817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18018","last_updated":"2023-10-27T09:48:29Z","snapshot_observed_at":"2026-08-07T21:43:48.165854Z","submitted_at":"2023-10-27T09:48:29Z","title":"NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18018","snapshot_observed_at":"2026-08-08T14:51:15.453440Z","title":"A., Garc ´ıa-Ferrero, I., Etxaniz, J., de Lacalle, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.453440Z"},"links":{"cited_paper":"/paper/2310.18018","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:932ebe10619c5a3c7422716365d8b80c3fa734dc3d909a4ea6d4d29b916abef0","observation_id":"d38930be-bc42-42ce-8362-ea6b0e0573df","resolution":{"observed_at":"2026-08-08T14:51:15.453440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-08T14:51:15.458616Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.458616Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:7ce42202983a9b08f810ab2da6931c68820e947110a05eedc81ec12d2738724e","observation_id":"315e78dc-d08d-4f21-9280-599eececdb96","resolution":{"observed_at":"2026-08-08T14:51:15.458616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T14:51:15.463959Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.463959Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:cd40ec9bc6a9ab10ef0f555af067b6ea3549f43ecfed6ae251154337c88f4217","observation_id":"938b5a87-2aa1-4590-8fc9-d387d09541cf","resolution":{"observed_at":"2026-08-08T14:51:15.463959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T14:51:15.469266Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.469266Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:3eca3913a1be898d9afce5ccfd47461fdbe2c5248adccf2c61f1f2d980d60d0e","observation_id":"93570609-b863-4b35-ba27-d7e9024919df","resolution":{"observed_at":"2026-08-08T14:51:15.469266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-08T14:51:15.474266Z","title":"Glue: A multi-task benchmark and analysis plat- form for natural language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.474266Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:125c9e22886ce2c2f491ccbab5ccec82893a68323a82a26a221171df815542ca","observation_id":"e462bad4-5da1-4923-93a4-47d4ec74d808","resolution":{"observed_at":"2026-08-08T14:51:15.474266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-08T14:51:15.484517Z","title":"Livebench: A challenging, contamination-free llm benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.484517Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:18fe58dbe57135422f3e3fe952f97dac8dac3343184deb92233654f4f4e964ef","observation_id":"2d6af2ff-2f14-4613-9844-ee7acd779fe9","resolution":{"observed_at":"2026-08-08T14:51:15.484517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-08T14:51:15.494390Z","title":"Justice or prejudice? quantifying biases in llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.494390Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:a27b75cb2172975f6de94331f7c2684502a67b4c95cbc9c898e4f585b6811780","observation_id":"d4909b1b-cc7f-473c-8b42-83f020171eef","resolution":{"observed_at":"2026-08-08T14:51:15.494390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-08T14:51:15.499571Z","title":"X., Chen, X., Lin, Y ., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.499571Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:b087412d225ef5a5cf98ac5c3314e0c65700297d563888b8038e0c9003192826","observation_id":"a45fb792-6052-4f45-a804-274711e4840e","resolution":{"observed_at":"2026-08-08T14:51:15.499571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-08T18:43:29.715488Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-08T14:51:15.504623Z","title":"Z., Yang, D., and Xie, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.504623Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:e01e4a567fa924df1de4b6395255c97173d2f96c464472dadd9230f4b1ce6376","observation_id":"4d3f199f-97ef-4ba1-aebd-2a112b542616","resolution":{"observed_at":"2026-08-08T14:51:15.504623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T14:51:15.372544Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.372544Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:a684a60df4eab65f02eb0533a8bc03ced490870003c6ccb96caf67fb007e7878","observation_id":"fcff33de-f9e2-46cd-9075-7d3edb614343","resolution":{"observed_at":"2026-08-08T14:51:15.372544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-08T14:51:15.479245Z","title":"W., Jiao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.479245Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:a77924a9785975a250a7db6ef9e1ce6a2cf6e6939e25c288d884aee20c5ca5b2","observation_id":"1bb2c226-877e-4409-9356-16042d1529cf","resolution":{"observed_at":"2026-08-08T14:51:15.479245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14050","last_updated":"2020-05-29T16:44:18Z","snapshot_observed_at":"2026-08-04T17:19:00.313650Z","submitted_at":"2020-05-28T14:32:08Z","title":"Language (Technology) is Power: A Critical Survey of \"Bias\" in NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14050","snapshot_observed_at":"2026-08-08T14:51:15.358571Z","title":"L., Barocas, S., Daum ´e III, H., and Wallach, H","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.358571Z"},"links":{"cited_paper":"/paper/2005.14050","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:e2443cb467a8a5a3653836464bd7eae80b70ea6e2a15af844eda11250f44c297","observation_id":"c775374b-a7bc-4ac4-85ee-856e99153b1f","resolution":{"observed_at":"2026-08-08T14:51:15.358571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T14:51:15.431556Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.431556Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:551b8a5883a05a91bd76347e8b6b294eb3b84f0684f40a19e2db85b0a2aa5bca","observation_id":"2b45f01e-ca1f-4342-a913-6ad12f7562f0","resolution":{"observed_at":"2026-08-08T14:51:15.431556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:51:16.027142Z","title":"M., Gebru, T., McMillan-Major, A., and Shmitchell, S","venue":null,"work_id":"e529f090-cec2-4438-9bef-7e33800f93a0","year":2021},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.352793Z"},"links":{"citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:0e37f1b020a96addc185cc484b137e68ac89f278b944d0f88455f01a402e1f88","observation_id":"ced1362a-0f76-47d9-91cd-532dc3219114","resolution":{"observed_at":"2026-08-08T14:51:16.032953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T14:51:15.346879Z","title":"org/CorpusID:268232499","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.346879Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:69b2ba8fadc32209d325a1d3bd7d12ad0171a1c726b43986b00e504c52d38775","observation_id":"f4d370ee-0a30-47f5-87d1-08a5c0976daf","resolution":{"observed_at":"2026-08-08T14:51:15.346879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-08T14:51:15.489455Z","title":"E., and Stoica, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.489455Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:c033cdeece96aa5d7458054f04fd802826b0ce7255677ac71d8611b7bc1d1a19","observation_id":"246859ee-fbaf-4caa-ba72-24d790e7d46a","resolution":{"observed_at":"2026-08-08T14:51:15.489455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T03:53:29.137552Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2502.06655."}