{"as_of":"2026-08-14T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09847402f5772e54911ac2a4df68f4838a0d756463512080811e93dceb138786","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:49:34.499531Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T04:07:56.287352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:28:44.552688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"cited_work":{"arxiv_id":"2412.01020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01020","snapshot_observed_at":"2026-07-03T17:28:44.552688Z","title":null,"venue":null,"work_id":"55abd529-1965-456d-8779-965ec8917b36","year":2024},"citing_paper":{"arxiv_id":"2606.15633","last_updated":"2026-06-17T05:23:30Z","snapshot_observed_at":"2026-08-08T13:05:37.982431Z","submitted_at":"2026-06-14T06:50:28Z","title":"Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T04:07:56.287352Z"},"links":{"cited_paper":"/paper/2412.01020","citing_paper":"/paper/2606.15633"},"observation_digest":"sha256:81e3fd0ff0b4217ba2e77b160703d7b39826014e1824ad6387c115eac826f1c1","observation_id":"ddab16a9-f941-4960-9d2b-7ecee0ac701b","resolution":{"observed_at":"2026-07-03T17:28:44.554094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01020/citation-record","integrity":"/paper/2412.01020/integrity","json":"/paper/2412.01020/citation-record.json","paper":"/paper/2412.01020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.489998Z","title":"https://aisafetybulgaria.c om/","venue":null,"work_id":"686703b7-e494-4bf5-824f-eb4ebde116c9","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.275900Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9d89106d1adcb20c725cc1aff560219c5b695dcc5fb09f46e7c5bf00ad579e9a","observation_id":"959064f1-1cef-4252-906d-e03d12c2d360","resolution":{"observed_at":"2026-08-12T04:49:35.494189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.476676Z","title":"Tpcx-ai - an industry standard benc hmark for artiﬁcial intelligence and machine learning systems","venue":null,"work_id":"8bfecb71-1994-49b8-9dcc-ef24b672a9ee","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.280630Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:79af9c2945328ffb0f6cea6995a944cbdcc2398a44eec4acbe84ddbe7b880b7a","observation_id":"768576e5-db86-4bd5-b740-1828ab195762","resolution":{"observed_at":"2026-08-12T04:49:35.481294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.464210Z","title":"https://compl-ai.org/","venue":null,"work_id":"e8a0330e-6422-4b61-8dac-72ef9a61006d","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.285007Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9f81390239402e97aca0df6c86360e7bd8565e1be1a1027f0cb23f1d1bcf5dda","observation_id":"595bf9b7-49cb-428f-8c43-23511f8d17b0","resolution":{"observed_at":"2026-08-12T04:49:35.468167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.289369Z","title":"Relevai-reviewer: A benchmark on AI reviewers for survey paper relevance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.289369Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:46288b9b1ed13acdea5ab4551ce9b861165f117b714595211b60960ae18bdafa","observation_id":"b852ae81-e737-4721-831a-9bfe82e099b8","resolution":{"observed_at":"2026-08-12T04:49:34.289369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.451491Z","title":"Robustbench: a standardized adversarial ro bustness bench- mark","venue":null,"work_id":"06d334fe-49ca-4693-bee0-562e991afe7c","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.293794Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f74594bcff4aa9affd1181b2e34bdf24d3cb00dc6764119308899ae43b7df9b1","observation_id":"c5a99daa-ed8a-4c81-b982-79c205a95d25","resolution":{"observed_at":"2026-08-12T04:49:35.455802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.438201Z","title":"https://artiﬁcialintelligenceact.eu /the-act/","venue":null,"work_id":"672b3ed9-640f-468a-ae40-8218c650f10e","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.298264Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:b78bdbbd956cafa6641d05ee9fd00cd0f5742e326cdcbce0ea7fafa39006de33","observation_id":"75850ed8-80ce-4434-8daf-38b73a9c410e","resolution":{"observed_at":"2026-08-12T04:49:35.442610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.424988Z","title":"https://di gital- strategy.ec.europa.eu/en/library/ethics-guidelines-trustworthy-ai","venue":null,"work_id":"6715e893-6837-4580-a814-0054b47a1fb3","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.302992Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:7ee56922a78c9d7d2132eaa5118de3dd16cd7e00c1309fe416e03373b6e405a9","observation_id":"b267cce2-1bd9-4cfc-9b5d-b9ab5095e816","resolution":{"observed_at":"2026-08-12T04:49:35.429455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.411497Z","title":"Compl-ai framework: A technical interpretation and llm benchmarkin g suite for the eu artiﬁcial intelligence act, 2024","venue":null,"work_id":"b552986b-cc4b-4d20-aa6d-75ae261660bc","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.307310Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:3dacb9f287046214638d36a2cd9271736034e4999350eb499554fd08cba2361e","observation_id":"1232386a-9562-4f1a-a896-34461e041741","resolution":{"observed_at":"2026-08-12T04:49:35.416377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.396745Z","title":"Measuring massive multita sk language understanding","venue":null,"work_id":"e32453ae-e478-463c-92d2-3af269f26ec4","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.311537Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:817256e9c68ab2926e6faec3721ce2de16d3e7d378e146a568ac02efbe788bb9","observation_id":"ba014203-b1b9-423d-a334-fd5ee4d2adb7","resolution":{"observed_at":"2026-08-12T04:49:35.401262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.382461Z","title":"Measuri ng mathe- matical problem solving with the MATH dataset","venue":null,"work_id":"5c8d187e-72ad-441f-852f-6aeb5e7fc6b1","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.315694Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:56e1dd803e869fd2453dbbc865baf4fa755c90a3d006e0bed4bc82d5ae9d3e82","observation_id":"5d3b5543-7ead-435d-8400-7e2da9421296","resolution":{"observed_at":"2026-08-12T04:49:35.386821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.368468Z","title":"Weld, and Luke Zett lemoyer","venue":null,"work_id":"b9902ea3-39ac-42e5-9c15-28872fc3f973","year":2017},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.319762Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:c2a22e40cdddbab9cec6adad4b5296251196ba033e9d7aae3666f4b95751f71e","observation_id":"8dcf9c9a-e335-440e-92ff-49c4d3a6b235","resolution":{"observed_at":"2026-08-12T04:49:35.373656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-13T12:02:41.563345Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-12T04:49:34.323908Z","title":"Openassistant conversations - democra tizing large lan- guage model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.323908Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:c9a3f9c375409e37f9c85c9fc8dec81fbb9e957f11e0e473eed57fd8c086d295","observation_id":"31d31134-2521-42bc-890c-fcb31d6d2140","resolution":{"observed_at":"2026-08-12T04:49:34.323908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.355077Z","title":"Back- doorllm: A comprehensive benchmark for backdoor attacks on large lan- guage models, 2024","venue":null,"work_id":"43f9132e-99b4-4441-99c7-1c6a29152e02","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.328632Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:cee8dcbad414175b76618ddde327f01c3ee35765f91c0fc74e1d67c2e3718906","observation_id":"10e6adef-20f7-49ad-8eda-32d82c7a0935","resolution":{"observed_at":"2026-08-12T04:49:35.359667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.342620Z","title":null,"venue":null,"work_id":"27f9e4f4-2447-4bdd-a3fb-24c80ebf8155","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.332779Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:ce9c9e9cf2afed349f78a07adba0669bdf1fa561770438a40ede9f39b4c7f7a8","observation_id":"a3ab6eb7-bfbb-4464-ae23-cf7c389c373f","resolution":{"observed_at":"2026-08-12T04:49:35.346655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09107","last_updated":"2025-04-20T04:31:16Z","snapshot_observed_at":"2026-08-13T05:49:50.371863Z","submitted_at":"2023-10-13T13:52:15Z","title":"GLoRE: Evaluating Logical Reasoning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09107","snapshot_observed_at":"2026-08-12T04:49:34.337026Z","title":"Glore: Evaluating logical reasoning of large langua ge models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.337026Z"},"links":{"cited_paper":"/paper/2310.09107","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:4c3ce241cf7aed2c1f84dd873019d8b91a382dc3834212590dc52b7577b94205","observation_id":"b024e696-d46b-48e5-baa3-d74efc343611","resolution":{"observed_at":"2026-08-12T04:49:34.337026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.329242Z","title":"Metabox: A benchmark plat- form for meta-black-box optimization with reinforcement l earning","venue":null,"work_id":"a3e6f943-8fa0-4fc3-8566-6a8b20a04cff","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.341499Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:10d6e4691a195fedf5e312e23baa87dbc6aca5e35bf601e4e29667d743e0f1e2","observation_id":"f9509a7b-ff82-44b9-8da8-450226793d40","resolution":{"observed_at":"2026-08-12T04:49:35.333475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.316741Z","title":"Ok-vqa: A visual question answering benchmark requi ring external knowledge, 2019","venue":null,"work_id":"d28d3e24-5ecd-471a-b5b9-b73d511fb40b","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.346322Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:039cec7aff499e6f77492f051671d34df5ce78b2ce220d783c6ad3470ca5e650","observation_id":"4ab148b2-0aa1-4d3d-b87b-0a3b5c1f0b6e","resolution":{"observed_at":"2026-08-12T04:49:35.321026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.303615Z","title":"Abstractive text summarization u sing sequence- to-sequence rnns and beyond","venue":null,"work_id":"8346bb7d-cb06-4fe2-bd67-029ee2dc5bef","year":2016},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.351220Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:4d0f8cbcdbcc1db12e58291e692f0516ee1f37d2d014c94edc2e9ed06d3ffd9c","observation_id":"0fd44be2-0d82-4afa-b5ea-4905c02a7fc3","resolution":{"observed_at":"2026-08-12T04:49:35.308111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.289556Z","title":"Adversarial NLI: A new benchmark for natura l language understanding","venue":null,"work_id":"b809a962-a396-44de-a268-78ad4491ba86","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.355412Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:100f75adc1735927a982a4722c298278c6d6dfd655feb7b9c00e032567eada4a","observation_id":"73b65f13-8f29-4de2-b2bf-a0fc493bcc68","resolution":{"observed_at":"2026-08-12T04:49:35.293849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.275585Z","title":"https://oecd.ai/en/ai-pr inciples","venue":null,"work_id":"350d3f50-fa14-4282-890c-8785f48f2fd1","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.359484Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:cc1a943eb7efc1ad9900346fd1a775520a7843dddf83964f76be047a1a3c6a99","observation_id":"caa6d431-23da-4cb6-a193-00024761feeb","resolution":{"observed_at":"2026-08-12T04:49:35.280799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.260807Z","title":"The LAMBADA dataset: Word prediction requir- ing a broad discourse context","venue":null,"work_id":"160c129d-2cfa-4596-a9ca-25ff1b328735","year":2016},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.363678Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:4add56354d76b0b70545f75276a23c57bfadff5814c973ae38eb9a6973f46a46","observation_id":"a9363cd5-ffaf-4dcd-91b5-f9b2e87961e3","resolution":{"observed_at":"2026-08-12T04:49:35.266378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T04:49:34.367867Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.367867Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:001b251d3a8df86f1f07e31a5e7952d69d75e3169e852588332c309af355602d","observation_id":"de3aa830-3499-4d37-b28c-7f1490d7eda4","resolution":{"observed_at":"2026-08-12T04:49:34.367867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.247716Z","title":"Winogrande: An adversarial winograd schema challenge at sc ale","venue":null,"work_id":"13558313-1603-476c-9c51-aff9ba72d3f5","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.372425Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:2f1289b0fe963acd6528c8d5eaa485899690315b6269fedc78a27fecf8eaa101","observation_id":"32cc2676-71cc-441d-a613-b2dc3c66fdad","resolution":{"observed_at":"2026-08-12T04:49:35.251863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.234616Z","title":"Hadﬁel d, Richard Ngo, Konstantin Pilz, George Gor, Emma Bluemke, Sarah Shoker, Ja net Egan, Robert F","venue":null,"work_id":"63c7d1ac-debb-4205-9776-660137c9ed43","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.376471Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:3312700ffeafebc6176893eaea222eb8772d22b040a8dc49d81abc9b80e4bcd9","observation_id":"6348edc0-763c-4d98-981e-065481892f0a","resolution":{"observed_at":"2026-08-12T04:49:35.239019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.219790Z","title":"Sur- vey of diﬀerent large language model architectures: Trends , benchmarks, and challenges","venue":null,"work_id":"78a9a473-5a2c-42fc-889a-ea3d191fdd4f","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.380505Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:07aea16dfdfc287898cd7c2a25834caa885e689b1caeab19a0544dae4e6bcf3b","observation_id":"141e0544-db56-4537-8ad7-db555dc02946","resolution":{"observed_at":"2026-08-12T04:49:35.224479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.206866Z","title":"Concep tnet 5.5: An open multilingual graph of general knowledge","venue":null,"work_id":"f7585d6f-1807-49a1-8838-913fb4bb6d87","year":2017},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.384428Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:559392fe45beeefd2d80a285e94a7d64637d2855459a8a1355d190982a11be29","observation_id":"5c0eef8c-bb5a-4fe3-8961-57df44b03318","resolution":{"observed_at":"2026-08-12T04:49:35.211305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.194172Z","title":"Musr: Testing the limits of chain-of-thought with multiste p soft reason- ing","venue":null,"work_id":"85f56d25-1c5e-41bd-9f7c-f7fe1e45a0a4","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.388365Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:bc5259937b50ffc614197ce90e8f97ac61c275974941eef668727d879a72e39b","observation_id":"8e2cb9b3-8344-4777-9005-28c997947f30","resolution":{"observed_at":"2026-08-12T04:49:35.198454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.180928Z","title":"Conﬂictbank: A benchmark for evaluating the inﬂuence of knowledge conﬂicts in llm, 2024","venue":null,"work_id":"2fe9b42a-ba88-4f91-ba96-95a72850e1b6","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.392518Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:63c7a6d16d1274b040554fe773b80696416b047de914e97944db78381f9c6ec9","observation_id":"a20935e0-0fbc-4411-88fd-e8cd5c050af2","resolution":{"observed_at":"2026-08-12T04:49:35.185345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.167001Z","title":"A corpus for reasoning about natural language gr ounded in photographs, 2019","venue":null,"work_id":"80fdab57-c453-4ef4-b8e3-1acfcaaf09bf","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.396498Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:7411909d7ec1842c1160873f1d8f663353824889c6c61710a0102fc2b5654aa6","observation_id":"cf6d6eb4-7de6-4ec0-b3e1-a900a43a10d8","resolution":{"observed_at":"2026-08-12T04:49:35.172027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.152472Z","title":"Table meets llm: Can large language models understand struc tured table data? a benchmark and empirical study, 2024","venue":null,"work_id":"78963584-4bf1-4af5-9c33-daff6faac501","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.400470Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:86bd0211f1d3cea8291ee8cbc708513ed543c2279006f8f0fb3d4218e935c370","observation_id":"a87cdc31-c0d4-4d97-9ffc-8a2595dc2b75","resolution":{"observed_at":"2026-08-12T04:49:35.157059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.138451Z","title":"Le, Ed H","venue":null,"work_id":"5a5e04fb-d8e0-49ad-90cc-bd3bf58c38dd","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.404516Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9ae1c2c74cea759027a85a60524e038dd5a01302d6756fb6576a70334ad37e3f","observation_id":"436f95fd-5862-4c93-964f-41ceb378d71f","resolution":{"observed_at":"2026-08-12T04:49:35.142715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.124354Z","title":"Commonsenseqa: A question answering challenge targeting c ommonsense knowledge","venue":null,"work_id":"2a1b2659-4918-49de-b419-59351004a0b5","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.408653Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:a31f3cf44cab9d61542b60892422c837f7b6d633338a3bcf313b75739343a90e","observation_id":"5870f8e5-7fd8-4410-af03-e0a4673eb9d5","resolution":{"observed_at":"2026-08-12T04:49:35.128940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.412604Z","title":"Ltlbench: Towards bench marks for evaluating temporal logic reasoning in large language mode ls","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.412604Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:dd3c7ff30d072932774472524642084b2ea9ee47e136f874a4ec76c3d78b9ba9","observation_id":"da8f0378-5315-42b6-87ca-298895d91458","resolution":{"observed_at":"2026-08-12T04:49:34.412604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.111265Z","title":"Kirkpatrick, Feiyi Wang, Tom Gibbs, Venkatram Vishwanath, Mallikarjun Shankar, Geoﬀrey C","venue":null,"work_id":"dae6bb6f-8b87-47cc-aab8-83c5cbeb2bbb","year":2022},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.416422Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:8a022f18adb2e9ae3bb4a66e51575947efadfbee1d5e18fba7adba188fd819e0","observation_id":"954456a9-cbf4-4331-b187-94545c406c76","resolution":{"observed_at":"2026-08-12T04:49:35.115471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.097832Z","title":"Madai, Emilie Wiinb lad Mathez, 25 Jesmin Jahan Tithi, Magnus Westerlund, Renee Wurth, and Rob erto V","venue":null,"work_id":"31e10e37-864f-4cba-9d05-708d1ca4fcb8","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.420387Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:46f20e059d0647f7afa27b08113fd14cfdf351335d4774720573c349537b1654","observation_id":"25f27a24-2548-4309-b237-0cff8158c062","resolution":{"observed_at":"2026-08-12T04:49:35.102325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12241","last_updated":"2024-05-13T20:46:10Z","snapshot_observed_at":"2026-08-13T00:27:20.623039Z","submitted_at":"2024-04-18T15:01:00Z","title":"Introducing v0.5 of the AI Safety Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12241","snapshot_observed_at":"2026-08-12T04:49:34.424309Z","title":"Ahmed, Victor A kinwande, Namir Al-Nuaimi, Najla Alfaraj, Elie Alhajjar, Lora Aroyo, Trupti Bavalatti, Borhane Blili-Hamelin, Kurt D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.424309Z"},"links":{"cited_paper":"/paper/2404.12241","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:d51f8830e18ca17a3b0227a638bef38e83399a182a17919b8d8a9fda1e6dd280","observation_id":"64a38680-7320-44cf-b4b3-208c97dd72fa","resolution":{"observed_at":"2026-08-12T04:49:34.424309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.084551Z","title":null,"venue":null,"work_id":"ba2f7603-1316-4fd2-b8c1-35363468a270","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.428747Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:d58347d151399c043f253f49f22a1d5cec2fc22de4654e6d2ecb479b88dbf900","observation_id":"8ef0f9f7-90d2-4a76-8294-9d88f86a62e0","resolution":{"observed_at":"2026-08-12T04:49:35.089272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.070638Z","title":null,"venue":null,"work_id":"dd912735-2e56-4591-8cb2-b83ce7ad362e","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.432590Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:af1ae60002b56bccbc7510db90007eea8ff7807635275baa98fcf1a583c69981","observation_id":"dd9703b6-3513-4e6c-b93a-19a841bcb088","resolution":{"observed_at":"2026-08-12T04:49:35.074927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10706","last_updated":"2020-07-10T21:40:34Z","snapshot_observed_at":"2026-08-04T09:25:12.687793Z","submitted_at":"2020-04-22T17:10:18Z","title":"CORD-19: The COVID-19 Open Research Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10706","snapshot_observed_at":"2026-08-12T04:49:34.436441Z","title":"Murdick, Devvret Ris hi, Jerry Sheehan, Zhihong Shen, Brandon Stilson, Alex D","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.436441Z"},"links":{"cited_paper":"/paper/2004.10706","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:584cbc630524a802edf729f76fba3ab5cb850fd904f9531bd70bb992241c8736","observation_id":"9694d149-2b58-40a5-b696-3d6f82c39ce7","resolution":{"observed_at":"2026-08-12T04:49:34.436441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-12T04:49:34.440600Z","title":"Mmlu-pro: A more robust and challenging multi-task la nguage un- derstanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.440600Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f78b4546d1b5949f174f25bff685e453119665585b85ef4d7bd73c9a3e539b6c","observation_id":"12ca922d-2dcb-43e9-8888-3c4b06c828be","resolution":{"observed_at":"2026-08-12T04:49:34.440600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.056945Z","title":"CausalBench: A comprehensive benchmark for evaluating causal reasoning capabilities of large language models","venue":null,"work_id":"5a3832c7-c46a-4723-8258-15226b42e27e","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.444965Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:12e50511963616fdd9aeec2bd5e27bf0899cf14ea18381270d883773b8fab58b","observation_id":"758a8961-3d6a-4944-b487-63ddebaff14b","resolution":{"observed_at":"2026-08-12T04:49:35.061640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-12T04:49:34.448945Z","title":"Logicv ista: Mul- timodal LLM logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.448945Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:13d0d62aefdd7cfb4b465f6c77928907da1a70074befec4fe93213c91a3653dc","observation_id":"8c69c960-5975-41e9-98fb-689d2e8a499f","resolution":{"observed_at":"2026-08-12T04:49:34.448945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.042234Z","title":"Quick and (not so) dirty: Unsupervised selection of justiﬁcation sentences f or multi-hop ques- tion answering","venue":null,"work_id":"9709ffe2-1742-42da-9c83-2cc0560d639b","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.453224Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:795e611198ad5e644442e3c982daf3e03a59169ebbdd83f5a9105e70445fa96b","observation_id":"8a57a991-f3da-4a06-8e1a-a1c0b5aecbbe","resolution":{"observed_at":"2026-08-12T04:49:35.047700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.457155Z","title":"Eval- uating the quality of hallucination benchmarks for large vi sion-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.457155Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:6ec6645d198b493af1b3d30dbbbfb133905bcdd3991b97ed6fa85c54f826038f","observation_id":"5e7dfec3-743e-430c-9517-9d9a8d40c46b","resolution":{"observed_at":"2026-08-12T04:49:34.457155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.027957Z","title":"https://z-inspection.org/","venue":null,"work_id":"47675535-45ea-43b6-8b66-bb54e5f383fc","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.461684Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:175e022adc148337af537e9a7848cea2d59da9f095c15119d0692c876474eb61","observation_id":"20f81d44-da0d-41b9-ab53-27ec1ca13751","resolution":{"observed_at":"2026-08-12T04:49:35.032335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.014252Z","title":null,"venue":null,"work_id":"71ef333c-c5a7-4c69-974c-418211ecd662","year":null},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.465655Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:11c7811021703f30cffc4980cac1872e0bb0c71598937c3be32be72837ff080d","observation_id":"42407999-af0d-4843-9c5c-43c813337483","resolution":{"observed_at":"2026-08-12T04:49:35.018580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.985684Z","title":"Hellaswag: Can a machine really ﬁnish your sentence? In Anna Korho- nen, David R","venue":null,"work_id":"a2760c6e-8f77-4195-b0ae-42b11ea71b42","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.474079Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f1ae6640648e29731e8ad764e7439168a952302e4f7ed49c902253a08ddd9874","observation_id":"8cc604dd-0a84-4bfb-ac5e-869ec535b2d4","resolution":{"observed_at":"2026-08-12T04:49:34.990279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07057","last_updated":"2024-12-06T14:21:06Z","snapshot_observed_at":"2026-08-12T23:45:46.778615Z","submitted_at":"2024-06-11T08:38:13Z","title":"MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07057","snapshot_observed_at":"2026-08-12T04:49:34.478030Z","title":"Benchmarking trustworthiness of multimodal large language models: A comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.478030Z"},"links":{"cited_paper":"/paper/2406.07057","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:6c76a915a9096e0abebd9f8776c448d8d57b097bceb153d9b5c66d2415fc3695","observation_id":"79e80c6a-d471-4375-b5de-162f8947408f","resolution":{"observed_at":"2026-08-12T04:49:34.478030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.970870Z","title":"Reef- knot: A comprehensive benchmark for relation hallucinatio n evaluation, analysis and mitigation in multimodal large language model s, 2024","venue":null,"work_id":"1a37ae29-b538-4dd2-aa70-5f5ad8d1f163","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.482834Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f4ec7d4509bf48afce1f7439050780a88bba67becd6836c0789197d5b4e9e086","observation_id":"3f429688-6ded-4117-9a01-d6e88f1f15cd","resolution":{"observed_at":"2026-08-12T04:49:34.976392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.956191Z","title":"Revolutionizing data base q&a with large language models: Comprehensive benchmark and evalua tion, 2024","venue":null,"work_id":"b0d4fecd-234a-47f9-a8d4-d36499f4e878","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.486810Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:efdb3665ca775ce8b5acb5cca3bfe4989fdb8f8aa92b2332e7f89180c3bbdcf1","observation_id":"bb8602bc-0507-49ad-b393-0c6d3a0fdaff","resolution":{"observed_at":"2026-08-12T04:49:34.961429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-12T04:49:34.490762Z","title":"Instruction-followin g evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.490762Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:2da4115fa90f18e463e2e0ec52f894819a41bd4b5bf2e9053f83aa08026c748e","observation_id":"2207480c-5c0f-4a4c-9051-22aba14151ab","resolution":{"observed_at":"2026-08-12T04:49:34.490762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06349","last_updated":"2024-09-27T11:45:09Z","snapshot_observed_at":"2026-08-13T00:34:08.045808Z","submitted_at":"2024-04-09T14:40:08Z","title":"CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06349","snapshot_observed_at":"2026-08-12T04:49:34.495253Z","title":"Causalbench: A comprehensive benchmark for ca usal learn- ing capability of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.495253Z"},"links":{"cited_paper":"/paper/2404.06349","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:0f9facec9614ef03c768f6e664b3e9a210c5e00c1ea6fb8eccf1bc821b682051","observation_id":"56dd0cbf-1cce-40a4-965c-225238405a70","resolution":{"observed_at":"2026-08-12T04:49:34.495253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.940683Z","title":null,"venue":null,"work_id":"0d02e6ef-e194-406f-9994-f67beb57b3e4","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.499531Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:a9dfa200119ae054f6cd89bfd6f5e8c160f37e883d3567fa30fb6131a027a1f0","observation_id":"cf60c4e1-4baf-46d8-b430-995295a8caff","resolution":{"observed_at":"2026-08-12T04:49:34.946685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.999745Z","title":null,"venue":null,"work_id":"c1ec3a1e-02c9-405b-97a5-1bafd958d827","year":null},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.469869Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:31b45acee58379a143655d6d8bd3287427e5297d428b8388cd2664bd0f3589a0","observation_id":"3c1835ad-51b0-4747-97f1-e0064a538d51","resolution":{"observed_at":"2026-08-12T04:49:35.004190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-12T11:44:38.604463Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2412.01020."}