{"as_of":"2026-08-08T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3963599b0fd479013aa6951fc03acf08fd04d68b6dc9e7f04453b582a604fa49","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:08:17.955891Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00482/citation-record","integrity":"/paper/2506.00482/integrity","json":"/paper/2506.00482/citation-record.json","paper":"/paper/2506.00482"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:09.977304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:09.977304Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7f37197adcd46c3dcfb52bd13584545a4afc73c73b110c8dc45fc0b1500058d5","observation_id":"f5b9bc80-2b88-42ea-94a2-c81776cfe024","resolution":{"observed_at":"2026-08-07T12:08:09.977304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17761","last_updated":"2025-06-11T16:56:58Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:45:26Z","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17761","snapshot_observed_at":"2026-08-07T12:08:10.073701Z","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages.arXiv preprint arXiv:2406.17761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.073701Z"},"links":{"cited_paper":"/paper/2406.17761","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:339a1942feac846252a48ba12a02f8a4fdd4fc661dca651e8f9adb6f16f55f24","observation_id":"2efa816f-2096-493c-9719-742628342339","resolution":{"observed_at":"2026-08-07T12:08:10.073701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:08:10.157068Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.157068Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:513b3c9988cd0ab2a9cfa8c6bbc73d358d2c742ae8e93efa5dccffd7114d49dd","observation_id":"427b5538-3fc3-4592-a80a-46dc79315ec1","resolution":{"observed_at":"2026-08-07T12:08:10.157068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:10.225114Z","title":"Axolotl: Scalable fine-tuning framework for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.225114Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:0e463ea53998cd80ea5dd1c06fd328d9319b6f65fd02dda3e05d01546d09ff40","observation_id":"02652e39-b34d-480a-8d59-119b86945385","resolution":{"observed_at":"2026-08-07T12:08:10.225114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:10.311875Z","title":"PIQA: Reasoning about physical commonsense in natural language.Proceedings of the AAAI Conference on Artificial Intelligence, 34(05):7432–7439, Apr","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.311875Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:bf3a98b6c48ecbd5adc566782d0f58fe09168cc6eaea82a8359d92855b6724fb","observation_id":"70cf9db4-a008-4061-b223-5319f8215fd2","resolution":{"observed_at":"2026-08-07T12:08:10.311875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:08:10.404642Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.404642Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:1b8fceb726b9cc5cdcd9c3bd57bdd38e277dd63cf90238dce65beecf5b028a0c","observation_id":"7c7944e0-cd66-499e-acff-4d0ee4f76357","resolution":{"observed_at":"2026-08-07T12:08:10.404642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.787887Z","title":"Angelopoulos, Tianle Li, Dacheng Li, Banghua Zhu, Hao Zhang, Michael I","venue":null,"work_id":"ba76edee-bb29-4b8f-b6a3-7069c2e9cf55","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.504819Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:fc05fac694a068569e8790cc8972b30bcdd4548d05d12796f4f198d0395ced61","observation_id":"f7e73d9e-db43-402d-8436-39b403c66e3a","resolution":{"observed_at":"2026-08-07T12:08:28.925972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02677","last_updated":"2025-06-03T01:56:26Z","snapshot_observed_at":"2026-08-06T03:16:16.590345Z","submitted_at":"2024-10-03T17:04:31Z","title":"CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02677","snapshot_observed_at":"2026-08-07T12:08:10.604298Z","title":"CulturalBench: a robust, diverse and challenging benchmark on measuring the (lack of) cultural knowledge of LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.604298Z"},"links":{"cited_paper":"/paper/2410.02677","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8eb8d486223c9e4a7467c9b70bd52d559c9a0a7080581acdeb2402ba31964b6c","observation_id":"6deff245-bd09-4939-867c-5908395d103e","resolution":{"observed_at":"2026-08-07T12:08:10.604298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:08:10.688904Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.688904Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a98bd1401b04238856ca22df89c3be5a91cc5f8fe747c6e0d464fddc87a3c129","observation_id":"793c3c87-6d02-4ab3-aa89-120a638244cf","resolution":{"observed_at":"2026-08-07T12:08:10.688904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:08:10.759064Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.759064Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c877922f4f4f063a7ec50d38d8edda253fb518e80a24fbd9c1792759f80645b8","observation_id":"2828d71c-cc47-4304-8dec-f632bc8c7838","resolution":{"observed_at":"2026-08-07T12:08:10.759064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:08:10.838533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.838533Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:3caeaf795f91727dd5530bcfbe6cf763af6f1f597e9167fe92903d0820c56925","observation_id":"072cf44b-c212-4d71-b7d3-1275b99ec56c","resolution":{"observed_at":"2026-08-07T12:08:10.838533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.596766Z","title":"SciEx: Benchmarking large language models on scientific exams with human expert grading and automatic grading","venue":null,"work_id":"c80688cf-5689-4012-b387-5737865d419c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.913333Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:92a08165b23582536768d369ccb65b9803f25eb23b20ed1e4bd6ea9cdf2475a3","observation_id":"144866f4-6643-48b7-b0de-4ca0fff94548","resolution":{"observed_at":"2026-08-07T12:08:28.653087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:08:11.040928Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.040928Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c33c8990783c150871a83bfcf7c3958e40aaa7fb34a8c50d63f234c75af3e222","observation_id":"c622398f-affd-4769-8e73-e3cb93c2f173","resolution":{"observed_at":"2026-08-07T12:08:11.040928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:08:11.143287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.143287Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:32e95a2dd5110360902dfe0565800e682d69723369af944417ae6e1ad042ac48","observation_id":"8c027e46-3d15-4ef3-8b6c-d084e209aa6b","resolution":{"observed_at":"2026-08-07T12:08:11.143287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09823","last_updated":"2025-05-30T14:06:34Z","snapshot_observed_at":"2026-08-07T10:08:12.334437Z","submitted_at":"2024-07-13T09:34:00Z","title":"NativQA: Multilingual Culturally-Aligned Natural Query for LLMs","version":3},"cited_work":{"arxiv_id":"2407.09823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.09823","snapshot_observed_at":"2026-08-07T12:08:18.292504Z","title":"NativQA: Multilingual Culturally-Aligned Natural Query for LLMs","venue":"cs.CL","work_id":"feabbf90-ef23-4d28-9f2e-91119897b54d","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.225092Z"},"links":{"cited_paper":"/paper/2407.09823","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ccc3080eda46b34db7d139238cc7eaf52af4ad2ab7efb9f1ee68e0139a9a563a","observation_id":"d306e540-5cc0-4a1f-b69b-a6d272c47262","resolution":{"observed_at":"2026-08-07T12:08:18.380004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:11.314107Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.314107Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ae7b449d6b834bef16a1ce26b4a1e92e11fc197310c683827f08c74940a3e5b6","observation_id":"a19cbe23-d5a2-425a-beb6-719f4e207aa6","resolution":{"observed_at":"2026-08-07T12:08:11.314107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:11.398525Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.398525Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:1509e691e68b19da63511e848632de125a6fba09fb2516885559fadf45568776","observation_id":"5c2d87d0-10fe-4bec-862b-7d175d674e06","resolution":{"observed_at":"2026-08-07T12:08:11.398525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.342774Z","title":"MedQA-SWE - a clinical question & answer dataset for Swedish","venue":null,"work_id":"6d9199a2-8048-4da1-bbfa-e1acf2167696","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.541072Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:d4f5101f975dec7a7a5d06cf090e779c55a454d231a36a0c69c27dc337d9cfa1","observation_id":"e2c7b2e9-2678-4c5d-807b-1346ce605d34","resolution":{"observed_at":"2026-08-07T12:08:28.428624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-07-06T19:33:26.078722Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-07T12:08:11.651962Z","title":"Liger kernel: Efficient triton kernels for llm training.arXiv preprint arXiv:2410.10989, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.651962Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:34050f36778045d40a394762e8277267dca96b73d43affea1e376571f60d3bad","observation_id":"91da4474-d693-434e-be15-8ab7ed1a45b5","resolution":{"observed_at":"2026-08-07T12:08:11.651962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04428","last_updated":"2025-07-04T03:19:53Z","snapshot_observed_at":"2026-07-06T18:26:46.402024Z","submitted_at":"2024-06-06T18:15:01Z","title":"MoralBench: Moral Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04428","snapshot_observed_at":"2026-08-07T12:08:11.740741Z","title":"MoralBench: Moral evaluation of LLMs.arXiv preprint arXiv:2406.04428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.740741Z"},"links":{"cited_paper":"/paper/2406.04428","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7d001662838d2dc06a41011b4fd531929ef5cf820b1994f888270506bb424c1a","observation_id":"b0849f0c-eafa-4615-97f2-6f26cd597f58","resolution":{"observed_at":"2026-08-07T12:08:11.740741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.046724Z","title":"KoBBQ: Korean bias benchmark for question answering.Transactions of the Association for Computational Linguistics, 12:507–524, 2024","venue":null,"work_id":"956fc9d3-cab5-41c5-b1c6-fd7e1bf4a08c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.856041Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:3351c87eb4c2e78fa996d1fe6299a8864c86aaf5cc48c9b921349c7667b45324","observation_id":"384af186-ac2b-4525-9d81-b3fc01d6e567","resolution":{"observed_at":"2026-08-07T12:08:28.176490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.785054Z","title":"Dynabench: Rethinking benchmarking in NLP","venue":null,"work_id":"a96c0c49-e918-41b1-a30f-aac935dedee3","year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.960334Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:9ee817a707fd94ecc1929b2dd101022cc7b958223ee73c323951b177d1f4338c","observation_id":"b5c7092a-64d8-4ce1-afb6-19c1b56f2281","resolution":{"observed_at":"2026-08-07T12:08:27.926812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.468824Z","title":"CLIcK: A benchmark dataset of cultural and linguistic intelligence in Korean","venue":null,"work_id":"f6bc4938-5a21-4b52-8633-22c57c36aaec","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.098448Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:705969a96e38a5a7cddb3fed979f01a659c2a65c110862808795dd770e6da70e","observation_id":"7c1e2b82-d1b1-49cf-8110-794e6fa5f3f2","resolution":{"observed_at":"2026-08-07T12:08:27.623537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.218353Z","title":"Developing a pragmatic benchmark for assessing Korean legal language understanding in large language models","venue":null,"work_id":"a1738b4f-1078-44e7-ab84-15edf4af5786","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.199734Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a19ca2cdaca380110f9ac345ed4b67aea5b3676d817660fcd45a99615d56c03c","observation_id":"1db570e7-318b-486f-88f3-dddbcd66b252","resolution":{"observed_at":"2026-08-07T12:08:27.371801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02448","last_updated":"2025-01-31T07:32:07Z","snapshot_observed_at":"2026-07-06T20:16:40.311377Z","submitted_at":"2025-01-05T05:57:22Z","title":"Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02448","snapshot_observed_at":"2026-08-07T12:08:12.304393Z","title":"Understand, solve and translate: Bridging the multilingual mathematical reasoning gap.arXiv preprint arXiv:2501.02448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.304393Z"},"links":{"cited_paper":"/paper/2501.02448","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:89dba3e971b2f8f9f83460a4f7a9be7f022a15095dcb5db0f0a503e4ac2f616c","observation_id":"8c49a033-ff53-4aec-b58c-66fc59956c6d","resolution":{"observed_at":"2026-08-07T12:08:12.304393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.803300Z","title":"The NarrativeQA reading comprehension challenge","venue":null,"work_id":"fafe9c82-4b60-4343-ab13-b06f3f5b1f08","year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.414934Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ec6da6d04b97d0a087dc6696c8313339f7a4330ee52478d83a41b129185ff768","observation_id":"5623cccb-be36-42ef-b4fe-07c8e3111493","resolution":{"observed_at":"2026-08-07T12:08:27.027075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01469","last_updated":"2024-12-09T06:52:13Z","snapshot_observed_at":"2026-07-06T17:38:47.079643Z","submitted_at":"2024-03-03T10:31:49Z","title":"KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01469","snapshot_observed_at":"2026-08-07T12:08:12.530994Z","title":"KorMedMCQA: multi-choice question answering benchmark for korean healthcare professional licensing examinations.arXiv preprint arXiv:2403.01469, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.530994Z"},"links":{"cited_paper":"/paper/2403.01469","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:6cbded4fb00942cfcac941ca9a0fb97f16708e8f8f21796ca628a05e49797c6a","observation_id":"7b21840f-e276-48e2-99dc-7b9e718c39b8","resolution":{"observed_at":"2026-08-07T12:08:12.530994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:12.613938Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.613938Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:f234b20d6e1c3c97ac347266679ed8bc5ba354066f176362b5ed37c7476c0119","observation_id":"51d8d5d0-d31e-4d17-9557-1320c5baa8c3","resolution":{"observed_at":"2026-08-07T12:08:12.613938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.551678Z","title":"KoSBI: A dataset for mitigating social bias risks towards safer large language model applications","venue":null,"work_id":"ba757104-f19a-43fe-a300-48d0aa9b6152","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.725096Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:f2e707cf8a9c8892472036fbb2cf4451a6b51784839b994694e844ed0afa68b6","observation_id":"6c3d54d9-ab05-4870-a72c-8534c0f1cf09","resolution":{"observed_at":"2026-08-07T12:08:26.686665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.280697Z","title":"KorNAT: LLM alignment benchmark for Korean social values and common knowledge","venue":null,"work_id":"6773a2ad-3b6f-4a98-b4b5-bc50c0e882c4","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.848365Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:f8aebd55070166ce17c7ee206bfe32cf7b647df67b6610df3a737721849d2576","observation_id":"aa081316-6729-4805-b54c-00c92fb35d73","resolution":{"observed_at":"2026-08-07T12:08:26.394750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17259","last_updated":"2024-12-23T04:02:46Z","snapshot_observed_at":"2026-07-06T20:11:55.722067Z","submitted_at":"2024-12-23T04:02:46Z","title":"LegalAgentBench: Evaluating LLM Agents in Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17259","snapshot_observed_at":"2026-08-07T12:08:12.933539Z","title":"LegalAgentBench: Evaluating LLM agents in legal domain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.933539Z"},"links":{"cited_paper":"/paper/2412.17259","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:92804e0d6e1aaf0968c8834219b0cffc61b54bf8e2c0f975266e54396d3fec1b","observation_id":"6b5fb4e9-c1fb-4fef-982b-9a5323918bb6","resolution":{"observed_at":"2026-08-07T12:08:12.933539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.950435Z","title":null,"venue":null,"work_id":"7df34952-f61f-414c-87dd-e40493e3a624","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.031385Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:49e754b157d974cbb52edbc09828865c950b6ba0b3fd55fb4cae0a878f559860","observation_id":"67f7a762-27b5-4fb1-b424-061269a1fc1d","resolution":{"observed_at":"2026-08-07T12:08:26.087765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:13.117735Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.117735Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e1b21cf97e13914947f0be3d1ebc1a997ddf1db9da1e75de2d178d47b626e5cd","observation_id":"0d952236-2223-4d8c-ad29-5afd2ade9bda","resolution":{"observed_at":"2026-08-07T12:08:13.117735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.785191Z","title":"Benchmark data repositories for better benchmarking","venue":null,"work_id":"f93ac7f4-c2ac-4325-b3ec-2b3be8d6c24c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.193135Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:47b851a6001d482e0a517c2dffe4f64986d21f5727793410bb7f75b99d03c58c","observation_id":"9543c30d-1994-4996-b889-20b8a5679c43","resolution":{"observed_at":"2026-08-07T12:08:25.844219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.478462Z","title":null,"venue":null,"work_id":"860df4da-709f-4f08-8c45-da4a71ff02eb","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.299417Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:857f9fb4001830262cb2dd334b6b1a8fc60ee796cd8009920f38bf553b851c23","observation_id":"8efbfdfb-c22c-4d53-8960-c00821637f53","resolution":{"observed_at":"2026-08-07T12:08:25.663250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.224213Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"5f34373d-321b-4050-9eb0-d4228f68ffe5","year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.416530Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:05a1013d247c28ab139564a21f3787477d8cf307bd703a8f7c8247f2ac922834","observation_id":"3e283af4-44c8-41ed-937e-5f530e085286","resolution":{"observed_at":"2026-08-07T12:08:25.342672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.997447Z","title":"FActScore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"d6378f34-543c-4d17-834e-fe3439ec82d1","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.497724Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:acc2e900131d1272846dcd838488547d5295ea0d06c985951428b3b3c8d69bbd","observation_id":"ab79f9d2-19ed-49ae-92f0-8831166b35e3","resolution":{"observed_at":"2026-08-07T12:08:25.078670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14996","last_updated":"2025-06-08T14:56:13Z","snapshot_observed_at":"2026-08-07T16:52:48.017259Z","submitted_at":"2025-03-19T08:45:03Z","title":"Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14996","snapshot_observed_at":"2026-08-07T12:08:13.563546Z","title":"Right answer, wrong score: Uncovering the inconsistencies of llm evaluation in multiple-choice question answering.arXiv preprint arXiv:2503.14996, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.563546Z"},"links":{"cited_paper":"/paper/2503.14996","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:1bc2ed8c4a9b908befe736983e0db06c3e1b99458777c655b8e4f81fe85e806b","observation_id":"e86d7949-42bc-49ed-886f-eb7ae1559373","resolution":{"observed_at":"2026-08-07T12:08:13.563546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.720883Z","title":"BLEnD: A benchmark for llms on everyday knowledge in diverse cultures and languages","venue":null,"work_id":"f1f5563b-3217-44e6-a9b7-f4820383c98b","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.674542Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8d6881797035e7ddb3bf5c48b48423fbab71e927a3feb19a2abd90a5b2d4ed91","observation_id":"970e71b2-80f9-4235-8a20-6bc47dc0dba2","resolution":{"observed_at":"2026-08-07T12:08:24.796108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.411164Z","title":"Extracting cultural commonsense knowledge at scale","venue":null,"work_id":"13bd1c89-93c9-4da7-964d-7cf6edeb2500","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.809086Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8a4e7373d37f94489599027631a4b0f89c8381bf6b03587b539693941d26af5a","observation_id":"b746cf2b-6230-403e-8f8f-4ca4330ee10b","resolution":{"observed_at":"2026-08-07T12:08:24.597620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.154469Z","title":"MixEval: Deriving wisdom of the crowd from LLM benchmark mixtures","venue":null,"work_id":"b7cab4d7-4d10-47ca-baca-45c6355889e3","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.880832Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8c8c68c60538df6833756544637266e0d7cef84446768062fa51193911419d24","observation_id":"dc5d50d0-ff3c-4ea3-9cf0-2eff798a6137","resolution":{"observed_at":"2026-08-07T12:08:24.233222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:13.986625Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.986625Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:71c70b5551f04271d512b16437ec6afec8b34c1fce78e4d7cad8e91e59927d66","observation_id":"a167dabf-4945-4a79-84f1-5217c4f6ea1f","resolution":{"observed_at":"2026-08-07T12:08:13.986625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.884405Z","title":"BBQ: A hand-built bias benchmark for question answering","venue":null,"work_id":"d0cf95b4-4bbe-4c5f-90df-7fd80f57354f","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.078274Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:3a9093e866918cba6ebecff24c8e79f506904ae156d4374791b64e8e366f99fa","observation_id":"c92b6544-3460-43fc-b53b-4942d32311cf","resolution":{"observed_at":"2026-08-07T12:08:24.031957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00860","last_updated":"2024-10-30T16:37:50Z","snapshot_observed_at":"2026-08-04T11:25:05.624764Z","submitted_at":"2024-10-30T16:37:50Z","title":"Survey of Cultural Awareness in Language Models: Text and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00860","snapshot_observed_at":"2026-08-07T12:08:14.144191Z","title":"Survey of cultural awareness in language models: Text and beyond.arXiv preprint arXiv:2411.00860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.144191Z"},"links":{"cited_paper":"/paper/2411.00860","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a9bd1c8e5f425d43e7c90f56f95ae1f60f8031fd0b61c9315f435d7c3e5f47db","observation_id":"b115779b-e43d-467f-9b5d-3848fd76cf1a","resolution":{"observed_at":"2026-08-07T12:08:14.144191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.580325Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models","venue":null,"work_id":"58fd5263-c126-4ccd-8d0a-0a321b512770","year":2020},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.231714Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ca347539bedd788ade13ab09c83b66520047435efc8aaaf25a2026945fd642b6","observation_id":"434e5316-32d9-4fce-937c-0ebbae8b572c","resolution":{"observed_at":"2026-08-07T12:08:23.722060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.254477Z","title":"NormAd: A framework for measuring the cultural adaptability of large language models","venue":null,"work_id":"07a1bda5-a4c6-44ea-88d4-f3048d257ebe","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.335556Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:78bce3d74171b829364e222eb46154bbecf532b3067254c69b8f96c279411aeb","observation_id":"431e4c29-6e41-4595-958d-42b3722aa736","resolution":{"observed_at":"2026-08-07T12:08:23.401621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.922562Z","title":"DiversityMedQA: A benchmark for assessing demographic biases in medical diagnosis using large language models","venue":null,"work_id":"e57402d0-9469-475f-9e8b-3c3a3571c58c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.581006Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:276f2d7dcffd0b87f5b44ddcee6f4ec073b4370c8c5dd3d861f62388c0cb2173","observation_id":"5fc97c41-d2a5-466c-9cd3-876a0506eda3","resolution":{"observed_at":"2026-08-07T12:08:23.085948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.670158Z","title":null,"venue":null,"work_id":"c39b3a76-5398-44ba-8654-b8e0551b4062","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.691459Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c8f3e178ea13ae78096466c9b12f1efac5bc35a543bd603a7d9e16c116862fa3","observation_id":"a931e440-3305-4057-84b3-49e2394adb4d","resolution":{"observed_at":"2026-08-07T12:08:22.795446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.478722Z","title":"Kochenderfer","venue":null,"work_id":"050560bd-7ab5-4501-a55b-edbe0e0af7bb","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.833051Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:710ac48f5949f365ceb5aa359b166c61ced28673e69f4f85aef191fc66a6b387","observation_id":"29c42e3f-8d2a-4402-9d66-c368ccbf24cb","resolution":{"observed_at":"2026-08-07T12:08:22.550842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.277229Z","title":"WinoGrande: an adversarial winograd schema challenge at scale.Commun","venue":null,"work_id":"f00554d7-8b0c-4e21-b539-d14fbe0d5891","year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.924761Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:977c59ab4d6e3d3add0661b6f842cda743440fce766a5c76d8c7b64baf9f8b5b","observation_id":"32256750-95a7-49dc-bd84-fbcc2c0f5f5e","resolution":{"observed_at":"2026-08-07T12:08:22.369793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.056867Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"27b96a7d-9901-48b8-b890-e58b4a76d526","year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.015768Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:b023892a92b62afd97eb394a36672d8da24dc1ec98cab929274747127d1ed3a0","observation_id":"cc6416ba-d929-4711-95aa-cd19b259b7d7","resolution":{"observed_at":"2026-08-07T12:08:22.146589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.798174Z","title":"Benchmarks as microscopes: A call for model metrology","venue":null,"work_id":"b7ceb100-9431-4e6a-bc97-10803a9e3c20","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.107192Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:255af1fefa4c6dff3f765fa4dea8569109f765644de419f437387df3b659d931","observation_id":"597877f1-8911-4dba-b89d-f29fbcd96adb","resolution":{"observed_at":"2026-08-07T12:08:21.940061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.556843Z","title":"Multi-fact: Assessing factuality of multilingual llms using factscore, 2024","venue":null,"work_id":"06323b99-5899-4b37-a786-b822bf319beb","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.229945Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:358901bcbfef9dd19ecdc2bc214526ce7b3e27d226094988e42a07c41c06da7a","observation_id":"7db6d897-08bd-47d6-854d-be04c1ce887e","resolution":{"observed_at":"2026-08-07T12:08:21.694305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01833","last_updated":"2025-04-02T15:40:24Z","snapshot_observed_at":"2026-08-07T16:14:17.068940Z","submitted_at":"2025-04-02T15:40:24Z","title":"YourBench: Easy Custom Evaluation Sets for Everyone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01833","snapshot_observed_at":"2026-08-07T12:08:15.321570Z","title":"Yourbench: Easy custom evaluation sets for everyone.arXiv preprint arXiv:2504.01833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.321570Z"},"links":{"cited_paper":"/paper/2504.01833","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7fa0b97a4ee2c87c3b3d1f38f43da56e6ae7546857644d0421945fa7f2dc92d8","observation_id":"1d3478be-d6f6-4cab-b9db-7783e1a7ad1d","resolution":{"observed_at":"2026-08-07T12:08:15.321570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.255500Z","title":"CultureBank: An online community-driven knowledge base towards culturally aware language technologies","venue":null,"work_id":"b2b6b82c-c715-4ed5-84e8-95423eb1e54f","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.440338Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7baa7fa7346869acbdf265a8d2e10afa665d9ce90ccb2ab44aeb0ad7dceac158","observation_id":"ac95e546-01e9-4a9e-b94c-0804e1c866ba","resolution":{"observed_at":"2026-08-07T12:08:21.384899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-07T12:08:15.542569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.542569Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7381fd2152986dbc7a9c11f3901c31a97ed62f945eb77a181c16b246642ae84f","observation_id":"2632e0cc-e035-437f-9565-3dfdb648bb34","resolution":{"observed_at":"2026-08-07T12:08:15.542569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.078408Z","title":"KRX bench: Automating financial benchmark creation via large language models","venue":null,"work_id":"236d8aab-e93c-44f9-9dbb-b81c8e256243","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.639270Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:3f1ddf50e646a2752ce321179747c1f2d5b23e523042b04fdaeaf0df06e43b4a","observation_id":"26e37416-51ce-415c-9642-e621f807dab6","resolution":{"observed_at":"2026-08-07T12:08:21.170385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01505","last_updated":"2023-06-25T18:06:25Z","snapshot_observed_at":"2026-08-04T00:07:20.386426Z","submitted_at":"2023-04-30T04:36:05Z","title":"Beyond Classification: Financial Reasoning in State-of-the-Art Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01505","snapshot_observed_at":"2026-08-07T12:08:15.739015Z","title":"Beyond classification: Financial reasoning in state-of-the-art language models.arXiv preprint arXiv:2305.01505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.739015Z"},"links":{"cited_paper":"/paper/2305.01505","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:639fc8a4747eebf7d8a36fead7b0632397d2528217a48c68695e800f2c618109","observation_id":"ad0d7d1a-0d36-4340-9651-9a858d447735","resolution":{"observed_at":"2026-08-07T12:08:15.739015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.877454Z","title":"Multi-step reasoning in Korean and the emergent mirage","venue":null,"work_id":"d09da19a-b8d7-476c-ac2a-95d89409dc1c","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.828572Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:887b416c05b55a1cfce1888de98b25a02afa93c5c8b456afa44ba91a1f087875","observation_id":"3201edf1-4f3e-4d99-a74a-b41de35e9f1c","resolution":{"observed_at":"2026-08-07T12:08:20.945080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.681082Z","title":"KMMLU: Measuring massive multitask language understanding in Korean","venue":null,"work_id":"e2816e51-64f2-4b55-9252-5ec218df0003","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.911316Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:703a08378caaa76798569552782a95d57a7b3993784c3a747fea73f908a32182","observation_id":"624cdaba-8ce7-4ba1-b8f4-cfe3cd287df1","resolution":{"observed_at":"2026-08-07T12:08:20.774825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.472673Z","title":"HAE-RAE bench: Evaluation of Korean knowledge in language models","venue":null,"work_id":"d52acaab-d741-48a8-acbf-f65cac04c692","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.003057Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:30a3fd91a33d086b9bb49ec5e2afb659adb0bbe9a4c6cab8160b6475b145dd83","observation_id":"062acff7-3666-48da-83a3-d3376048856b","resolution":{"observed_at":"2026-08-07T12:08:20.551437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.307052Z","title":"Challenging BIG-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"02eead44-754b-4b67-a112-0d9eab08fe4e","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.099651Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ce9f182ea92ba2b3cd30be3f4658addd6cc29ae25fbec15823a7c48ba9e51d71","observation_id":"51cdb724-54f3-47c5-9fc7-280e106df693","resolution":{"observed_at":"2026-08-07T12:08:20.366551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02257","last_updated":"2024-10-15T18:37:03Z","snapshot_observed_at":"2026-07-06T19:10:04.150678Z","submitted_at":"2024-09-03T19:31:03Z","title":"MMLU-Pro+: Evaluating Higher-Order Reasoning and Shortcut Learning in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02257","snapshot_observed_at":"2026-08-07T12:08:16.178310Z","title":"MMLU-Pro+: Evaluating higher-order reasoning and shortcut learning in llms.arXiv preprint arXiv:2409.02257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.178310Z"},"links":{"cited_paper":"/paper/2409.02257","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:cc61ddda81eb4d93e10fe462856aa994db834959c8444b1119bc20669eebcd4b","observation_id":"f7a0cb8e-86be-4b03-ac03-4c9eb57a57ad","resolution":{"observed_at":"2026-08-07T12:08:16.178310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:16.285247Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.285247Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:07475525e08a5c2246d176a8bea0ec51984b288d4fc838cba9ac73258c71e43d","observation_id":"432bf232-706d-4036-b311-207966c0a5a0","resolution":{"observed_at":"2026-08-07T12:08:16.285247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T12:08:16.366173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.366173Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a65cb0b471a74460588a8d2e47eb28e2e0d1414fdd0800f9b933f5e3f60bb046","observation_id":"00d892b9-90c2-4f7b-a54b-7846b57cd4c5","resolution":{"observed_at":"2026-08-07T12:08:16.366173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.108331Z","title":"Benchmark suites instead of leaderboards for evaluating AI fairness.Patterns, 5(11):101080, 2024","venue":null,"work_id":"e371971e-7704-42e8-a2e5-1eb26a571980","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.462836Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:93093d17b8681c7139bbcc9d46ad695f73f6999f274c76d511c57df6f2a81fed","observation_id":"4b644f29-8f98-4946-a501-c1d937aec4bd","resolution":{"observed_at":"2026-08-07T12:08:20.206356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.917545Z","title":"SeaEval for multilingual foundation models: From cross-lingual alignment to cultural reasoning","venue":null,"work_id":"81749611-4dcf-4773-8b5e-867ff82b79d8","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.586923Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e201f8d511fc5d76afe0c78645469c19991a088ae00bb18418ba150b504022a7","observation_id":"6098c32e-3b67-48eb-92a2-d20244f6f03a","resolution":{"observed_at":"2026-08-07T12:08:19.993735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07251","last_updated":"2024-12-10T07:20:51Z","snapshot_observed_at":"2026-08-01T07:08:12.448245Z","submitted_at":"2024-12-10T07:20:51Z","title":"KULTURE Bench: A Benchmark for Assessing Language Model in Korean Cultural Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07251","snapshot_observed_at":"2026-08-07T12:08:16.759287Z","title":"KULTURE Bench: A bench- mark for assessing language model in Korean cultural context.arXiv preprint arXiv:2412.07251, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.759287Z"},"links":{"cited_paper":"/paper/2412.07251","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8f4f2bd0ebad38d4bfa567e6be7850d5019cf425cbc9231504054832bec25499","observation_id":"1fd0d21e-54f8-4e60-83f6-9b48a90b3a76","resolution":{"observed_at":"2026-08-07T12:08:16.759287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.745569Z","title":"Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks","venue":null,"work_id":"3da439e7-f237-4029-a6f2-25d968a5f8df","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.857171Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:18c32bca0285367f04f4240ca8c9bce9440e701b21b53963dce5985701729a5f","observation_id":"49db165a-1c43-4554-97df-544abd4e6381","resolution":{"observed_at":"2026-08-07T12:08:19.840752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.552242Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"a75c1979-a521-47b7-afb0-8234d4d9d65c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.951540Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:08903633d327ac1aa0ee256e8978f5d59c5dd4b5fe91bb3311da7607f037dbc4","observation_id":"af13bd18-0319-4209-a00e-594f1aa283f0","resolution":{"observed_at":"2026-08-07T12:08:19.656148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-07T17:22:23.185186Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-07T12:08:17.035975Z","title":"Toward an evaluation science for generative AI systems.arXiv preprint arXiv:2503.05336, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.035975Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:024517f16a493eb1e7c6e384932f11bf431425a9268569144edbf26d2fb957ea","observation_id":"f44943f3-cb76-4bfa-aeeb-bf86bf08a589","resolution":{"observed_at":"2026-08-07T12:08:17.035975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T12:08:17.152295Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.152295Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ed00305c9707c01641ffedfb389a64361dad6e9fb7b2e5c85d62e4c4b731e1d1","observation_id":"a3199245-1f8c-4d78-958b-bed6e0247619","resolution":{"observed_at":"2026-08-07T12:08:17.152295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:08:17.279546Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.279546Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:bb638ac33322b2f1015e26485087f88077656f84a04735d878151b3a131ea76c","observation_id":"e2d4076c-8373-42b7-bbb3-a99321d88f7a","resolution":{"observed_at":"2026-08-07T12:08:17.279546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-07T12:08:17.369531Z","title":"Rethinking benchmark and contamination for language models with rephrased samples.arXiv preprint arXiv:2311.04850, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.369531Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a100d5d481d4c7e71944c2b0048e215e196234a6f0aadace65e23db2e46ca261","observation_id":"0a0588e0-0c37-4bd2-95fb-f1c7e168d36e","resolution":{"observed_at":"2026-08-07T12:08:17.369531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.345420Z","title":"FLASK: Fine-grained language model eval- uation based on alignment skill sets","venue":null,"work_id":"3ec9009a-7ccc-48b3-b64e-c511931ebc86","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.447929Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:3fbf56aa0b16bc937e30eca07e1daf4f9b690c984f9403f308792ab3bd22c532","observation_id":"bc172362-c9b7-4ef7-9b97-e23956a44a2b","resolution":{"observed_at":"2026-08-07T12:08:19.440683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.190681Z","title":"GeoM- LAMA: Geo-diverse commonsense probing on multilingual pre-trained language models","venue":null,"work_id":"dfef4512-8347-47a3-bbc9-82a0f178c908","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.503711Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:39c98030efde5ecb91633525309de5fdbe42ce1129a0c3cdc3153f1c8c5194ba","observation_id":"7da61289-4ca5-42d3-86b8-83542a2efdc6","resolution":{"observed_at":"2026-08-07T12:08:19.253520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:17.614168Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.614168Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:5a7ea67a5e4ddbf46299bf372fa68209f845fb26a99fb5ff9bd34dc3f15ecb51","observation_id":"725c2996-fa56-420c-b4f4-d17e36ae7af6","resolution":{"observed_at":"2026-08-07T12:08:17.614168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.051182Z","title":"Maruf Hossain, Guang- Jie Ren, Kate Soule, Yifan Mai, and Yada Zhu","venue":null,"work_id":"4ffa2e02-955f-4b89-b3e4-ca95011fde49","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.692121Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:96437d643762c39200e27b5e887b108c9fcfc5f688b9b5c92d7780759f13d589","observation_id":"ad13bf2f-b95b-429a-96e4-7f7b91ef36e0","resolution":{"observed_at":"2026-08-07T12:08:19.085125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.920738Z","title":"Task me anything","venue":null,"work_id":"93f0d2dc-0ce9-44f2-bb51-47bb8d093339","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.749553Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:919133b190382f8e0df57f6ed3b6801d8c4ab7ec7e62e58756c0240b8ca2d335","observation_id":"29a84389-3535-41e3-85c8-51ccf4318ed9","resolution":{"observed_at":"2026-08-07T12:08:18.975615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.796635Z","title":"Users can interactively explore the overall data distribution they are interested in","venue":null,"work_id":"eff66f0d-7954-4d75-9a44-9a76395dc40d","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.836203Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c8105499a41fb4f551002534ad987dab3faa3d158ca657b89b3cf0d53ecfdd8b","observation_id":"86d268ff-e827-4c90-a2e4-463393160202","resolution":{"observed_at":"2026-08-07T12:08:18.847818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.686907Z","title":"By reviewing samples, users can verify whether the dataset matches their needs and explore datasets suitable for their purposes","venue":null,"work_id":"4dbedd8c-4f21-4aa1-9737-4bd624fe6987","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.905218Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e0a4153fd1f3ef6f39f088ae2520f9fce11f8e1fd57fa5bc81ff791e85da00db","observation_id":"e0de9c67-b6cb-47e7-acf9-528c7ec99ed7","resolution":{"observed_at":"2026-08-07T12:08:18.739965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.555287Z","title":"Is the Earth flat?","venue":null,"work_id":"0637a14b-4681-49e5-9536-13a1d29ea058","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.955891Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:6babe48631172d1ff6e7426ac4bfbb8e94426e3d4a7e4d3d1a6175eeb4e759a8","observation_id":"7f2adf41-922e-4c81-9f4c-6dc5c22c83cd","resolution":{"observed_at":"2026-08-07T12:08:18.606763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:16.678445Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.678445Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:f01fb884cf2edda371948f4c7387319400810db795b0df513bac85528e3d9014","observation_id":"88c7fafc-7f12-49be-82bc-bc53c5530e79","resolution":{"observed_at":"2026-08-07T12:08:16.678445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:01:57.559855Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2506.00482."}