{"as_of":"2026-08-08T04:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb34daf29bcca9b6bb1898c51d67f01b02f3b91043345661727af752f4598e9","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:24:09.129500Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28801/citation-record","integrity":"/paper/2607.28801/integrity","json":"/paper/2607.28801/citation-record.json","paper":"/paper/2607.28801"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.337433Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.337433Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:d201030314fee0a2acf9b16d0b12b425791a029157a526e2e5a4a267878c5a39","observation_id":"71901d54-e696-49e1-9fb7-68086feb2bf4","resolution":{"observed_at":"2026-08-03T00:24:08.337433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.459171Z","title":"no\" | \"partial","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.459171Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:07de1526decea23df6b09fb01ecd94a36f79e0f1c141f17f7bf5d5c6b4f148ec","observation_id":"ae4c4257-e350-4b93-9931-7ba31d78942b","resolution":{"observed_at":"2026-08-03T00:24:08.459171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.527171Z","title":"no\" | \"partial","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.527171Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:e80b8fede020b090a9e7335ce5c26acb3f438a67b05895ee9a4f1e728b7bf173","observation_id":"b652f6b8-d0ca-4363-997a-e02245f5efbf","resolution":{"observed_at":"2026-08-03T00:24:08.527171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.573680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.573680Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:7e49e6e6e53f57247a0ebf353aa916f94685a5599399e5f2efb42a19a2fc732c","observation_id":"7babb2c5-a3ae-42d1-b600-14e458faefea","resolution":{"observed_at":"2026-08-03T00:24:08.573680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.658583Z","title":"indicators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.658583Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:f4a0005e3984c2963f92fad6773af6cc8e9f0245a926fd5934b1b9ca80659603","observation_id":"92bb0f0a-dfff-4bf0-a3a2-113b0da1c287","resolution":{"observed_at":"2026-08-03T00:24:08.658583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:09.045561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:09.045561Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:1aed27ee5594272ad8c3e5cfc1897bd7584cee0ebad06d58ed8c02cb081cd828","observation_id":"9bf64def-82c1-4e3e-a22d-ef528c058aee","resolution":{"observed_at":"2026-08-03T00:24:09.045561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:09.129500Z","title":"id\": 0,","venue":null,"work_id":null,"year":1943},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:09.129500Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:c65a21ab5063a267528240778dac83650db266818ea0389657b6e89a44a77c09","observation_id":"b6b0d61b-97e4-4b28-9e74-bbd63b46f414","resolution":{"observed_at":"2026-08-03T00:24:09.129500Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.743785Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.743785Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:b09f55353b508ab93576cacfba41ea2113afc1b571d25e11a6d8ba5f2e2ac87a","observation_id":"07bc2473-1133-4dfa-82eb-2bf9deaf358f","resolution":{"observed_at":"2026-08-03T00:24:08.743785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.794384Z","title":"Use [] if none apply","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.794384Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:2a8addfe82963e23e468887e878df20c0892337b5b4ba4bd7f93cb9a2da1c3bb","observation_id":"f041bf89-8cf9-404c-af89-5bebd5edf38c","resolution":{"observed_at":"2026-08-03T00:24:08.794384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.858764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.858764Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:d024057d1c3c29d355d9bb4a6cac7ad7cb03af5e42d2d25669e336a4d582938f","observation_id":"a637ccb8-24be-4281-8843-cb94ea8d1144","resolution":{"observed_at":"2026-08-03T00:24:08.858764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.904349Z","title":"\"partial\", not 1)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.904349Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:7c423696a156b3cfd5efc164801be5553cec7f07ca6aa0df9ce23fde1cee4102","observation_id":"d398dcca-c530-406a-8137-480ffc9b56f0","resolution":{"observed_at":"2026-08-03T00:24:08.904349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.985611Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.985611Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:017a3282c2b413fa25e204b6edd87763309901ac935e5eaabbff8facad391156","observation_id":"1a2224b6-7ca7-4aac-9322-d545e90376d7","resolution":{"observed_at":"2026-08-03T00:24:08.985611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-03T00:24:08.131704Z","title":"acl-short.118/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.131704Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:d96f7d0ef2996487493ae9c79a6fe135aa8ac3cffbb0d828dd0834f21f0126c7","observation_id":"01abc87a-b506-4d56-a5c8-6699f866b788","resolution":{"observed_at":"2026-08-03T00:24:08.131704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14337","last_updated":"2021-04-07T17:49:17Z","snapshot_observed_at":"2026-08-03T23:24:34.241550Z","submitted_at":"2021-04-07T17:49:17Z","title":"Dynabench: Rethinking Benchmarking in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14337","snapshot_observed_at":"2026-08-03T00:24:07.971141Z","title":"emnlp-main.306/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":306,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:07.971141Z"},"links":{"cited_paper":"/paper/2104.14337","citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:4540768c78c8d779c181e19f0149aebd1e0e482862d35d1cc82ac03cba68f575","observation_id":"d18b0e1a-4d83-4284-a968-2162598b044d","resolution":{"observed_at":"2026-08-03T00:24:07.971141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09301","last_updated":"2018-04-25T00:46:14Z","snapshot_observed_at":"2026-07-06T06:35:16.414488Z","submitted_at":"2018-04-25T00:46:14Z","title":"Gender Bias in Coreference Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09301","snapshot_observed_at":"2026-08-03T00:24:08.044702Z","title":"acl-main.442/","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":442,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.044702Z"},"links":{"cited_paper":"/paper/1804.09301","citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:f749669597118841d1b1e4d785af5757185c0ad9f30a8044059ba0345959e1a7","observation_id":"4e0a0622-821c-45c4-9802-65320c4f94d0","resolution":{"observed_at":"2026-08-03T00:24:08.044702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-03T00:24:08.252392Z","title":"acl-long.1275/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":1275,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.252392Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:d4ede0c748e200f3d35a1b059d6a566bf7f23eae9f4d8f3d513456bedef2421a","observation_id":"20ff151c-eab0-41b8-a60b-ec6f145cc575","resolution":{"observed_at":"2026-08-03T00:24:08.252392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02324","last_updated":"2018-04-16T22:14:06Z","snapshot_observed_at":"2026-08-06T11:21:56.268167Z","submitted_at":"2018-03-06T18:23:08Z","title":"Annotation Artifacts in Natural Language Inference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02324","snapshot_observed_at":"2026-08-03T00:24:07.887822Z","title":"Gururangan, S., Swayamdipta, S., Levy, O., Schwartz, R., Bowman, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:07.887822Z"},"links":{"cited_paper":"/paper/1803.02324","citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:e17043802833c9ca6c8ab2010565b8fc38dc1127f567e3ccd185b609e30cee84","observation_id":"22dbdaec-d359-4fc1-a9d6-c564b29e9c3c","resolution":{"observed_at":"2026-08-03T00:24:07.887822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:24:08.191034Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:24:08.191034Z"},"links":{"citing_paper":"/paper/2607.28801"},"observation_digest":"sha256:814ab3ba7275735b0081c79ff8666ed07d5e48f3996fbd3ddece0a063794b144","observation_id":"f6cc7f78-62a1-459f-bd38-2046c02d4b7d","resolution":{"observed_at":"2026-08-03T00:24:08.191034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28801","last_updated":"2026-07-30T19:51:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T19:32:03.142991Z","submitted_at":"2026-07-30T19:51:55Z","title":"Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2607.28801."}