{"as_of":"2026-08-15T08:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e95e049a9c7aafb84b8e06f63cc4aeb23a22e7619ce784e83e78a33c90d87ed3","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T20:43:46.574417Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.05169/citation-record","integrity":"/paper/2606.05169/integrity","json":"/paper/2606.05169/citation-record.json","paper":"/paper/2606.05169"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Phase transition of the largest eigenvalue for nonnull complex sample covariance matrices","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:b76cd471acb6a9c73c50089bbb44ca944947355e2a2946d867063b3af2203713","observation_id":"ca734e5e-95fe-4088-9208-0f7be6def4b5","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Atomic vibrations in vitreous silica","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:47f439ded9350800e4d6748001e98eeb0faa5f35c4391f41875b38c53a0c0029","observation_id":"25f8a8a0-a9d6-4e7f-a5a3-97c3b1e48f81","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"On a short-coming of saaty's method of analytic hierarchies","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:2da7d4f28a23685a980b8138c1be5e02356b095196129d7a19d362f1254c33c6","observation_id":"c4274874-8f9c-4433-b026-49199e774cdc","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10062","last_updated":"2023-06-14T15:43:25Z","snapshot_observed_at":"2026-08-14T06:22:39.417683Z","submitted_at":"2023-06-14T15:43:25Z","title":"Revealing the structure of language model capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10062","snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Revealing the structure of language model capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"cited_paper":"/paper/2306.10062","citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:9082adb2ac7cf718fb57fd3f9aea06939c055415368fb1f18252db21be80e45c","observation_id":"92482c6d-513c-4612-bdb5-abc48569bebc","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Approximation Theory and Harmonic Analysis on Spheres and Balls","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:feb599de387ddf0722057c0de39b746185e096699ed6730f182a76f1eb1b5f98","observation_id":"552f4880-0463-4327-8b9b-b2f5e65eb06a","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Submodular meets spectral: greedy algorithms for subset selection, sparse approximation and dictionary selection","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:96baad1c51bbe100a4e5497e83659d3fb5cb084b1a1734eefb3784f94b672450","observation_id":"7c2ad284-af8e-4196-8608-8b1c6e04d5dc","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Moduli of Smoothness","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:e9588d1e07d0ca079e30fb435bec9fcebc0803a7aaf38af1ed544ef07095c3cb","observation_id":"4bf2214d-0948-4684-8444-c5bb1e5297d7","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Remarks on the analytic hierarchy process","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:42cdf2a19c2de819a04a4eb33106c877b0901e956156a51e364dc32aa5efd4af","observation_id":"8db03edc-9ade-410c-994d-72e6f94108a6","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"A positive answer to the busemann-petty problem in three dimensions","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:a3580869161133dc22a98a6343b8970d36fcdc33d75656a0cf83a14e3e7ece44","observation_id":"b332224d-3af8-4782-951d-0b8ca36e5de2","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Geometric Tomography","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:5bda719f56b14986c1028e171fa08a23c0abe8afacd30a6c60faa88241e10e10","observation_id":"3798dce5-3aa0-4e0f-aa79-52ef3f9d77b7","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Geometric Tomography (Second Edition)","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:9f2da24702b448d62793ba7678938547fb0bbb9f32fb7834439643e2236b8e1c","observation_id":"e3bcb6ff-1be0-4432-abc9-97779f1328dc","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Optimal rates of convergence for convex set estimation from support functions","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:b787968712a37e209aeb21e755ccff1dfc0db8fb13be954dd765a6e0f3e46e91","observation_id":"a1f41c01-f065-4ad6-b307-9507bc013353","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"The theory of ratio scale estimation: Saaty's analytic hierarchy process","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:ae202d58222422826bfb5201e2acdfb6bd5575d4746a4981578b276a250fdbcc","observation_id":"c12ec4f6-adb9-4c1f-a46a-997882c335f7","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"A rationale and test for the number of factors in factor analysis","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:cbc92d9539a733144880debc99c974dcd27c38f6f49055b9c428a2bf292a9ba8","observation_id":"20753677-634f-4b7b-9a4f-3b2e266f5410","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"HypoSpace : underdetermination in enumerable hypothesis spaces, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:8f5cbe06bcd41b0c864a1fc08c2a3bdb88fdbd15183bd712d4089d0d7e063768","observation_id":"eb9a7002-0021-43a2-8da4-62d179dd6db0","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Dynabench : Rethinking benchmarking in NLP","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:bc35f879654230067293c970ff46194fbbbfd689d1c50d5e75520f76e9c7ec40","observation_id":"29f1a536-e03e-4ef7-aa30-d59a12ea823c","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"metabench: A sparse benchmark to measure general ability in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:8ac1354c32ab0e845f88381add61b043b0abacef492c6a6f1e56b6796021fa76","observation_id":"782e4d07-20dd-4b73-bebf-b703a3862bc6","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Intersection bodies, positive definite distributions, and the busemann--petty problem","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:ba7b7e0428b3e36520dd73f83f44d5e6d4e46c24e3469c2e9268091ab5503fe3","observation_id":"f6fd100e-9b3e-40da-a0e6-dea35a5f5b88","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Near-optimal sensor placements in G aussian processes: theory, efficient algorithms and empirical studies","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:e6d1271ce8c829f31b947433c54f2b5aa33b081df74e7bf1468298937047ad02","observation_id":"e6dbfa72-4153-4d26-9304-a3b16e5bee60","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Active evaluation acquisition for efficient llm benchmarking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:0ad18d781f25fea08a36ed1cc420fcb11406326f4419f6dc8517df1dd8a47b18","observation_id":"bd97a9df-2182-471f-8c68-0e5458c69535","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Intersection bodies and dual mixed volumes","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:8dfb000605ed7d8330b733ca80c09a4fdb827fc4bb39d612fdb78ede17838998","observation_id":"791161d4-a3ff-4368-9a67-a3adc27c7643","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Diameters of compact sets in linear metric spaces","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:7adf68623dfd6b67f2b45d79eb69b258bab7a28a2ae4ee28b20aa34a0ae8e137","observation_id":"79ef9017-2dcf-4494-b98b-fae699af46d6","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Optimal recovery of operators and multidimensional carlson type inequalities","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:01bd772834757072edc4f0eb2124c35e59101e37db42bb8cdb474b12b6848196","observation_id":"f9d36f3d-a679-4b8e-b5d0-a52cbc2ac5b2","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Distribution of eigenvalues for some sets of random matrices","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:f4c6eff73a3398bd712310296274ba7b6f6f1846dc23411d175f5aa024989328","observation_id":"cff30fdd-cb51-49dd-9511-1ba967b4b14b","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"The Random Matrix Theory of the Classical Compact Groups","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:d4341438737ecb2e3e91d99a0336939d58fd564a7cfd1bd52c0d9cbf34ea297a","observation_id":"22c045db-90ff-4f29-bbaf-5ff379a0e9c5","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"A survey of optimal recovery","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:18e2d32c46cd7aa72b84d5a9ec02f5cac12e06f20dbe617e0af5a3d037181257","observation_id":"fe7cacab-1ffa-4895-9129-681d2d35f00a","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"An analysis of approximations for maximizing submodular set functions—i","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:d0a035d1fb8923d4ffa54fffbbe95f2bb3c1c1a9727685ea3e74889cdf5a27ca","observation_id":"b8fb6902-c12d-4f4a-9ac7-69f81471bc9a","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Efficient multi-prompt evaluation of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:34ac5cff8ef35524d8bdea918617a12cc100b1da424237318260ce4182946494","observation_id":"1dae0248-a0a5-4ff0-bcb7-ca1ca5aa97dc","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Projection bodies","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:a08bedab78b2fe48b1ad255640240c6ac95ae82f394591017caa3feb8afeffd7","observation_id":"f977f1ff-9831-4249-8598-5612b8653b72","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"tinybenchmarks: evaluating llms with fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:74089d21c2a404a73ad1ea4afc5cdfe26b5a72a964cea1f5f1f07c2395ee654c","observation_id":"c3cf31a0-8016-4422-af44-3e37c08605f1","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Polynomial approximation on compact manifolds and homogeneous spaces","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:5ba273eb73815c260ac118f829258294e0cf1be5c1af6be9d95793fa631f73c4","observation_id":"d378b6bf-0e5d-422b-a36d-f63642d8fe85","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Covering a sphere with spheres","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:1f259ffe1085b3fe3c1adab56a10e141c513402e8e7a9258893457189223a850","observation_id":"b78e5120-5ae4-4617-a12e-ee8a87625c50","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Inconsistency and rank preservation","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:56b6a953067493e2f0d1660d7989345d57749125b49a56a80d4092ec30f92305","observation_id":"aac891da-ca1e-48b6-aa24-480d6c919426","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"u ber die projektionen konvexer k \\","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:b009525e0a7062a95c7fffcf97c2b1ae9dde87e5e5a86cf856472191f7c85aed","observation_id":"6be393df-4156-49a2-8b36-94452ade8603","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"BenchScope : dimensionality and reliability of LLM benchmark suites","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:8f0d82331525e27dfbaa4b42011162e0d771b04e5a2f023374b7ab717e886eda","observation_id":"f79143ea-ba2b-440c-9ef2-bf1d04780b90","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Information-Based Complexity","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:48e400f19f776c6eba2d86b01d793e263ee7a87022159c24406674fe45fd242d","observation_id":"b2fc03f8-9826-462c-af30-de31a633126f","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"Inverse participation ratio in 2+ dimensions","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:c3c4877bb512755bb61ef6ccb9c459cce8f235036e2f1d80360e3af3f05e8425","observation_id":"714792d9-90fe-45b7-b0a0-d149407e179d","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"A positive solution to the busemann-petty problem in R ^4","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:06745640be91a85ebbb82c006e786f409a184a8b1070a7b92960364701598ade","observation_id":"d240ba93-beb0-44c2-826c-893e64bec394","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T20:43:46.574417Z","title":"General scales unlock ai evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T20:43:46.574417Z"},"links":{"citing_paper":"/paper/2606.05169"},"observation_digest":"sha256:cbdf59e6f74ebc6d7185db03aad000c98f44358c221efdfa8306d8a0afd877ce","observation_id":"86245072-9c56-4662-b0fa-a8ec1ba38d5b","resolution":{"observed_at":"2026-07-12T20:43:46.574417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.05169","last_updated":"2026-04-15T08:56:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T06:22:51.742999Z","submitted_at":"2026-04-15T08:56:58Z","title":"The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2606.05169."}