{"as_of":"2026-08-10T20:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b73cb10a4cdfe337c79bb1e9b60bf5963b15cf346dc0aa17ae73ed157e5507a8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:55:56.617692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:3bc7a091dcb59fd5250f255811ab782e02f80d562279c52c1c0bfca8a504b8f9","observation_id":"0b1e145f-0b0c-4cbf-938e-5aa28133c018","resolution":{"observed_at":"2026-05-23T02:52:27.051526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2503.17181","last_updated":"2026-04-08T09:48:41Z","snapshot_observed_at":"2026-08-09T00:59:15.440250Z","submitted_at":"2025-03-21T14:29:35Z","title":"A Study of LLMs' Preferences for Libraries and Programming Languages","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T22:53:16.951417Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2503.17181"},"observation_digest":"sha256:8ede3b83a7669bae0b1760cdc9f1bdc2ce487d7b3d10fa9d865f067b69ca2277","observation_id":"b0ea9157-82e9-4f2d-b003-8f3f5de0b70d","resolution":{"observed_at":"2026-05-22T22:55:12.391707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T13:55:56.617692Z","title":"https://arxiv.org/abs/2406.10229","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-09T10:52:35.096607Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.617692Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:8d70e065cf61cde49adc613397f4a071dc197ecfcab38e8788e304ea0c004c23","observation_id":"bc38713e-f5ab-4a85-86d9-645a25d093ce","resolution":{"observed_at":"2026-08-07T13:55:56.617692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T12:14:23.000112Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00204","last_updated":"2025-05-30T20:19:39Z","snapshot_observed_at":"2026-08-10T18:52:15.545472Z","submitted_at":"2025-05-30T20:19:39Z","title":"Structure-Aware Fill-in-the-Middle Pretraining for Code","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:14:23.000112Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.00204"},"observation_digest":"sha256:1a56e03f39ca447589f56bb3568e5d60c38aa11bc99a58233febf227437ac9a8","observation_id":"bef963a3-d7a2-4043-aa23-ec9d4c5e89aa","resolution":{"observed_at":"2026-08-07T12:14:23.000112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T11:18:10.760594Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-08T07:38:04.360811Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.760594Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:ca5f252ecfdc350479993c0e40924ef0b91d09dc8d6a3ce3ae1e2d72ab04448b","observation_id":"5238fcf6-3d49-42d7-95d7-957763d3bf49","resolution":{"observed_at":"2026-08-07T11:18:10.760594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T05:34:26.922228Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Oluwasanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07673","last_updated":"2026-07-21T11:15:43Z","snapshot_observed_at":"2026-08-09T03:05:20.348569Z","submitted_at":"2025-06-09T11:50:41Z","title":"How Benchmark Prediction from Fewer Data Misses the Mark","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:26.922228Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.07673"},"observation_digest":"sha256:363ce0deab0e1339b13705fd1ba70c71575cac83e796903e9a3186bce34ee3b9","observation_id":"5705a10f-9f73-4de9-ac11-01fc409cea29","resolution":{"observed_at":"2026-08-07T05:34:26.922228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-06T22:46:40.311443Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-07T23:54:52.849436Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.311443Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d709d16ed43b062aea7fc9c8fa1d2988b6f9fdb400c2a236dbf7e287794392a8","observation_id":"ffa8195f-6c42-430e-a18d-f5c38ae41b92","resolution":{"observed_at":"2026-08-06T22:46:40.311443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-04T17:10:43.439511Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11106","last_updated":"2025-09-14T05:49:42Z","snapshot_observed_at":"2026-08-04T17:10:34.284259Z","submitted_at":"2025-09-14T05:49:42Z","title":"Fluid Language Model Benchmarking","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-04T17:10:43.439511Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2509.11106"},"observation_digest":"sha256:2270aea1d318526488fd6036eba722d179f3251c16e20da49a74924407c7bd35","observation_id":"e2e17ed5-befc-4d79-9cb8-7275906204c8","resolution":{"observed_at":"2026-08-04T17:10:43.439511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-04T11:19:47.532043Z","title":"Quantifying variance in evaluation benchmarks, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05709","last_updated":"2026-06-04T12:15:57Z","snapshot_observed_at":"2026-08-07T08:05:26.965055Z","submitted_at":"2025-10-07T09:22:22Z","title":"Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:47.532043Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2510.05709"},"observation_digest":"sha256:b7cd179bbdac38d120358e6c6ccd21d846c8d850c71075ffccb42fe6629023d1","observation_id":"5c0953d6-f1b9-4059-9f27-cdadff721879","resolution":{"observed_at":"2026-08-04T11:19:47.532043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-10T14:49:33.428173Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:e09d980d9f754353e374bb6f872865c399954030bb9c2241b10a46abbfe9784e","observation_id":"38ae454e-4f7b-403d-a66c-cc2cee262063","resolution":{"observed_at":"2026-05-16T16:29:14.003804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-03T17:53:55.247281Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-10T14:49:12.058880Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:53:55.247281Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2512.07795"},"observation_digest":"sha256:56a9265dadfd44e594df307016d3651c0fbb25f05237efe3f5e8d5763af75aca","observation_id":"976900a8-7ad3-4a51-b8f9-ca3797e671d2","resolution":{"observed_at":"2026-08-03T17:53:55.247281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2604.23114","last_updated":"2026-04-25T02:52:33Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T02:52:33Z","title":"A Tale of Two Variances: When Single-Seed Benchmarks Fail in Bayesian Deep Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T08:26:01.717280Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2604.23114"},"observation_digest":"sha256:3b14828238069975a020b7cb028f39338d2805800ddc773af300c794d7d48049","observation_id":"9f3ce2f6-22e1-4faa-a8a2-1ac5f18decc0","resolution":{"observed_at":"2026-05-11T20:36:11.793707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.06213","last_updated":"2026-05-26T15:14:12Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:15:31Z","title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T10:13:35.777910Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.06213"},"observation_digest":"sha256:989ebc47b6edb9df01b8e34ad63b50f896a1cf3749fb63b9c787f2daa55e1ebd","observation_id":"507f4142-380b-435a-aab5-d0e2331614df","resolution":{"observed_at":"2026-05-11T20:06:13.592425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.28190","last_updated":"2026-05-27T09:11:13Z","snapshot_observed_at":"2026-08-06T13:04:16.055052Z","submitted_at":"2026-05-27T09:11:13Z","title":"The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T12:42:53.018183Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.28190"},"observation_digest":"sha256:9d6616907d1963d21d239affdffec89d7b7b8fdd6ee46ea3508b1fb9ce270c7f","observation_id":"8bbafc1c-e21b-4b90-93a7-af375f2bddfd","resolution":{"observed_at":"2026-06-29T12:43:25.039511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.30315","last_updated":"2026-05-28T17:54:09Z","snapshot_observed_at":"2026-08-08T08:52:54.387961Z","submitted_at":"2026-05-28T17:54:09Z","title":"Resolution Diagnostics for Paired LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.402338Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.30315"},"observation_digest":"sha256:3b703e0291f1ae260c20076e3ca57e2ecf974d8b6ceb924cf715c796b87bae49","observation_id":"94b16516-8599-4888-a6ea-8900097459f0","resolution":{"observed_at":"2026-06-29T07:23:13.254548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.05029","last_updated":"2026-06-03T15:57:42Z","snapshot_observed_at":"2026-08-01T16:51:47.025025Z","submitted_at":"2026-06-03T15:57:42Z","title":"Validity Threats for Foundation Model Research","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:41.653304Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.05029"},"observation_digest":"sha256:ec5629cf2ea9a360637e493726ef172be5075947ada16d628d01ba52e3afd076","observation_id":"30606fe5-3738-4848-a408-cc5b42f6d912","resolution":{"observed_at":"2026-07-02T07:36:44.879438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.17426","last_updated":"2026-06-16T02:19:01Z","snapshot_observed_at":"2026-08-01T14:34:59.514464Z","submitted_at":"2026-06-16T02:19:01Z","title":"Bounded Difference Concentration for Infinitely Exchangeable Sequences with Applications to AI Benchmark Uncertainty","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T23:02:58.564465Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.17426"},"observation_digest":"sha256:4126df1174dc5ec6b29060d1b7b3b2007e0577c4777bbb37107e18a4070dece2","observation_id":"93cf316e-d257-42ee-b052-52a7e1bda135","resolution":{"observed_at":"2026-07-03T23:09:00.963089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:5909cfc36fd3a00bda7f9e29b3e0b16a24f40d18103827abdeaeb0273e377684","observation_id":"6d6830a2-a2fa-452e-af6b-407fe573777f","resolution":{"observed_at":"2026-07-01T15:45:47.638431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:58b598ad20902708b44c5df4f83a1c8068dd18af7732551e1519a48547f5dca7","observation_id":"cffd2844-7096-4c59-a7f3-1a2b2b322c4f","resolution":{"observed_at":"2026-07-02T21:17:23.993727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-07-12T02:29:58.886380Z","title":"Quantifying variance in evaluation benchmarks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03436","last_updated":"2026-07-07T05:35:41Z","snapshot_observed_at":"2026-08-08T02:51:48.231899Z","submitted_at":"2026-07-03T15:49:40Z","title":"How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T02:29:58.886380Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.03436"},"observation_digest":"sha256:8afc9b8d60a4941a3fbfecef7dcf25a566b98616f41922b321f38ccdc10a121c","observation_id":"7c690aa6-92c3-42d1-886a-5b6d566a38d6","resolution":{"observed_at":"2026-07-12T02:29:58.886380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2607.07946","last_updated":"2026-07-08T21:45:34Z","snapshot_observed_at":"2026-08-10T02:32:57.882587Z","submitted_at":"2026-07-08T21:45:34Z","title":"DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:58:38.688149Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.07946"},"observation_digest":"sha256:96997c98708573122afe22b581ec369a0aa6751c3ef3f41d324e23f12c3442b4","observation_id":"96468dd4-d445-4fba-b111-cd7f773baf37","resolution":{"observed_at":"2026-07-10T15:07:19.640776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-02T12:17:16.303388Z","title":"org/CorpusID:270845965","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19363","last_updated":"2026-07-27T17:19:01Z","snapshot_observed_at":"2026-08-08T02:58:20.566969Z","submitted_at":"2026-06-05T05:09:15Z","title":"AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:16.303388Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.19363"},"observation_digest":"sha256:a80a5c1e084580d856a88fbc08d8ba89005e6b0dc5c90a51a45190893fceebb5","observation_id":"daf1a889-df9e-4597-bf7c-34b3b488455c","resolution":{"observed_at":"2026-08-02T12:17:16.303388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-01T03:00:48.305722Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25257","last_updated":"2026-07-28T03:56:23Z","snapshot_observed_at":"2026-08-08T08:53:40.590873Z","submitted_at":"2026-07-28T03:56:23Z","title":"Laplace-PSN-IRT: Uncertainty Quantification for Neural Item Response Theory Models of LLM Benchmarks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T03:00:48.305722Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.25257"},"observation_digest":"sha256:0ba3fab519089c74f6bd2cba1dfe467f3c39e5579ebdf1515bef236803b89536","observation_id":"8c876188-bedd-4059-9116-3271153f8224","resolution":{"observed_at":"2026-08-01T03:00:48.305722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-01T01:16:44.479430Z","title":"arXiv preprint arXiv:2406.10229 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-06T22:52:32.781663Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.479430Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:8147477a74065b9fbdd58d965577759b390d8e909c607593faf00187f346ba27","observation_id":"c82b8d54-7f25-4e7d-a7c0-596b29880703","resolution":{"observed_at":"2026-08-01T01:16:44.479430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10229/citation-record","integrity":"/paper/2406.10229/integrity","json":"/paper/2406.10229/citation-record.json","paper":"/paper/2406.10229"},"outbound":[],"paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T08:53:15.205653Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2406.10229."}