{"as_of":"2026-08-10T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f047e437a9ad29ce0036f39abb89188663c6da99fdbb19e02449a398af3fe486","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T20:20:15.314971Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T13:33:12.980906Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25773","snapshot_observed_at":"2026-07-30T13:33:12.980906Z","title":"Bowyer, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27023","last_updated":"2026-07-29T15:20:39Z","snapshot_observed_at":"2026-08-07T00:23:58.047490Z","submitted_at":"2026-07-29T15:20:39Z","title":"BayesAME: Bayesian Active Model Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T13:33:12.980906Z"},"links":{"cited_paper":"/paper/2605.25773","citing_paper":"/paper/2607.27023"},"observation_digest":"sha256:e1f84307ddbce32459dfe9bdd139fa0664c0a2513d677d7c363a8935cad1fd0f","observation_id":"81c5bda6-26fa-4a1a-8f6b-48b608c54524","resolution":{"observed_at":"2026-07-30T13:33:12.980906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.25773/citation-record","integrity":"/paper/2605.25773/integrity","json":"/paper/2605.25773/citation-record.json","paper":"/paper/2605.25773"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:8339ae57f140850604f778bf5f41b6132cc9b4f245ca2abeacec38644278c1c5","observation_id":"1ca67844-77a3-43d5-bf9d-e1d92529a918","resolution":{"observed_at":"2026-06-29T20:23:57.482819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:59fda89721ae4db67a00733ff578c43ceb6408750e8a9fef8cb3ddc9533db26f","observation_id":"4b06322c-a809-4661-9755-18ef6872d5a9","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:c7796f316b5c98a09070e0321f50cf8fb5abedb307330aeda6f165635c54c530","observation_id":"eebf3614-d72f-46d4-8a13-6036f47cc664","resolution":{"observed_at":"2026-06-30T00:24:05.137981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Manning, Christopher Re, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:70fe05a3d2ba9038f8c5828184d5836bf316648774ddfb489dba8b9ffc100414","observation_id":"7acd9896-cfbf-4dd7-bae6-2fb6cfc57862","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Open LLM Leaderboard v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:f81bc89e1a663fa115280976dc728759befcc52d49e01333a0463a7c4988bc08","observation_id":"3993dc0d-4114-4b79-9c12-3860612d72db","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Anchor points: Benchmarking models with much fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:37af87ad52f1c0d62b83dd02896c9dcd520ca3fc02bc9032164509abb95eddb5","observation_id":"0f1f4bbd-282e-4b92-b895-768c79859e07","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"tinyBenchmarks : evaluating LLMs with fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:835de9f9bf18af0d417ed06df0e3a1f088621664ce7dc00e5f705897b4f0e601","observation_id":"f68e4718-8272-4acb-bf8f-0424a6fd7859","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Schulze Buschoff, and Eric Schulz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:83d39443d74aa1a681c8cb95bcd9f6c031643259ad6004b127b4de991cf80b31","observation_id":"66833a31-380d-4f33-affe-0d5a49057062","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13885","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T00:24:05.127183Z","title":"Confident Rankings with Fewer Items : Adaptive LLM Evaluation with Continuous Scores , 2026","venue":null,"work_id":"01d7fbe2-3395-48a8-9800-23e103268133","year":2026},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:9adf39d262e101d03ec4f68f0d1c1b92063edfd0eb6ef96371fb6d154083553a","observation_id":"6801473b-d6bd-4654-bb12-009eec9fcd80","resolution":{"observed_at":"2026-06-30T00:24:05.128554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:96282d33ee7bbbdc7db4abcc47a8c5e0a91518723700c8400f2066f0fb20d520","observation_id":"d3d91751-3cf4-4f08-852b-1809861fb329","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.1084","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TurnBench - MS : A Benchmark for Evaluating Multi - Turn , Multi - Step Reasoning in Large Language Models","venue":null,"work_id":"3de8ddff-29d2-4999-b9ad-d508bf3bb399","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:ff5b261619e8c56c9719595cb8ac29a752c6ec23b26e9562ffdd0f895558cc1a","observation_id":"db43d3d3-9cf6-4de1-9e25-fd85915b76b7","resolution":{"observed_at":"2026-06-29T20:23:57.484624Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Chain-of- Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:6e03c0a16f6a2019a2a806cab06e5116151390fcf2c776939295cd566855327c","observation_id":"e41f21a7-d9c0-4209-ab91-80139dfe0237","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"The Curious Case of Neural Text Degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:1170a0a209d2e9844f0c99b9ad49fded63828355f67acf3172d50731b2ebee0b","observation_id":"f940413f-5df8-4b22-bc66-c17cfdf00244","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.432","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The effect of sampling temperature on problem solving in large language models","venue":null,"work_id":"f8889cd4-92ff-4ee7-8259-70f946856509","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:9d34df1c842c0be5de3c28b483dde3fdaad06d65647ed44738266653b6b432b8","observation_id":"b83387df-5d72-42a2-875e-0a20bb6383f6","resolution":{"observed_at":"2026-06-29T20:23:57.492067Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.011+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.011+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Roush, Andreas Kirsch, and Ravid Shwartz-Ziv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:a6b3314b342a17848697740a9384aca16dcb943f5b7183499b6d8c8e177dfa9d","observation_id":"453cf194-f73a-425e-b5f7-e4f51fbbbb30","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Quantifying Language Models ' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:47b64c295d401aeab100c019cf7197c71e596c5268bc1e054e55a29fe5e58396","observation_id":"dbf347c6-7afe-4c7e-b8ad-323cfce0ed78","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13285","last_updated":"2026-04-06T08:31:43Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-02-27T21:12:13Z","title":"Brittlebench: Quantifying LLM robustness via prompt sensitivity","version":2},"cited_work":{"arxiv_id":"2603.13285","doi":"10.48550/arxiv.2603.13285","metadata_source":"pith","pith_arxiv_id":"2603.13285","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Brittlebench: Quantifying LLM robustness via prompt sensitivity","venue":"cs.LG","work_id":"abfaa460-b8c0-49b6-a24b-5ad82f804632","year":2026},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2603.13285","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:786ddf20c6011fbaef1bf2f29e3410cafc79abe5b3ff7dd7d0a51445d9d03c5d","observation_id":"75b21076-ffec-449e-b43a-4a370cd3f83a","resolution":{"observed_at":"2026-06-30T00:24:05.130697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Language Models are Few - Shot Learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:4ef888fdbff2835ec8f5c157e19e5981ede1eebd2c1ebf3a335043a4b6eac3ef","observation_id":"617b4675-dbad-469e-b009-c66f5091d6aa","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.123667","doi":"10.1016/j.eswa.2024.123667","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analysis and comparison of feature selection methods towards performance and stability","venue":"Expert Systems with Applications","work_id":"868ea15c-9ab1-49eb-8617-5da98edd5161","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:f08da4f3be347b08d08be4b141444d721cf2a6a264bdab70425e3215ce5372be","observation_id":"48cb4c73-9916-410a-84f9-77b2f30592dd","resolution":{"observed_at":"2026-06-29T20:23:57.485867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10115-023-02010-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Knowledge and Information Systems 66(3), 1575–1637 (2024) https://doi.org/10.1007/s10115-023-02010-5 16 Under-review","venue":"Knowledge and Information Systems","work_id":"e38ab68e-e8a0-4329-a3ba-c245c24a5ea4","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:6a22c416c5c90cea1fb13f9f9ebfcbaf8cbf99389866f911b4e3536b654a5e4e","observation_id":"8e41bc20-a7aa-4e3d-b871-13632c99b45d","resolution":{"observed_at":"2026-06-29T20:23:57.538444Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpami.2005.159","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Trans","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"0eeef040-d044-48e0-a6dc-98298e25be0f","year":2005},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:13907f463de13f01f48bcd9a6b4f403f7936f21fb47576041c564dd5679109a9","observation_id":"77a04c7a-668c-4750-8e41-cd9358691365","resolution":{"observed_at":"2026-06-29T20:23:57.489917Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1142/s0219720005001004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minimum Redundancy Feature Selection From Microarray Gene Expression Data","venue":"Journal of Bioinformatics and Computational Biology","work_id":"1237b577-b58a-421b-883a-cdd6c65b8c9f","year":2005},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:527f25e6a2dc6ad1f02545c2ebe608f92ca0677669442c43207cbf13584bae09","observation_id":"8dc9f9e2-722e-4736-ba48-e6c7dae55d00","resolution":{"observed_at":"2026-06-29T20:23:57.529803Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00059","doi":"10.1109/cvpr.2019.00059","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploiting centrality information with graph convolutions for network representation learning","venue":null,"work_id":"51ccd600-fa96-47f7-9e2d-a56362b22679","year":2019},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:d3c7b63be1e1de796af38445ee895cabe455a3c8e1b9dcef8fbadb07410e6497","observation_id":"0ce6858a-72a3-4d86-a5e0-ac05baaf1a7a","resolution":{"observed_at":"2026-06-29T20:23:57.536874Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1706.1970","doi":"10.1080/00401706.1970.10488634","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hoerl and Robert W","venue":"Technometrics","work_id":"9301f413-f104-4514-b840-a10933899575","year":1970},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:4fbe46d6c12ea3f00d3ebc54f2d50645530ed01b24474a4b0ddef8685ee7c8ac","observation_id":"b766d038-020c-4e43-84a7-3f2d73d7b3bb","resolution":{"observed_at":"2026-06-29T20:23:57.539443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-17T23:51:35.324186+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T23:51:35.324186+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Ridge Regression Learning Algorithm in Dual Variables","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:c2f4a8dcbed4c8a267d90f8c4c90a8a30cdbfc31f186f0d046f070fb7103f2f8","observation_id":"f351ca74-5daa-459e-b144-2b0f74d18ea9","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"The Elements of Statistical Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:97b32ad9e4324af78b766e2cdea027dd07083acc041137db727812753136006f","observation_id":"2442088b-26bc-430c-9aa1-bf45b09e6da9","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8955.121903","doi":"10.3115/1218955.1219032","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatic","venue":null,"work_id":"0b2c77bc-cf79-45cd-a20e-ed026ad602ba","year":2004},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:0585ad069b17f29e5335714afb710a62342fe32dffdadff363feadb6591897c6","observation_id":"d41361ec-e795-484f-9ccd-c9edaa41208e","resolution":{"observed_at":"2026-06-29T20:23:57.527684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T20:19:33.084246+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T20:19:33.084246+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:35:37.608506Z","title":"A coreset selection of coreset selection literature: Introduction and recent advances","venue":null,"work_id":"b461b0d7-ec96-4e28-856f-bc3c8c1f3b7f","year":2026},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:a26eb0b59a5fbdbeb0e06585aebad92c7f976648c88e6c77eb1d497c7b30dd60","observation_id":"5f118958-c23c-4e62-a934-84cad89f7a98","resolution":{"observed_at":"2026-06-30T00:24:05.162139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"NP -completeness of searches for smallest possible feature sets","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:99d5d8d3165ff242654017554517e2e5dbc95ce764480f8b1306b37357515f84","observation_id":"5106f688-cd56-4cdf-82a8-dab3a5adf46c","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0087357","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":"PLoS ONE","work_id":"4209e105-adbf-496c-854d-1729ce4b2b3b","year":2014},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:ee3d40c12034fbce1b8283b76d2e7407f482b0ec60b8fd93c2739b68fd2d83ec","observation_id":"415b0794-eaeb-4d8c-8a6a-cead7a9b1beb","resolution":{"observed_at":"2026-06-29T20:23:57.527581Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"cond-mat/0305641","last_updated":"2003-05-28T17:04:28Z","snapshot_observed_at":"2026-07-07T01:58:56.794132Z","submitted_at":"2003-05-28T17:04:28Z","title":"Estimating Mutual Information","version":1},"cited_work":{"arxiv_id":"cond-mat/0305641","doi":"10.1103/physreve.69.066138","metadata_source":"doi_reference","pith_arxiv_id":"cond-mat/0305641","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kraskov, H","venue":"Physical Review E","work_id":"0fc5559f-6b2a-47d2-939f-928e6681a1b3","year":2004},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/cond-mat/0305641","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:d8f09309328a09d6edd6d45ec87fda602297178acfa4b5483843b1f6cbbe3c1e","observation_id":"d54d5063-0a93-4b37-ba23-bfa3b2659a27","resolution":{"observed_at":"2026-07-04T16:38:51.450111Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T05:08:11.516005+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T05:08:11.516005+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Efficient Estimation of Mutual Information for Strongly Dependent Variables","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:ddb91491607cbbb98f1f4c7089fab12fc1356194225e90f646fb5bb66c5e23a2","observation_id":"84ff4869-2dac-4122-b9e4-ebc5ead88937","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/1269656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T00:24:05.154176Z","title":"Frank and Jerome H","venue":null,"work_id":"9786ea9f-d325-490d-8954-6c823a9fbf7b","year":1993},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:b19541ba230bf5762ccb98242f9064960158e6cccef25b288552011645b3f2ad","observation_id":"c3f59237-d28e-4224-9d91-56b77c7f55f9","resolution":{"observed_at":"2026-06-30T00:24:05.155415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1706.2020","doi":"10.1080/00401706.2020.1742207","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Process Assisted Active Learning of Physical Laws","venue":"Technometrics","work_id":"91ad5a41-4f45-46e4-8e2c-f2ae2eb12bb9","year":2020},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:4550cb9976f94281292c2149c3be3545c45348cdb94caeaf0404bf31b32e061e","observation_id":"c640818e-15bb-4222-963e-65bcb9c196a6","resolution":{"observed_at":"2026-06-29T20:23:57.513226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0385.130401","doi":"10.1145/130385.130401","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Guyon, Isabelle M","venue":null,"work_id":"9f0db2de-b504-4c82-b18b-4cbc852c3922","year":1992},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:c7467472d5b6139649e6bb49f732e5421039ef53197d472375338ac3383161de","observation_id":"5a03b2c3-795a-4a9c-8a8c-ddf8a5754bff","resolution":{"observed_at":"2026-06-29T20:23:57.520819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T11:49:38.076051+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T11:49:38.076051+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6161.1996","doi":"10.1111/j.2517-6161.1996","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Inferences from Multinomal Data: Learning about a bag of marbles","venue":null,"work_id":"62dc2cf5-6bff-42bd-b6c8-b37ee996ab38","year":1996},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:574e5dfb8914d405600ebcba67d075be0ae9f31c07ba69dddf58aeb51e01c3b1","observation_id":"42d6f9ef-dc61-4219-aa49-a46925b0e2cf","resolution":{"observed_at":"2026-06-29T20:23:57.507671Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Lord, M.R","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:fbc34c064465366e4020a094084414561f1d982a74460ba1dc120ae48f67797e","observation_id":"5aae530f-f59a-4e36-8d20-707cb220e497","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Item response theory: Parameter estimation techniques","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:932ae7826b30d16f6d2d6b361798f16926779c1457ce4be9957bd5a2458e6f34","observation_id":"b60fe1c6-bd70-4db6-8f1e-2e97b34852c4","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1201/9781315119144","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Van Der Linden","venue":null,"work_id":"f65b9eae-23fb-471f-8a2d-7e20071e81ca","year":2015},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:d812e3cc6a08345b0f21f924945c8ea421c623f40fefa2104217364be6949180","observation_id":"d2d2e708-bfd5-4240-b40c-9cc9e7eda0cd","resolution":{"observed_at":"2026-06-29T20:23:57.522824Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d16-1062","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Wu, Hao and Yu, Hong","venue":null,"work_id":"c5856704-a4ae-4f08-a36b-5bd3a89ec5cd","year":2016},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:6b3fbd46bdebb03d3b19a0c88f7537d1e1afc2abef141659c1b4a2ac15c2a922","observation_id":"4cfdc8fc-3723-4112-83c0-b74b6f4985b4","resolution":{"observed_at":"2026-06-29T20:23:57.515285Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.insights-1.14","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Clustering Examples in Multi - Dataset Benchmarks with Item Response Theory","venue":null,"work_id":"84bd378c-82bb-4bae-b065-cb88906f10ed","year":2022},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:6360554b80f2a9a88b0ce7cd123fdb0c1d7552e3d2bbc6079e3700dd1cfe657a","observation_id":"9799c098-043f-4bd8-a09b-018cb79bbc92","resolution":{"observed_at":"2026-06-29T20:23:57.541334Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19590","last_updated":"2026-05-16T01:07:51Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T21:29:04Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","version":2},"cited_work":{"arxiv_id":"2509.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.19590","snapshot_observed_at":"2026-06-30T00:24:05.158749Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","venue":"cs.AI","work_id":"0d55c5da-e54e-4b79-85d9-8a313c49fbfa","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2509.19590","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:d90c47e4a366ab0a073231eefa1e497afc926c996888f17975cf7c0bb0b9f6d7","observation_id":"6aea4207-e9c5-4543-9aee-bcd5112e0ee7","resolution":{"observed_at":"2026-06-30T00:24:05.159905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:39046f00a884e900146a2cc0c7cdf241550697680b0cedf31359fb34c1b2681f","observation_id":"b1966889-d5cd-4ec4-8a62-1177e77a8ead","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/0146621605287691","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Beta Item Response Model for Continuous Bounded Responses","venue":"Applied Psychological Measurement","work_id":"4c1cd656-85aa-419b-b1e6-5859a248ae7a","year":2007},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:551de53765362e5c46c2530e4de7cae349103921cf6b304fab760f2bc245de94","observation_id":"65c4da37-61db-4440-8a9e-830b7ed73ef4","resolution":{"observed_at":"2026-06-29T20:23:57.494075Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Dorner, and Moritz Hardt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:2030a1658dbde67c28a2b1d97f96b6d1ebaf356df362d83fb199e9cf9b9f966a","observation_id":"3f078c41-eb08-4dbb-a72f-0e0258dd1f1f","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.112","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Attentions for Long Document Summarization","venue":null,"work_id":"e35b4a28-b107-4e4e-8d8b-ed8c877c887e","year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:d4b484496aeca0852785cfa070f9a90aa10a1818e66f781f7188ba0e4e1a1d22","observation_id":"ca55da39-0b5a-4c7e-ab19-619ff0929eb8","resolution":{"observed_at":"2026-06-29T20:23:57.540168Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Overview of the BioLaySumm 2025 Shared Task on Lay Summarization of Biomedical Research Articles and Radiology Reports","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:824b3e55fc0c4132f3db9437b2c8c4075321c2350730a5e5ffabe40cd4ac2b95","observation_id":"51addbec-1af6-4a06-84ed-8246561e94cf","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:547559b47f8941913f9e8e66a7d85eb40f42fe316ab5f12c24fd16ec7b818328","observation_id":"0dea627a-e42c-4e6a-b5ce-9fd0eaaa4f73","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:b33b0b3fe55d8b49e7c6ca142d1f5d4f976bd1800dcbed00a3336b35cfa5a2db","observation_id":"99d9ab87-b27e-48da-a4fa-6ba8c0fbebc5","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:ada1c0c32d23046cc98415aaccc1fc42ea396afb7fb21833fc42ea318582f2bf","observation_id":"70a58aa3-ebbd-44d7-9bd1-a513c915f3cf","resolution":{"observed_at":"2026-06-30T00:24:05.164340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-10T17:38:15.086994Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:3d09b7928673509efd9e891e8913ba3688fb864f1d017465bd8d9d71be4ead33","observation_id":"17f86524-7e07-495f-b44c-ccf06ace390b","resolution":{"observed_at":"2026-06-30T00:24:05.147871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.772","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On Leakage of Code Generation Evaluation Datasets","venue":null,"work_id":"08e87f62-b426-4b77-9e5a-576e331d7929","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:0aa77a477c75d9c638d211b163c8c20283edca60e221bf4bfbb80ad03a78b342","observation_id":"d1d91cc5-dbad-42b4-aa1a-0eccee9c93ff","resolution":{"observed_at":"2026-06-29T20:23:57.536771Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/1412159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.936606Z","title":"Spearman","venue":null,"work_id":"865557c8-a51d-4ed7-8812-a0fad2f416fd","year":1904},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:db41bd6f4347298f8e499f4698ee7315bb6a1789f73a44b705f1cd1f2c668e6a","observation_id":"04630944-cf5c-4bc5-8da4-daf4ff0633df","resolution":{"observed_at":"2026-06-30T00:24:05.152701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/biomet/30.1-2.81","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T08:06:47.376286Z","title":"A New Measure of Rank Correlation.Biometrika1938; 30(1–2): 81–93","venue":"Biometrika","work_id":"792d8b23-d107-45bb-8e93-19fd762a835f","year":1938},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:7a89243b25e1ad39638faf41faaf2eef0d70ae2d8ab92657e7cfad520a95cabb","observation_id":"a4f237d1-2150-459d-832b-b0ada1298c7c","resolution":{"observed_at":"2026-06-29T20:23:57.534764Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T15:24:53.481674+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T15:24:53.481674+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"On the stability of feature selection algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:7ac156fcd4e498357c2cf189fa92db42722b78ab516a13fbdcbee511db6a8f57","observation_id":"6d70f12a-9b63-4814-8c4e-5b7280f7930a","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01453","last_updated":"2024-03-26T01:44:52Z","snapshot_observed_at":"2026-07-06T16:42:19.938941Z","submitted_at":"2023-11-02T17:59:04Z","title":"PPI++: Efficient Prediction-Powered Inference","version":2},"cited_work":{"arxiv_id":"2311.01453","doi":"10.48550/arxiv.2311.01453","metadata_source":"pith","pith_arxiv_id":"2311.01453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PPI++: Efficient Prediction-Powered Inference","venue":"stat.ML","work_id":"722d90b8-1ad4-4af6-af32-3a828faf318f","year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2311.01453","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:3919ee788616681ae50ded5528e0368e81fa2f5c33e6877dc42e3954cae6ce07","observation_id":"5e872c2a-d655-4bc6-b409-8ed2ffaf6104","resolution":{"observed_at":"2026-06-30T00:24:05.145459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Active Evaluation Acquisition for Efficient LLM Benchmarking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:99908e0ff2ebe603823503a2af48d9443b4c5fa1b7b9fbfd711be51a522fc052","observation_id":"a2b6b653-335b-488c-9741-30fb78724d9b","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:36517e6ae2403d7c4ccc5351545627b165c82da1fe648600e2a62e980d92c7b8","observation_id":"6b1dceb5-43d3-4076-b705-a3facb155e43","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Beyond One - Size - Fits - All : Tailored Benchmarks for Efficient Evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:65e0c8581681d81d399f4c991622f53d3542ebd9975d6e64c370d78b7c89502f","observation_id":"2e2d9e09-3a96-4c26-be92-ad43072eacb1","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07959","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T15:55:48.980003Z","title":"Rubinstein, B","venue":null,"work_id":"17fb0e82-9baf-4aac-bc02-b6fbd49e2adc","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:9eae817425af5732a2288be9bf36107e96ed4fdb2807d2c34234d4dc30e0b714","observation_id":"1748603e-32aa-4c12-9a2a-95864d90ae46","resolution":{"observed_at":"2026-06-30T00:24:05.150302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1477","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SubLIME : Subset Selection via Rank Correlation Prediction for Data - Efficient LLM Evaluation","venue":null,"work_id":"fb155880-4416-41a7-88f0-1964041749f9","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:fbf9048c2dbaa366092511e5ecd09ce4e397ac5164d3d2f01db26ed1c4be676c","observation_id":"2e82c324-8eeb-4941-b0d0-f7fc9f966142","resolution":{"observed_at":"2026-06-29T20:23:57.529655Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09662","last_updated":"2025-08-13T09:48:23Z","snapshot_observed_at":"2026-08-05T20:59:46.497447Z","submitted_at":"2025-08-13T09:48:23Z","title":"EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization","version":1},"cited_work":{"arxiv_id":"2508.09662","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09662","snapshot_observed_at":"2026-06-30T00:24:05.156358Z","title":"Effieval: Efficient and generalizable model evaluation via capability coverage maximization, 2025","venue":null,"work_id":"2c4b79c6-0ea4-4b4c-9e2a-aa7d65906245","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2508.09662","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:f1a765c7894c099ca311a800574c57f6c932a520a046c7d0c95eac7568899278","observation_id":"095ad887-e5a9-4435-b8a9-e5d913988171","resolution":{"observed_at":"2026-06-30T00:24:05.157736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"BenTo : Benchmark Task Reduction with In - Context Transferability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:e33631f6c187895c612bea24f84ed5de4873aa902c1529d84db879b11fea9c32","observation_id":"76a94103-1a96-4e0b-8c1f-c8fb47ed5430","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"You Don 't Need to Run Every Eval , 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:65a3bba839e1255627fb21170a6c1e9e4bd7218f2749bdbb701d16fc3d03197c","observation_id":"8f7be017-9460-4452-9ccb-06f495614956","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03563","last_updated":"2024-09-05T14:19:45Z","snapshot_observed_at":"2026-08-09T07:59:30.785256Z","submitted_at":"2024-09-05T14:19:45Z","title":"100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances","version":1},"cited_work":{"arxiv_id":"2409.03563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03563","snapshot_observed_at":"2026-07-02T07:36:44.887531Z","title":"Zhihong Pan, Kai Zhang, Yuze Zhao, and Yupeng Han","venue":null,"work_id":"ca9d9a55-e3d6-4e3a-9ecc-713fecf937b0","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2409.03563","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:12c517e48e7ae33945c6db613c88cfdda9fd3e154f8b73999b1bdd1361c97c7b","observation_id":"6bcb9df7-67c6-4446-925a-c48b8ee25d64","resolution":{"observed_at":"2026-06-30T00:24:05.140715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl.a.60","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How to Select Datapoints for Efficient Human Evaluation of NLG Models ? Transactions of the Association for Computational Linguistics, 13: 0 1789--1811, 2025","venue":"Transactions of the Association for Computational Linguistics","work_id":"d5edae56-4530-4c8d-8cef-c717518b2613","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:aad2553d6c105299507224d845e9fbd146734da139869f8e874a0de3768650f3","observation_id":"d4bb1e6d-f27f-4825-b990-f948cc73aeaf","resolution":{"observed_at":"2026-06-29T20:23:57.543379Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Note on Regression and Inheritance in the Case of Two Parents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:cf2afa4a735a5449e4f67e77c023b7c6cc1e5130bcdb8c257bbc54a28c71fcb5","observation_id":"f7266e44-4980-428e-a64a-fa10f3a5be85","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Solutions to instability problems with sequential wrapper-based approaches to feature selection","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:855356afcea4213791ecc282dbe71ff273b69074e99004587138fa45e319602d","observation_id":"e0a75714-3457-4c9a-9277-0d5b48827d6d","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:61ec58cc63d45e5e87e5aca8ce74392ee05d548f9f2300827b6e449874e26cc6","observation_id":"82d5902b-b220-4aa7-98be-b882025174ce","resolution":{"observed_at":"2026-06-30T00:24:05.142943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:0f15bf6544be87dbccdc9786a44524369810c093a028a4d6f41b9281b97a3c8f","observation_id":"1b2eae54-23af-4b80-a327-afb5248aaced","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3018","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances in","venue":null,"work_id":"f37c115d-f328-43b3-be92-d03172bbdf18","year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:6eb3612bd7b62aa4b0e645b6a4a9eeab6c1d1058dc72a281b88690e82be2b025","observation_id":"3549b3fe-e34c-4482-95f4-7196cfc8c96d","resolution":{"observed_at":"2026-06-29T20:23:57.505564Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:53:19.403913+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:53:19.403913+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:8a07a719941fd9ef6ca614b5ffe03d2f9bd64b8602b9a78979bb4a23dc385675","observation_id":"111d0f79-e802-4d69-8bd9-9c419aeffc58","resolution":{"observed_at":"2026-06-30T00:24:05.175434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.824","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging","venue":null,"work_id":"0b20062e-6cd4-4d5c-b36d-18cdb8eb121c","year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:057dcaf568a1e13c3d093283abbcdb82f779dfa995a4437773284a74e2bde936","observation_id":"be5f8723-73d2-4c02-9702-8e92b3e2b881","resolution":{"observed_at":"2026-06-29T20:23:57.509589Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:43.511426+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:43.511426+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:cbc8413fd0a155fb439702ae1152a9c56bc2d44976044ff2b26933fc1c258e44","observation_id":"585485f1-c360-4aff-95a4-c830b5a4e25c","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"MuSR : Testing the Limits of Chain -of-thought with Multistep Soft Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:01d2227a2c3a08409918c38704c69110287264f06e4f3bea9dfbd084dd922a83","observation_id":"9d1caec3-0ab7-4bcf-857a-555ccc3d2041","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1421","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/n19-1421","venue":null,"work_id":"628930d3-897c-43a2-8d6d-589da959e066","year":2019},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:8bc36235def9e1d75002e2c28dadd04d074e49a72371feb6f7269d594e5b913d","observation_id":"6f9d1d2b-379e-4194-84bc-f7a27f98285b","resolution":{"observed_at":"2026-06-29T20:23:57.500392Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:186c3ffe926d786773917ddce1fd620f9c4657649b6e4d229f69e38344379be0","observation_id":"26bfe734-3a07-48a8-8428-ef4b6afee8fa","resolution":{"observed_at":"2026-06-30T00:24:05.133052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"LegalBench : A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:7bf8a5d77c311279c1d2086c1c2e073c95b62e1258251d00346ffe2605257759","observation_id":"fdfd7c3a-daf7-4fa4-9703-0fff60593f4a","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/app11146421","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What disease does this patient have? A large-scale open domain question answering dataset from medical exams.Applied Sciences, 11(14):6421","venue":"Applied Sciences","work_id":"8f5486db-de55-4505-948e-e05912d36328","year":2021},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:3f5b62ef59ab856cea125a08933dc9c5b63cb47ab142fb6933ff9ddc289f2a99","observation_id":"ffec0047-098b-4d7d-b6e9-5458de48f5f6","resolution":{"observed_at":"2026-06-29T20:23:57.531701Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-30T11:25:12.258303+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T11:25:12.258303+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:49:58.267510Z","title":"arXiv preprint arXiv:2510.04051 , year=","venue":null,"work_id":"e6c04182-77e9-4f58-8e21-306263497439","year":2025},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:92da7ed86a7c27e7975c2ce9ca0a68f9d11f3d359a80f8ecdf3d7794bac4a5de","observation_id":"e7c1abf9-1f0e-41f1-ab8f-cfa7ce811a34","resolution":{"observed_at":"2026-06-30T00:24:05.135456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T20:20:15.314971Z","title":"Prudencio, Tom Diethe, and Peter Flach","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:ad38fcaa3552481f334a30ea27185fd94486696463ca1777200cdb1a74b24f59","observation_id":"94b38345-ad96-40ea-be00-3eaf54c464c6","resolution":{"observed_at":"2026-06-29T20:20:15.314971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":36,"verified_exact":32,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 1 inbound Pith citation observation for arXiv:2605.25773."}