{"as_of":"2026-08-05T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3af4a834b8cd7bf1e5d39468f8e5ea2a2ea9145ed8e306efe16d89713c402bb","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T05:05:35.282725Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:08:20.340476Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10405","snapshot_observed_at":"2026-08-01T18:08:20.340476Z","title":"Valid best-model identification for llm evaluation via low-rank factorization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17409","last_updated":"2026-07-19T21:01:34Z","snapshot_observed_at":"2026-08-03T01:51:34.955007Z","submitted_at":"2026-07-19T21:01:34Z","title":"Efficient Sequential Evaluation of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:08:20.340476Z"},"links":{"cited_paper":"/paper/2605.10405","citing_paper":"/paper/2607.17409"},"observation_digest":"sha256:bafe296149333c6ba91107098d76f238cd296dba09afe713d748d924862326e2","observation_id":"a08e148e-dd09-4811-8b08-5fe1a3515dd9","resolution":{"observed_at":"2026-08-01T18:08:20.340476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.10405/citation-record","integrity":"/paper/2605.10405/integrity","json":"/paper/2605.10405/citation-record.json","paper":"/paper/2605.10405"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:72ee71a1680b3e9ed44cc827d1ab852063583de2eb7cf22bcc413aaec964aa7e","observation_id":"35ffab3c-84d1-49c4-b07d-a695f14400c7","resolution":{"observed_at":"2026-05-12T05:41:24.206597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on large language models for code generation.ACM Transactions on Software Engineering and Methodology, 35 (2):1–72","venue":null,"work_id":"86ad7c3f-7fa1-4c68-b66f-2b27f7a66d6b","year":2026},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:48e968d83c4d3c2abeff192c64eb5c5b35a6fce4b508e98d4d872f0934f18e94","observation_id":"316257e9-30d7-40a7-98b1-c31a53bb7926","resolution":{"observed_at":"2026-05-12T12:21:33.748037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:354d14f6111e7b93b4ebed062c8960ceeec9b42fbb2476f753a878e099c32952","observation_id":"c4d6e241-5531-453e-b276-623b4ec3143d","resolution":{"observed_at":"2026-05-12T05:41:24.214692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.345368Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290","venue":null,"work_id":"8ce2e771-bc8c-4b3b-a834-6303b981b746","year":2024},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:362a38343d56776d3aa971dec05879d987e88c616a32b3b2ffdc7c755ef8a007","observation_id":"d5992728-8131-404c-a682-f577f6324e1b","resolution":{"observed_at":"2026-05-12T12:21:33.735059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"f53310e2-3607-421e-a3e6-a3d12a9f1505","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:23f231afc36de1d53ea1f4565e4f4f7577c6d622dd825d51027e81b3dfae7f22","observation_id":"aad61b36-5ad1-4a0a-9c34-6d2967b90d8f","resolution":{"observed_at":"2026-05-12T12:21:33.739298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaia: a benchmark for general ai assistants","venue":null,"work_id":"938481c4-8d37-4e17-8bf9-514a7d98af1f","year":2024},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:372f43d0cda295b45b5b497dc17d5e51abc2106649b70d9e3f5df8f47ddaca5f","observation_id":"e49e4c1b-370b-4f1f-ab97-a5358aca0ca5","resolution":{"observed_at":"2026-05-12T12:21:33.764615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.23749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T18:38:49.416265Z","title":"Efficient benchmarking of ai agents.arXiv preprint arXiv:2603.23749","venue":null,"work_id":"348d818b-9651-4029-b03e-c245646b2395","year":2026},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:251a65a20aabaa90a86a51e69477b36d6fdad09f7dc954fe01802130cf410280","observation_id":"8be03e6f-8839-4fc1-b5be-e5d924563abc","resolution":{"observed_at":"2026-05-12T05:41:24.255501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11977","doi":"10.48550/arxiv.2510.11977","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic agent leaderboard: The missing infrastructure for ai agent evaluation","venue":"ArXiv.org","work_id":"dec804c2-eb85-4ee1-bae1-dfb23b87886d","year":2025},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:f598802a5e86cd064e7a14e5ce09b062f824d3473df02152f9c6541bb4ccaa25","observation_id":"9bbcb3ba-097f-4cf3-b695-5255d4a8604e","resolution":{"observed_at":"2026-05-12T05:41:24.276169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Best arm identification in multi-armed bandits","venue":null,"work_id":"9b1331c0-519e-4bbc-866d-4ebc20e421cd","year":2010},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:210a1d07694f45b809bba4517dcd706f42c10433cb1ded242ac448a2c17e52d3","observation_id":"acf2c947-c9a8-40dd-a171-1758aac8c417","resolution":{"observed_at":"2026-05-12T12:21:33.701844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On speeding up language model evaluation","venue":null,"work_id":"7c38ac83-a710-45f2-ad4c-e69968e8addc","year":2025},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:dd97b19be392e065a85eec83db707a3a4daadf168be689c81c232926f735d924","observation_id":"303d3a0d-bf7f-4a4f-abae-86a46f7af6a0","resolution":{"observed_at":"2026-05-12T12:21:33.696353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semiparametric efficiency in multivariate regression models with missing data.Journal of the American Statistical Association, 90(429):122–129","venue":null,"work_id":"f4ead66f-009e-4f3f-8417-66de8ee16026","year":1995},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:69f54679a15542f0f6a2c06df10362eb6328a86cf53642328536cd24fb2b9384","observation_id":"fa348ac7-0015-44e9-bc62-fa746b701407","resolution":{"observed_at":"2026-05-12T12:21:33.744057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"8919b325-5ee1-4148-90df-44183fa292b1","year":2006},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:116be77900b35e1d81bebb70e6ca64fe98e474301c87cf1ee5bfa454d5990a91","observation_id":"716fd16d-738c-4263-89a1-1aacdd9da477","resolution":{"observed_at":"2026-05-12T12:21:33.670494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prediction-powered inference.Science, 382(6671):669–674","venue":null,"work_id":"1c0d1525-31a4-4db1-b11a-043c42e5fb31","year":2023},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:de5f6f98d3b37a9e6d11361a928836ae9ecb7efc7a0d61850b7bcc08c81d5e9c","observation_id":"abf59e41-4263-498c-8f5d-4904a46a2c1f","resolution":{"observed_at":"2026-05-12T12:21:33.688720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01453","last_updated":"2024-03-26T01:44:52Z","snapshot_observed_at":"2026-07-06T16:42:19.938941Z","submitted_at":"2023-11-02T17:59:04Z","title":"PPI++: Efficient Prediction-Powered Inference","version":2},"cited_work":{"arxiv_id":"2311.01453","doi":"10.48550/arxiv.2311.01453","metadata_source":"pith","pith_arxiv_id":"2311.01453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PPI++: Efficient Prediction-Powered Inference","venue":"stat.ML","work_id":"722d90b8-1ad4-4af6-af32-3a828faf318f","year":2023},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2311.01453","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:a7c298cad25e616a181498e86c74ec07e543efc835cca0764cd77e321d85ac2d","observation_id":"5b4c5ffb-fd23-4c44-a4d3-77edb54a8e04","resolution":{"observed_at":"2026-05-17T12:22:26.080624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Confidence intervals for policy evaluation in adaptive experiments.Proceedings of the national academy of sciences, 118(15):e2014602118","venue":null,"work_id":"9d27dc19-f6b3-4652-9326-b44d81e8ab24","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:eaf9485691b6d0de5b782cb0fc9c3d2e9a09d95536c86f7277da8e041fef85ad","observation_id":"79ed0348-cb2d-41aa-a504-c5dd42e43561","resolution":{"observed_at":"2026-05-12T12:21:33.656675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-07-06T02:25:17.083332Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":"1103.4601","doi":"10.48550/arxiv.1103.4601","metadata_source":"pith","pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Doubly Robust Policy Evaluation and Learning","venue":"cs.LG","work_id":"6fee03e7-42b0-4024-bb9e-f0b36756d3ef","year":2011},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:a57d7564aa1b3fa7b205dadf3f51358ccc1ea051d031f9226eabb5ed8d2d5879","observation_id":"47d474e3-e995-4591-a498-1a4ba04e74aa","resolution":{"observed_at":"2026-05-12T05:41:24.266806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal and adaptive off-policy evalua- tion in contextual bandits","venue":null,"work_id":"2356e89a-65e1-450e-8542-3bf2d0fade5b","year":2017},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:aecadea51124f138c18e9e3c06720cc26970beae4f59eb647cc944b1408095e9","observation_id":"0fd182fa-279c-46fc-9206-a925070d7efd","resolution":{"observed_at":"2026-05-12T12:21:33.666173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online multi-armed bandits with adaptive inference.Advances in Neural Information Processing Systems, 34:1939–1951","venue":null,"work_id":"1dcfd29c-e817-4e24-a546-ba78269e20bd","year":1939},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:e54f74b2853c0f53bdc400248d6b0bd77968fbb438db08fe7fa746e2d6540b0a","observation_id":"25fb32f0-da85-4992-85f9-4b99eb513c93","resolution":{"observed_at":"2026-05-12T12:21:33.730428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The adaptive doubly robust estimator and a paradox concerning logging policy.Advances in neural information processing systems, 34:1351–1364","venue":null,"work_id":"18d0ebb3-79ee-4c7e-bffb-f7f0a8f025cd","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:2f57f4fe4dd04036ba4f4f4ff381c666267b2e3fe3717b61447502afa47f72e2","observation_id":"837b5998-84e8-4a13-a895-318a55fe5944","resolution":{"observed_at":"2026-05-12T12:21:33.769100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Post-contextual-bandit inference.Advances in neural information processing systems, 34:28548–28559","venue":null,"work_id":"00ecb3e2-7fd7-4d31-8d10-ce9e05d2fe36","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:bfbb409c12422652f6d9409a6d7d6893611eb5840b6b7259833bb01aa1da644f","observation_id":"ae715d7a-a9c0-4aaf-8249-adc99d41ee08","resolution":{"observed_at":"2026-05-12T12:21:33.682464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy evaluation via adaptive weighting with data from contextual bandits","venue":null,"work_id":"89f1c861-aa29-48b1-b54b-19dc42cbff78","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:cff50500a3bc670547590ec5900712fc8e758d513102309d729deb2d7f2d18bc","observation_id":"555dc1b2-47d2-4077-a03d-aa9854fc4409","resolution":{"observed_at":"2026-05-12T12:21:33.718175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doubly-robust lasso bandit.Advances in Neural Information Processing Systems, 32","venue":null,"work_id":"68a2f38d-e465-4d73-8219-a69814873906","year":2019},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:f7212dc491bbc609aef55966fbc55b10e37e0cf44488fcfb25dfeddec3532f8b","observation_id":"6febb63f-f64f-4b31-b921-ee252bd6dbaf","resolution":{"observed_at":"2026-05-12T12:21:33.722310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doubly robust thompson sampling with linear payoffs.Advances in neural information processing systems, 34:15830–15840","venue":null,"work_id":"44a175fd-7fc7-43d8-acb1-9cc0b0916bfc","year":2021},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:ce2b089b1115c6ebc559a8cd9141e99adf874f176aa1d25751ffd65e90b0a96a","observation_id":"2a0bd780-9b91-4f5e-9142-35f19babaa46","resolution":{"observed_at":"2026-05-12T12:21:33.754953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16658","last_updated":"2026-04-21T21:21:37Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:09:39Z","title":"Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards","version":2},"cited_work":{"arxiv_id":"2506.16658","doi":"10.48550/arxiv.2506.16658","metadata_source":"pith","pith_arxiv_id":"2506.16658","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards","venue":"math.ST","work_id":"deb9d4e9-d874-423c-acc1-4f1783bbc63a","year":2025},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2506.16658","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:16126f1a751d903e384575079b9f1ba1d00f824f3119625debc9777ba5fe0a3b","observation_id":"33bff643-cf89-47ca-87dd-2985cbc21fb8","resolution":{"observed_at":"2026-05-12T05:41:24.243690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Best arm identification with llm judges and limited human audits.Available at SSRN 6147806","venue":null,"work_id":"e9e7a3c2-0c8a-42be-97af-738c0458a96b","year":2026},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:e9d59d9ab0ee88f8549ea85863c06751364bb3fef5bce46cf824e9b90aa7f7f3","observation_id":"754caf53-6c2c-41c0-9f28-953f3c3c872c","resolution":{"observed_at":"2026-05-12T12:21:33.711506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20251","last_updated":"2026-05-08T20:35:11Z","snapshot_observed_at":"2026-07-06T22:43:17.026472Z","submitted_at":"2026-01-28T04:59:20Z","title":"Efficient Evaluation of LLM Performance with Statistical Guarantees","version":3},"cited_work":{"arxiv_id":"2601.20251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20251","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Evaluation of LLM Performance with Statistical Guarantees","venue":"stat.ML","work_id":"ee45396e-8d55-4d0c-9272-700bd66fc462","year":2026},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2601.20251","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:e53313da378ab6736aae67307f66494b79317db71310042421f49aaa02fa8b24","observation_id":"3332347f-b3d2-41ef-b8b1-ee9a1ba432db","resolution":{"observed_at":"2026-05-12T05:41:24.220209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Concentration inequalities for sampling without replacement.Bernoulli","venue":null,"work_id":"7a232dd7-1a56-4bc5-8ded-c9e60eb26e03","year":2015},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:d13a25ba5507e9592ed281c0e29d2e17adc97c46c2f5ae86c56216bd4e3efa95","observation_id":"8de8400c-9ee4-4b32-9c5d-8a32c63d5e47","resolution":{"observed_at":"2026-05-12T12:21:33.661407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:051d4106d9a8eb623070c5d8ce5a1ba5c5281723d53226742a60ffdf10b847fd","observation_id":"3027fe90-6a4f-4563-b486-37712814b645","resolution":{"observed_at":"2026-05-12T05:41:24.233296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"384f32e1-14c7-4216-b925-c5603794dff2","year":2024},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:35330cddecfe6ed5596c0c4eb920698a0ceb7b378d3b85ca2f18586e36ddd3a6","observation_id":"6eaa682e-e3b5-4688-b2c3-222dcb314d2f","resolution":{"observed_at":"2026-05-12T12:21:33.678085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:0cd4733dcc448ec16997c490462616fe887c15da099875b834bcbcdf44e3cee6","observation_id":"18cc7a51-c3c0-4424-8280-d83feb37826b","resolution":{"observed_at":"2026-05-12T05:41:24.249491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Camel: Communicative agents for\" mind\" exploration of large language model society.Advances in neural information processing systems, 36:51991–52008","venue":null,"work_id":"dace532f-49b5-4e85-9c51-555c1df57bf8","year":2023},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:a121042d4fa449fe006d3d5e1cc4aa21b99818641ebb385da1d7cf0b0043dfa3","observation_id":"7738c768-1d29-4896-800a-4adc16406be9","resolution":{"observed_at":"2026-05-12T12:21:33.705940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Musr: Testing the limits of chain-of-thought with multistep soft reasoning","venue":null,"work_id":"af6aae56-1c3f-4f6d-9adf-d3dbf734fff1","year":2024},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:e947ed03e4374ba5c55c02cfccbf215f803be57276a44d931bb006a2a9e8df01","observation_id":"4f1ebc1f-899e-413c-992a-4bb39f93f397","resolution":{"observed_at":"2026-05-12T12:21:33.674483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regularization paths for generalized linear models via coordinate descent.Journal of statistical software, 33:1–22","venue":null,"work_id":"81268533-d7b0-4f9b-a069-6c981be05ab4","year":2010},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:6b0f7d5b97315cfc07adae25c772fa683c365b0b94cccf1f4bcea2e7b53ce8af","observation_id":"7d61f4a5-640d-4220-a72f-6636721ecb00","resolution":{"observed_at":"2026-05-12T12:21:33.759625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On bernstein-type inequalities for martingales.Stochas- tic processes and their applications, 93(1):109–117","venue":null,"work_id":"1e87cbf5-c214-472f-b1bc-4db28a8cb940","year":2001},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:18156b56638a9d06e6a829c08e3371077e64a6164abc9b262ff16464234cbc7b","observation_id":"9f85d91c-89bb-4002-8f26-7e73c88f0ae0","resolution":{"observed_at":"2026-05-12T12:21:33.773705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Z k i − ¯Z <k i 2 Fk−1 # =E","venue":null,"work_id":"4863e594-a62f-48f9-81ad-b982efaacfd4","year":1975},"citing_paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:35.282725Z"},"links":{"citing_paper":"/paper/2605.10405"},"observation_digest":"sha256:e5506ed0780f9454378978e6b3d07a12e68cbf20d7c4acef891c8543434145e5","observation_id":"646e4902-2c99-41bc-978d-84894251507c","resolution":{"observed_at":"2026-05-12T12:21:33.726231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10405","last_updated":"2026-05-11T11:43:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:43:28Z","title":"Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":24},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2605.10405."}