{"as_of":"2026-08-14T12:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a1a667b6680eabbf50d5396a7245c71f6abd721d924c00fc817a5f1a1aac722","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T09:38:44.568685Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:08:21.473999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05046","snapshot_observed_at":"2026-08-01T18:08:21.473999Z","title":"Collabeval: Statistically efficient collaborative model evaluation via matrix completion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17409","last_updated":"2026-07-19T21:01:34Z","snapshot_observed_at":"2026-08-11T21:15:12.177966Z","submitted_at":"2026-07-19T21:01:34Z","title":"Efficient Sequential Evaluation of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:08:21.473999Z"},"links":{"cited_paper":"/paper/2607.05046","citing_paper":"/paper/2607.17409"},"observation_digest":"sha256:ccbae0aa7365ff65fb94ace51825ccac7cac9ac68896e27c1ebc24a5996db942","observation_id":"ce0c4fc5-f706-427d-809b-790d6c5acc41","resolution":{"observed_at":"2026-08-01T18:08:21.473999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05046","snapshot_observed_at":"2026-07-30T13:33:12.987656Z","title":"Fisch, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27023","last_updated":"2026-07-29T15:20:39Z","snapshot_observed_at":"2026-08-07T00:23:58.047490Z","submitted_at":"2026-07-29T15:20:39Z","title":"BayesAME: Bayesian Active Model Evaluation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-30T13:33:12.987656Z"},"links":{"cited_paper":"/paper/2607.05046","citing_paper":"/paper/2607.27023"},"observation_digest":"sha256:550c5d9183d175c3fb01767c320e9157e15ad6e82b4d2b72213fe7e912bde7b7","observation_id":"f1075e93-4eab-403b-bb71-6bb7527ea992","resolution":{"observed_at":"2026-07-30T13:33:12.987656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05046/citation-record","integrity":"/paper/2607.05046/integrity","json":"/paper/2607.05046/citation-record.json","paper":"/paper/2607.05046"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Prediction-powered inference.Science, 382(6671):669–674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:c1e20727420d9bab7abd54acafbad7e9c2dd5b6d9d9993c71e06362aa3b750ed","observation_id":"ee6e8239-a555-4645-a335-e290ca5af5fd","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01453","last_updated":"2024-03-26T01:44:52Z","snapshot_observed_at":"2026-08-13T13:02:03.545167Z","submitted_at":"2023-11-02T17:59:04Z","title":"PPI++: Efficient Prediction-Powered Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01453","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"PPI++: Efficient prediction- powered inference.arXiv preprint arXiv:2311.01453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2311.01453","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:3ef074d22151e5e235ec77e4603c8017994f399075661a7422c6df4b6b28b8e4","observation_id":"9b4f31b6-3762-481e-a4b7-fad3765f6c9f","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07949","last_updated":"2025-06-09T17:14:41Z","snapshot_observed_at":"2026-08-07T05:19:16.640783Z","submitted_at":"2025-06-09T17:14:41Z","title":"Cost-Optimal Active AI Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07949","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Angelopoulos, Jacob Eisenstein, Jonathan Berant, Alekh Agarwal, and Adam Fisch","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2506.07949","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:b29eb5aaf54fd8c3589d0ecd8d21f9cdc873762500da665998704d5837aab719","observation_id":"be2e3506-c2fc-4221-8876-210ce47a74a4","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:fdc903a0d17bdec5f1cdc29bd7c4bdc039fed91c6aaa48afcd81c7fd3e4d358e","observation_id":"d371683d-e1a6-4b45-bb45-8b4857c73394","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08037","last_updated":"2023-02-10T20:04:05Z","snapshot_observed_at":"2026-08-13T13:20:36.379988Z","submitted_at":"2022-12-15T18:45:29Z","title":"Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08037","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2212.08037","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:71cfeb5c985f5210c101ce653328232d7789f183466bb79d970806206b764964","observation_id":"8199bf4f-c6f3-4619-a026-83f5c73abe93","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07008","last_updated":"2026-06-01T01:28:08Z","snapshot_observed_at":"2026-08-13T00:58:54.374789Z","submitted_at":"2024-03-09T02:47:11Z","title":"AutoEval Done Right: Using Synthetic Data for Model Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07008","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"AutoEval done right: Using synthetic data for model evaluation.arXiv preprint arXiv:2403.07008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2403.07008","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:28a05b598855051157fd100f48ac393e1ea3571f111015fb6719a73a2a9da04a","observation_id":"0afdce97-1a9b-4ac9-a09c-ac810dbd5070","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Prediction- powered ranking of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:a3cf5e923936b417c0cb11a73f48ede2afaa6886f7270da24677f28259592e29","observation_id":"76512655-8e38-49eb-a3af-f1b69383252b","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:bc87d200f0e72c8b295eee3891dbf81fe4e6d125fade9a611d05f5e9e664ed87","observation_id":"7503b542-aac3-458a-80bf-a91ebbf0811c","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"WMT24++: Expanding the language coverage of WMT24 to 55 languages & dialects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:6acb2e8c44a63e2df8341fe52c40c1b3b7b19db543e94fafc3f040630bcc53bc","observation_id":"55fa8252-edae-4ca2-a148-8c31a00822a5","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"ISBN 979-8-89176-256-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:f31152b1c2bbc3aeb81133977455813001f8eced30ba3664ccfaddb6677279dc","observation_id":"9aba35cc-b374-47e7-a9e3-23f33ef68b6d","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Alex Hofer, Bhuwan Dhingra, Amir Globerson, and William W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:0cfc84b72fb6c330801de187da5b90a6a4e797c0ff2c536419b73d2a34855eb9","observation_id":"6bd22a3e-36df-4bbc-8a8a-b8c582db8871","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15204","last_updated":"2025-02-08T15:15:35Z","snapshot_observed_at":"2026-08-12T22:56:26.910225Z","submitted_at":"2024-08-27T17:03:18Z","title":"Can Unconfident LLM Annotations Be Used for Confident Conclusions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15204","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Can uncon- fident llm annotations be used for confident conclusions?arXiv preprint arXiv:2408.15204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2408.15204","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:080be67e4932a9241ff5dd0c6dcbb84a1be5c9761d865ddae38fe788b83496ee","observation_id":"6a243a6d-20e9-42fc-8827-2761071f6ab1","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Olmo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:b645253e80a9ee4ec70da3a7f2987336f3622e621cd9546eaf324563a4c00096","observation_id":"0370cbdf-98d8-4cfc-bfe3-cb9bc0f1b549","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:241c8ede798a3aed4ea470dd5c4002f04f1421bec2f0b1b5beb2e7c973ab926a","observation_id":"6e3e85ee-9fed-4849-bc68-bd8eeb72f474","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:750f3776d29e1912e5f42a9e05f0f835fa31b457b48534b0a70bef6faacbe5bf","observation_id":"b3334b36-6038-4fdd-a87c-9ab1cd4c38c4","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"SWE-bench: Can language models resolve real-world github issues? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:6c008719b59450a125efb6c15be5bfa5fcd2b1034c344ae989b3652a58eebf0a","observation_id":"110d7b0f-8dc6-4174-940f-fd21bd54dda9","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"MetricX-24: The Google submission to the WMT 2024 metrics shared task","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:5d23c57554c007976b5732ba3263f883e93bb0f90548d9549b076b26f29d6b27","observation_id":"5099a01d-3c86-4a8a-98b6-df9c475090cb","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Schulze Buschoff, and Eric Schulz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:a392a780bfce68ae21a5c477277f33de0549f4dca09b211807b72df0aa5f2cd0","observation_id":"85524a48-99f5-4ebc-9471-bba80e90b4ff","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:78ad9fca7db6724b94a80ad37c005e94846d83b185d2d325812599c13cf471e2","observation_id":"14f2a2f7-6923-4fb8-af7c-457cd7089a34","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-08-13T05:04:55.673675Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Llm360: Towards fully transparent open-source llms.arXiv preprint arXiv:2312.06550, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:9cd095dd1f0b74c072be8a145e6adf98c290088b72182fdd5cfd5140e8b7b50f","observation_id":"1cbae9d5-e679-4250-af8f-a74275fc6ec4","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-14T10:55:02.137567Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Llm360 k2: Building a 65b 360-open-source large language model from scratch.arXiv preprint arXiv:2501.07124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:9d9960edc2383f950e4cfdd02b7281561cecf7e43fcaf89f1c2042f544fc45bf","observation_id":"37d2254b-2d91-4067-b330-26975a3278ec","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:355aad2b18206a283a88fcbc61556ca4745576b83b321817f9ab80d4ed5703b8","observation_id":"718b6d60-243e-498b-b22f-7feb346fa610","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:e79dd58b406c80e173553f18a19ec46af6b9f1ab551a410afd443d05fafd256a","observation_id":"20693ff7-817a-4148-a283-415ad68ad40e","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Rich insights from cheap signals: Efficient evaluations via tensor factorization.arXiv preprint arXiv:2603.02029, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:904b3a4191969755107fe3678ebfdc6c573bbe6c90cc1e0c9b36ad3465e906ac","observation_id":"4f83792d-34d7-4869-abcd-ec99aa264564","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Item response theory in ai: Analysing machine learning classifiers at the instance level","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:c15adf967f56a8892f8053bcb6972281425c9a071cb9c8b5ba718e495b02cc01","observation_id":"0f7e8fb6-3f15-4d90-b702-972713cba68a","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Spectral regularization algorithms for learning large incomplete matrices.Journal of Machine Learning Research, 11(80):2287–2322, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:3ccac95c2c6a94a4c18e3c53a129aa34faa5cbe35bf6db67b3e9420113d6ac5b","observation_id":"fa2248b8-1ae9-40c8-919f-a0c1375a434f","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"2olmo2furious.arXivpreprintarXiv:2501.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:94f5c742cca1c699a1b56d20391fa837f9b579e6657510ca0fe0349db49d3f72","observation_id":"5dc8a9fd-4260-400c-81a5-bb59980b421b","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"You don’t need to run every eval, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:ee5cbca6dce0830c3ce53b26bad393471f934f61d9b6a0cf84d7e7fa8cde3085","observation_id":"2de3510d-d014-4691-a03b-bc3fd55706e3","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:568dd89b727a67ed7074a02111edbfce70850e8ae488227d22d89d6c15b7b47d","observation_id":"d8ecda5b-3b5d-416e-8d88-4fed4a6ba198","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Lalor, Robin Jia, and Jordan Boyd-Graber","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:52956a37722c118c9d5e42424b5f95ce31674f8805d5016cba7d3ecd725097d8","observation_id":"17ccc8fc-b4a2-4191-9cab-a4f68ef7ff72","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Missing value estimation methods for dna microarrays","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:d92f37fcb64e6ee510301a960a32729452276bbf5f8762a9179ce23b2789a416","observation_id":"0ce38cd9-04ca-4238-b050-991533acf57c","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Anchor points: Benchmark- ing models with much fewer examples","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:4fbb3ce2c412d1dee8b2dec33ba0a67895bea4c7a361cdcf94c160af3e538075","observation_id":"f15d79b8-bac1-42c5-afd2-29ccf8a163b6","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"doi: 10.18653/v1/2024.eacl-long.95","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:81ae3cccd245ee4b5216bc3950def1644273bf6bcf95e3b5e3a8099c1390b8dd","observation_id":"0c347fb9-8008-487b-9d6b-fa8c8ae999a6","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"How predictable are large language model capabilities? a case study on BIG-bench","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:85de93f4dc34c074371cff3a25fc1441e59c7f3ff31caf67764cc8fa8ddb90eb","observation_id":"83723642-977d-46eb-a9fc-e0ba118d374a","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"Collaborative performance prediction for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:669ad8c89517edd9c85fc89e86cb759aabcb1cc9352d758ffdfdd263bd1c029f","observation_id":"039ad392-d0be-4578-af57-d52281d244d8","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"On speeding up language model evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:f4e761314557fe0c8580bd6001564f6473614d5ba3b66671b084f17ac32335d9","observation_id":"753df974-f078-4927-8ddb-57e31fd8d0a3","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T09:38:44.568685Z","title":"power tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T09:38:44.568685Z"},"links":{"citing_paper":"/paper/2607.05046"},"observation_digest":"sha256:86f48a2d1b9cfcbdbd8fc1f7b2ea768504f5ef5a285760c8c45dbd5991ed3faa","observation_id":"206bc132-e769-43c5-a55e-49631af956fa","resolution":{"observed_at":"2026-07-11T09:38:44.568685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05046","last_updated":"2026-07-06T13:22:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:51:58.246336Z","submitted_at":"2026-07-06T13:22:04Z","title":"CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2607.05046."}