{"as_of":"2026-08-09T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9f10049aa0d6cc292b3c1216d556173ee29e2363dd1870a1c67df3058a4a0e3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:44.966255Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:36:56.159561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:5c8ee0cde6797e8cd69f3e6366d8f00b48714e7a2c5c086d4b0c8cc24a79580b","observation_id":"919639a0-3045-4e79-bedf-518059ad8d24","resolution":{"observed_at":"2026-05-10T18:40:50.245598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:55173d60fd3cace0217a81360c1443ec55ed07c6693b4088c97738812167daa9","observation_id":"f4f514b0-5bae-4d7b-bb64-ab29ea276fb6","resolution":{"observed_at":"2026-05-11T05:26:06.167444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-07T14:27:44.966255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18855","last_updated":"2025-05-24T20:09:04Z","snapshot_observed_at":"2026-08-07T14:22:13.651214Z","submitted_at":"2025-05-24T20:09:04Z","title":"Inference Compute-Optimal Video Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:27:44.966255Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2505.18855"},"observation_digest":"sha256:331290028f0b822b8b9ae87d0ebdbfe7ed3d11f4cfdcb7c5419375fdb6c51e6b","observation_id":"00a701f6-41b5-4a06-84e4-d6a0ca130aa0","resolution":{"observed_at":"2026-08-07T14:27:44.966255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-07T05:34:26.931350Z","title":"How predictable is language model benchmark performance? ArXiv, abs/2401.04757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07673","last_updated":"2026-07-21T11:15:43Z","snapshot_observed_at":"2026-08-09T03:05:20.348569Z","submitted_at":"2025-06-09T11:50:41Z","title":"How Benchmark Prediction from Fewer Data Misses the Mark","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:26.931350Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2506.07673"},"observation_digest":"sha256:a4da0f5bcb8c6d719d78f7c4be493d57f845297e324eaa608d2d5149a7aee046","observation_id":"080a3031-0e61-44d9-a8f4-1d99a863ec85","resolution":{"observed_at":"2026-08-07T05:34:26.931350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-07T00:42:01.341630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13216","last_updated":"2025-06-16T08:16:03Z","snapshot_observed_at":"2026-08-09T06:43:04.058790Z","submitted_at":"2025-06-16T08:16:03Z","title":"Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.341630Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2506.13216"},"observation_digest":"sha256:5b9d36a643d899efb2d64cd67030b2d8117ecd7182ed9d8ab6535fa550e752ac","observation_id":"40fd6055-0c1d-4a1c-bcc0-0685509ffc0b","resolution":{"observed_at":"2026-08-07T00:42:01.341630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-07T05:07:39.743953Z","title":"How predictable is language model benchmark performance?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.743953Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b1ed9d5368a5a75f08a3c7b3ecec673d8e7e8396caf2c8a8de0086461de607f6","observation_id":"341e967e-f53c-44d0-b95a-640968e74a98","resolution":{"observed_at":"2026-08-07T05:07:39.743953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-06T18:33:50.399472Z","title":"How predictable is language model benchmark performance?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07931","last_updated":"2025-07-10T17:10:07Z","snapshot_observed_at":"2026-08-09T02:39:04.965663Z","submitted_at":"2025-07-10T17:10:07Z","title":"Meek Models Shall Inherit the Earth","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:33:50.399472Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2507.07931"},"observation_digest":"sha256:a9a59dc7a229603f4ae6d05db357ba5c91f575bf4754250976bf72753d88f6a2","observation_id":"478777c1-efa7-4e92-b886-d3e89bb84549","resolution":{"observed_at":"2026-08-06T18:33:50.399472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:9c80523a1c72b8f48c4efc5a24b02f76728f00ea9aa7c15e5bf4d2d4b9dd7cb6","observation_id":"75ebfafe-8d71-4a7a-90c1-c041c162b77d","resolution":{"observed_at":"2026-05-16T16:29:14.017077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-12T03:36:12.915133Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:4cf39619186ee04b2803d69e5e72cf623ce8da4121ae738b85400da80060187e","observation_id":"13129982-9ab4-4f8e-8c18-b0ab26e40f76","resolution":{"observed_at":"2026-05-12T03:36:19.960521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":2},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-13T07:29:14.545746Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:9fd9f42ab626bfede6d3c0d63ef5c41b1353681dccaaf9832abd1cce80f8d69d","observation_id":"e49f9683-535a-48c1-a719-6f78dca6b220","resolution":{"observed_at":"2026-05-13T07:32:30.280172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":3},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-21T07:57:49.746594Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:7cb4279d4a361427b726f8daad8b34d113c20c78837bb7ae4c0855b0d39c92fc","observation_id":"76e0903b-e60b-42c2-9ba4-cf33c163fb34","resolution":{"observed_at":"2026-05-21T07:59:50.184287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2605.28179","last_updated":"2026-05-27T09:01:09Z","snapshot_observed_at":"2026-08-05T14:49:49.141441Z","submitted_at":"2026-05-27T09:01:09Z","title":"SuperValid: Capability-Aligned OOD Validation for Generalizable Downstream Scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T12:57:31.313438Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2605.28179"},"observation_digest":"sha256:e6d8a0bf1ebd5476bed3752a90fa9f5f10de91c18505deb11c66faf133a349ff","observation_id":"11b0c18c-a78e-4f3a-b1b2-c1af85369d78","resolution":{"observed_at":"2026-06-29T13:03:26.411671Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2606.05029","last_updated":"2026-06-03T15:57:42Z","snapshot_observed_at":"2026-08-01T16:51:47.025025Z","submitted_at":"2026-06-03T15:57:42Z","title":"Validity Threats for Foundation Model Research","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:41.653304Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2606.05029"},"observation_digest":"sha256:38556993dfe4067e895c03c913348995b26d04bae0a677057092ce7b84b01628","observation_id":"1d678b81-fc30-4ae3-84d9-78050f0ac875","resolution":{"observed_at":"2026-07-02T07:36:44.860071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2607.00913","last_updated":"2026-07-01T13:18:21Z","snapshot_observed_at":"2026-08-05T09:20:57.270200Z","submitted_at":"2026-07-01T13:18:21Z","title":"Two AI Metrics Diverged: Will it Make All the Difference?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-02T12:29:24.439779Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2607.00913"},"observation_digest":"sha256:18ee16a8a9d720ca412fbd6214ee95941727f139e3811cc28fa9dbfbc0c4eeaf","observation_id":"334fce09-74a2-40df-8928-474a3ff94c37","resolution":{"observed_at":"2026-07-02T12:36:56.161018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"How predictable is language model benchmark performance?arXiv preprint arXiv:2401.04757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-07-11T07:57:39.948830Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:a9258f43cb1ae9694650ce15dc8eb34729f039b526f5c29d72356b1db93f7641","observation_id":"55cb6e29-b47e-46a7-911f-8a59565b5b1f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.04757/citation-record","integrity":"/paper/2401.04757/integrity","json":"/paper/2401.04757/citation-record.json","paper":"/paper/2401.04757"},"outbound":[],"paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2401.04757."}