{"as_of":"2026-08-06T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b3b57e90e8c50e544ba26d30eedd7e2d9886d94fef4d6d24a785fc7dc521e2e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:37:12.962958Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T04:45:20.445703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T16:58:43.279807Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"cited_work":{"arxiv_id":"2604.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12843","snapshot_observed_at":"2026-07-03T16:58:43.279807Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","venue":"cs.CL","work_id":"62b27eb8-4865-4cd3-9b53-fcb83ca1df98","year":2026},"citing_paper":{"arxiv_id":"2605.06213","last_updated":"2026-05-26T15:14:12Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:15:31Z","title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T10:13:35.777910Z"},"links":{"cited_paper":"/paper/2604.12843","citing_paper":"/paper/2605.06213"},"observation_digest":"sha256:f4804c6ff6d1fbcebf47bd1ad1218a9de1adb96093b910acd0c9adca876a9e6e","observation_id":"1b951344-6798-455c-add9-b9fc88e9595e","resolution":{"observed_at":"2026-05-11T20:06:13.583631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"cited_work":{"arxiv_id":"2604.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12843","snapshot_observed_at":"2026-07-03T16:58:43.279807Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","venue":"cs.CL","work_id":"62b27eb8-4865-4cd3-9b53-fcb83ca1df98","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2604.12843","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:70dcaeaebb1187333f3c8c59f64a4ccbbe9ddac02d68442c3babc46e512df7d8","observation_id":"9c1d734e-88ce-4bb5-a346-8329f24e8f85","resolution":{"observed_at":"2026-07-03T16:58:43.280944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.12843/citation-record","integrity":"/paper/2604.12843/integrity","json":"/paper/2604.12843/citation-record.json","paper":"/paper/2604.12843"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.10062","last_updated":"2023-06-14T15:43:25Z","snapshot_observed_at":"2026-08-03T13:50:02.707294Z","submitted_at":"2023-06-14T15:43:25Z","title":"Revealing the structure of language model capabilities","version":1},"cited_work":{"arxiv_id":"2306.10062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.10062","snapshot_observed_at":"2026-07-04T10:49:46.941557Z","title":"R., and Orallo, J","venue":null,"work_id":"503ffde6-3cd0-45b9-8543-4c9422a107e1","year":2023},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2306.10062","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:82ba34daf8a8bfaaaba98ffa075db62c3cb459be5c6424285bbf9f1c852726a2","observation_id":"0b598f78-1ffb-4e76-adb7-2b07ddcf6e06","resolution":{"observed_at":"2026-05-11T08:30:56.713555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"f1c42704-2f22-4b47-b688-d6d3fef7392e","year":2021},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:982e81ad5da4980de632ffdf731becac07954563dbe7cc2c2232281a36f703f5","observation_id":"e77699b9-3d1b-493a-b72a-2bf8eb368f5f","resolution":{"observed_at":"2026-05-17T14:29:46.093857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:49:46.902303Z","title":"A rosetta stone for ai benchmarks","venue":null,"work_id":"711eef5c-5c89-4b2d-a5ff-6a83ce1d7305","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:4c5b98ff59835a4022d90683135d36d8c170c14dd8c7947be5b78a5543a412f5","observation_id":"a47e77c2-6c2e-4fb1-9ce6-4bb9f5440cd7","resolution":{"observed_at":"2026-05-11T08:30:56.706135Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11106","last_updated":"2025-09-14T05:49:42Z","snapshot_observed_at":"2026-08-04T17:10:34.284259Z","submitted_at":"2025-09-14T05:49:42Z","title":"Fluid Language Model Benchmarking","version":1},"cited_work":{"arxiv_id":"2509.11106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.11106","snapshot_observed_at":"2026-06-28T22:52:45.610919Z","title":"arXiv preprint arXiv:2509.11106 , year=","venue":null,"work_id":"c176fd5f-fba5-4958-bbfc-d89d537ab28c","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2509.11106","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:ed637edafb05d97b6a3554d7b6f52c1b62b55d6a14d4a442dd2b6f1ae5898d44","observation_id":"5ea3ca8f-8041-41f7-bb62-e0f3cf9200c3","resolution":{"observed_at":"2026-05-11T08:30:56.698614Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.101858","doi":"10.1016/j.intell.2024.101858","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"12 Liisa Järvilehto, Yongjie Sun, Nami Aiba, Shumpei Haginoya, Hasse Hallström, Julia Korkman, and Pekka Santtila","venue":"Intelligence","work_id":"0420fde2-9b05-4f0a-a63a-0de99c9b14e6","year":2024},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:88c5ee0a5f52fcbcf91a6c36bde6baa89938121a9238d8cc693f57876d55cd4c","observation_id":"520082a7-d528-42ce-b08f-fb2e696bcec3","resolution":{"observed_at":"2026-05-10T21:25:50.076377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:53:10.186866+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:53:10.186866+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.324","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dynabench: Rethinking benchmarking in nlp","venue":null,"work_id":"eaf930c9-6870-4034-b828-381d52e23251","year":2021},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:a7cda467b772307165f5d8640b36098595fd34fe3f40430e3b734be0d5a9f2c5","observation_id":"b0379a1e-4cce-4041-b22a-2f2c6b485316","resolution":{"observed_at":"2026-05-10T21:25:50.079372Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-02T00:57:49.055228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-02T00:57:49.055228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-05T16:38:33.638599Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:2c116c98fece8a3a5c7ddf204a4f93d5eed0bef23c6b401815fd363db2ae962b","observation_id":"471cbdb5-6644-4b77-8c5b-0595ff536f0d","resolution":{"observed_at":"2026-05-11T08:30:56.694144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0cc090c8-3e28-4bd2-b0a0-fe5e5157e3d8","year":2016},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:bbbd558a07968d3c1fc33907dd749e5593a37c053d58305ef3667877d90e3fdd","observation_id":"a82166b1-a2ce-4875-a12b-acba89703f2b","resolution":{"observed_at":"2026-05-17T14:29:46.097265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d16-1062","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Wu, Hao and Yu, Hong","venue":null,"work_id":"c5856704-a4ae-4f08-a36b-5bd3a89ec5cd","year":2016},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:ddc91f180ea19ba51331487acd31a34f784238275403752ba4914dbc43232a78","observation_id":"249dd8f0-5c01-41ed-b27b-4589a87640f4","resolution":{"observed_at":"2026-05-10T21:25:50.023398Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04689","last_updated":"2026-07-13T22:56:21Z","snapshot_observed_at":"2026-08-04T23:30:14.739124Z","submitted_at":"2025-10-26T03:54:12Z","title":"Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks","version":3},"cited_work":{"arxiv_id":"2511.04689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.04689","snapshot_observed_at":"2026-07-15T01:20:49.385427Z","title":"Frederic M","venue":null,"work_id":"84eb4ef4-b147-4b98-a271-127b0a97d297","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2511.04689","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:c341e5b07ac843df9acd371e4c3b2d7511c5c8b077187fe37fd8aed246062a80","observation_id":"05ebc3d2-978a-46f9-8be2-eb156ab75157","resolution":{"observed_at":"2026-07-15T01:20:49.385427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sasha Luccioni, Yacine Jernite, and Emma Strubell","venue":null,"work_id":"d2b73431-c435-4a35-bb3f-5be537fc3c29","year":2024},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:7df43dcacf8c1d41f2d4615af8aae6f42b85a0bdd10aafce62e5910e23fda8ff","observation_id":"b887eb82-d5c0-411e-9f9b-c2a441b0f422","resolution":{"observed_at":"2026-05-17T14:29:46.100599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0106.365854","doi":"10.1145/3630106.3658541","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond Individual Accountability: (Re-)Asserting Democratic Control of AI","venue":null,"work_id":"d0b5b89e-a5fa-4fe4-ab55-8eb27c7a2418","year":2024},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:17921b4404cff68b5b7761ee48aa3e5a682dade00ac6347375015849e98783a0","observation_id":"90f7d9e2-aaf6-434f-9291-b101cdcd3c25","resolution":{"observed_at":"2026-05-10T21:25:50.067120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20208","last_updated":"2026-06-11T05:27:45Z","snapshot_observed_at":"2026-08-06T13:48:01.479725Z","submitted_at":"2025-07-27T10:11:16Z","title":"From Benchmarks to Skills: Low-Rank Factors for LLM Evaluation","version":2},"cited_work":{"arxiv_id":"2507.20208","doi":"10.48550/arxiv.2507.20208","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20208","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yotam Perlitz, Elron Bandel, Ariel Gera, Ofir Arviv, Liat Ein-Dor, Eyal Shnarch, Noam Slonim, Michal Shmueli-Scheuer, and Leshem Choshen","venue":"arXiv (Cornell University)","work_id":"2244f4ba-8f8c-422b-9845-0bc9c61231dd","year":2024},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2507.20208","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:45e58be784c63c32dd294332abc89ad4adbf04501110dbe5464fced3902fd2ea","observation_id":"545cf548-90c2-4386-afa0-2b04eaef10d1","resolution":{"observed_at":"2026-06-12T02:09:07.519296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URLhttps://openreview.net/forum?id=qAml3FpfhG","venue":null,"work_id":"10371da9-01c0-4a72-bf64-1ed038f0fb1f","year":2024},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:3b481cadad37b6039f3b45066692f9f328371b54e44c55be9744718aea1747db","observation_id":"31b38521-984a-43fd-95eb-dc0200fa0863","resolution":{"observed_at":"2026-05-17T14:29:46.103509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.346","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Jia, Robin and Boyd-Graber, Jordan","venue":null,"work_id":"45605785-359c-49de-84dc-0f416a8f1c97","year":2021},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:daa5d62a6e499133e32c75e5efc8741754f711cea49d33c04e2cbcb00978b18c","observation_id":"36b24013-0a66-4c4c-b120-27387ceb91b3","resolution":{"observed_at":"2026-05-10T21:25:50.070265Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T21:49:28.249205+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T21:49:28.249205+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/j","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:50:15.195436Z","title":"Chothia and A.M","venue":null,"work_id":"b8ea1a15-a40d-4760-8de8-d50fa97911d7","year":1971},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:257e9d0b9ac35c8fe968bbbfb194c256727281bc1a6647fee12b506bb2e15996","observation_id":"b6b74848-b548-4bdb-890d-7a7bbfeedb80","resolution":{"observed_at":"2026-05-10T21:25:50.083508Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13335","last_updated":"2025-03-17T16:15:02Z","snapshot_observed_at":"2026-07-06T20:54:04.912422Z","submitted_at":"2025-03-17T16:15:02Z","title":"Reliable and Efficient Amortized Model-based Evaluation","version":1},"cited_work":{"arxiv_id":"2503.13335","doi":"10.48550/arxiv.2503.13335","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reliable and","venue":"arXiv (Cornell University)","work_id":"9bdc9389-5004-4ece-b0d2-6dfb413c5253","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2503.13335","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:9181f21e2cffbfb623ff992e57278fa09370a8116f04222e2ec968bc762daac1","observation_id":"ff199c6f-5d59-4821-9ec8-c55a6d0806bb","resolution":{"observed_at":"2026-05-11T08:30:56.688972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:32.945442+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:32.945442+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":1,"verified_exact":4,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2604.12843."}