{"as_of":"2026-08-21T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a2c9e423527bdab3347fd62301e67983b72c85f48c73e16d0010cfee6b2a08e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:23:53.806181Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.087704Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-10T14:38:25.862946Z","title":"metabench–a sparse benchmark to measure general ability in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15147","last_updated":"2025-02-23T08:09:48Z","snapshot_observed_at":"2026-08-19T23:40:24.057770Z","submitted_at":"2025-01-25T09:11:15Z","title":"A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:25.862946Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2501.15147"},"observation_digest":"sha256:0dced21983cb6ed1590bbdc0a96a7977d14d5058df04834820753cbee09b985d","observation_id":"e90a0b89-3763-4ded-b0ac-f717c25c9ddd","resolution":{"observed_at":"2026-08-10T14:38:25.862946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-16T04:23:53.806181Z","title":"Metabench– a sparse benchmark to measure general ability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03814","last_updated":"2025-05-02T17:05:01Z","snapshot_observed_at":"2026-08-17T15:11:12.016051Z","submitted_at":"2025-05-02T17:05:01Z","title":"Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:23:53.806181Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2505.03814"},"observation_digest":"sha256:1c80e7db40c972966e7ca20a73f88e24caca15a5ff812cc1034293180f07983c","observation_id":"5d40505a-3946-4f22-8c5e-6efaccecf898","resolution":{"observed_at":"2026-08-16T04:23:53.806181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-07T14:08:09.475795Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19959","last_updated":"2025-07-30T16:46:12Z","snapshot_observed_at":"2026-08-20T19:04:49.811733Z","submitted_at":"2025-05-26T13:21:18Z","title":"MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.475795Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2505.19959"},"observation_digest":"sha256:fee37d62561022d1b72ae6566998cd6263e3423388cc33c60aeaf974ac3732a3","observation_id":"bd35b406-d089-423a-ade4-f0b92e37ae66","resolution":{"observed_at":"2026-08-07T14:08:09.475795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-07T00:42:00.775227Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13216","last_updated":"2025-06-16T08:16:03Z","snapshot_observed_at":"2026-08-16T23:06:14.528660Z","submitted_at":"2025-06-16T08:16:03Z","title":"Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.775227Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2506.13216"},"observation_digest":"sha256:9f5fac1b1f978401c2a5b360462bcd663564a6f343d0d6338b6d04eccde5edf2","observation_id":"3d6133d1-c2e2-4143-8d7f-6fd5889bdb46","resolution":{"observed_at":"2026-08-07T00:42:00.775227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2507.23009","last_updated":"2026-05-11T11:47:15Z","snapshot_observed_at":"2026-08-14T11:42:36.697068Z","submitted_at":"2025-07-30T18:14:35Z","title":"Position: Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T02:12:48.586913Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2507.23009"},"observation_digest":"sha256:943664d78fffa5e36d2c5609729ecc4c3a4d47c2da02aabd6708c6690c823613","observation_id":"5e1005c1-f974-401e-b4b1-1b1040bab0af","resolution":{"observed_at":"2026-05-19T02:12:55.759627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2604.11328","last_updated":"2026-04-13T11:31:04Z","snapshot_observed_at":"2026-08-12T15:04:44.243472Z","submitted_at":"2026-04-13T11:31:04Z","title":"Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:47:45.677717Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2604.11328"},"observation_digest":"sha256:5c818c97dc03ab8290f457cb40cdbd9b5a0b4585cfc7101ef7cab1289fe5c0b7","observation_id":"1e313c25-af52-415a-8245-306e89ebdefc","resolution":{"observed_at":"2026-05-11T09:50:59.571592Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2604.12843","last_updated":"2026-08-09T14:28:08Z","snapshot_observed_at":"2026-08-15T11:22:51.170082Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:37:12.962958Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2604.12843"},"observation_digest":"sha256:39723b3b97627f56fa58b497324ed68bf9b8ed5344cdbd38b0ed00e2f2fdb45a","observation_id":"471cbdb5-6644-4b77-8c5b-0595ff536f0d","resolution":{"observed_at":"2026-05-11T08:30:56.694144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2605.06213","last_updated":"2026-05-26T15:14:12Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:15:31Z","title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T10:13:35.777910Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2605.06213"},"observation_digest":"sha256:e767ee6d5a3ea116f6a3f8baf56c678eba0ebc06c496e34ccd912c8d285f935a","observation_id":"d6229044-6503-4080-99b2-6ee5ecc8fcca","resolution":{"observed_at":"2026-05-11T20:06:13.574332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2606.07616","last_updated":"2026-05-29T20:55:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T20:55:15Z","title":"Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T22:48:20.193699Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2606.07616"},"observation_digest":"sha256:25167d50d7fd935cf38ff1fc2a3b7dc329fe64ae3812584b8e6745900e5f1414","observation_id":"51e162ca-9c1a-4458-8237-0c2b8b11f6a3","resolution":{"observed_at":"2026-06-28T22:52:45.629897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-08-15T10:50:30.700589Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:1f0013b116a9882c33cff8547a5c974b13206f91c278c5d419c5dff0d03b60d6","observation_id":"39807472-4816-4985-b804-9c3523e29efa","resolution":{"observed_at":"2026-07-03T16:58:43.293342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2607.01152","last_updated":"2026-07-02T01:52:53Z","snapshot_observed_at":"2026-08-07T23:31:57.854748Z","submitted_at":"2026-07-01T16:31:11Z","title":"AGC-Bench: Measuring Artificial General Creativity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-02T12:33:53.029578Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2607.01152"},"observation_digest":"sha256:64559cc1d63e06b71b31cb44cec350146f06c85c137c5e9ae39b6fe7aca2b05f","observation_id":"9f99d01b-c72f-486b-ac57-0e4c82e19be4","resolution":{"observed_at":"2026-07-02T12:36:56.069253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2607.01152","last_updated":"2026-07-02T01:52:53Z","snapshot_observed_at":"2026-08-07T23:31:57.854748Z","submitted_at":"2026-07-01T16:31:11Z","title":"AGC-Bench: Measuring Artificial General Creativity","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-03T21:25:14.030920Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2607.01152"},"observation_digest":"sha256:5c67776d7ae6e49c46d6a58bfddfb185769193bdbe71942db4a3e763d8fbc01f","observation_id":"23705eed-4c7b-4b28-81e6-563dc571beeb","resolution":{"observed_at":"2026-07-03T21:28:58.089705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-03T00:45:58.290920Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28685","last_updated":"2026-07-30T03:45:10Z","snapshot_observed_at":"2026-08-12T20:35:16.784837Z","submitted_at":"2026-07-30T03:45:10Z","title":"Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T00:45:58.290920Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2607.28685"},"observation_digest":"sha256:031b8846e4512fc66fcadb0f2187688d1be702dae107a28cf39f26a088b24243","observation_id":"aa4f8dd3-6f04-4252-9483-c0a11dc34989","resolution":{"observed_at":"2026-08-03T00:45:58.290920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-08-06T05:39:49.447997Z","title":"In Proceedings of the Thirteenth International Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05086","last_updated":"2026-08-05T17:25:27Z","snapshot_observed_at":"2026-08-18T01:11:46.539742Z","submitted_at":"2026-08-05T17:25:27Z","title":"Item Response Theory for AI Safety","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:39:49.447997Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2608.05086"},"observation_digest":"sha256:2de2039b21f0d4016486512faa5c139464d09c24397d54f8847557f0d9586e15","observation_id":"9241b1ca-3a78-41bb-9ad6-6c35e8772641","resolution":{"observed_at":"2026-08-06T05:39:49.447997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.12844/citation-record","integrity":"/paper/2407.12844/integrity","json":"/paper/2407.12844/citation-record.json","paper":"/paper/2407.12844"},"outbound":[],"paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:36:58.590002Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2407.12844."}