{"as_of":"2026-08-10T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dea83c7b82e0a1280986d46d098217330a098c256f6fc8714b29382739f52756","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:09:01.728564Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:39:36.819142Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:40:49.906159Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"cited_work":{"arxiv_id":"2502.01683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01683","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-powered benchmark factory: Reliable, generic, and efficient","venue":null,"work_id":"24e9f644-3195-4fe6-a9b0-20169a079e01","year":2025},"citing_paper":{"arxiv_id":"2604.04386","last_updated":"2026-04-06T03:27:48Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T03:27:48Z","title":"Automatically Generating Hard Math Problems from Hypothesis-Driven Error Analysis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T19:39:36.819142Z"},"links":{"cited_paper":"/paper/2502.01683","citing_paper":"/paper/2604.04386"},"observation_digest":"sha256:6790325be99fe4af41b1d6a2c38377bc9302e9e6464ece0c5815fce62ae9e5cd","observation_id":"c925eb55-b244-4ff4-a252-25304c795a85","resolution":{"observed_at":"2026-05-10T22:40:49.911691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01683/citation-record","integrity":"/paper/2502.01683/integrity","json":"/paper/2502.01683/citation-record.json","paper":"/paper/2502.01683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.309254Z","title":"Claude 3.5","venue":null,"work_id":"8f80004e-5ea5-4ff0-b2cc-b6f315aa1c8d","year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.591091Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:8fb92b2ddd7801fbd239abd565a1328b75cf660c3d954d1b6b99f44ee1ac9d96","observation_id":"9cfc5650-ba39-478e-84b4-ee36304aca78","resolution":{"observed_at":"2026-08-09T18:09:02.311909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.301916Z","title":null,"venue":null,"work_id":"a72aa253-c038-4cdb-a64e-8984e6326810","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.594566Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:956d089b351952a0ddea25acf758409986898ef0ccd3485f5323591a1f588435","observation_id":"409b5d83-32f7-40d0-90ca-e91565196e3c","resolution":{"observed_at":"2026-08-09T18:09:02.304253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-09T18:09:01.597866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.597866Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:1e9c8110c9dbb3b72a6952464cdcd057518c25ab8040ec153f6dcb0af744a67f","observation_id":"36a20913-6729-453e-880c-f85fcff73202","resolution":{"observed_at":"2026-08-09T18:09:01.597866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.601806Z","title":"Yu, Qiang Yang, and Xing Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.601806Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:0d52b9175a76b7bbf6767b5a1dc417624aac477183b0cc10f664f6d85c7252c3","observation_id":"92662432-f6f3-4d5e-954c-b51bd990f875","resolution":{"observed_at":"2026-08-09T18:09:01.601806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-04T15:54:46.196160Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-09T18:09:01.604922Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.604922Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:f1536bc35d52a194473a81af5b78682467ed8e113805e030b5b39fcf9ce96f34","observation_id":"63181b01-6028-476d-a761-cf84cc0c8618","resolution":{"observed_at":"2026-08-09T18:09:01.604922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.608303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.608303Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:5453caf2b8cdc0c844939292068f71c10aea4ba73d783bfc869d7bb460648f3d","observation_id":"a34b53b7-cf57-4948-83e5-602a6b6665bf","resolution":{"observed_at":"2026-08-09T18:09:01.608303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.293715Z","title":null,"venue":null,"work_id":"36c80460-71d0-442b-8bf3-8180035152d4","year":1950},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.611435Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:50dde7dff3b4fa5ccc04c344c0f63c50ba94cfcdc3b46b7eb6f3b845d75d8787","observation_id":"0c544555-8fb4-4a4d-862e-3b86ac823563","resolution":{"observed_at":"2026-08-09T18:09:02.296828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.614868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.614868Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:2ada8c30ca361ea0b6269a599be7ef5d80985e8739ceb253c728d3be4216d50c","observation_id":"98f7e8f4-cd76-4e95-acbf-8ac9a4df1e8d","resolution":{"observed_at":"2026-08-09T18:09:01.614868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.278404Z","title":null,"venue":null,"work_id":"0114e109-4a80-4f95-8545-f154090399a9","year":2021},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.617635Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:72c2575ddd482bfa7529b2c4722394193c46c120c1198cc2c39e70d9d48637a0","observation_id":"e87f3976-8e7a-4022-a988-58993e941b82","resolution":{"observed_at":"2026-08-09T18:09:02.282798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.269712Z","title":null,"venue":null,"work_id":"a6a38e02-0ed0-4391-8e8b-f10ddfe84967","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.620591Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:c58dde2f54e9bd15521ae479b4f1884b302e53ea25a5654ed99891c4e0e45efe","observation_id":"883b262a-7a1d-4d85-a5a3-b806e69c743c","resolution":{"observed_at":"2026-08-09T18:09:02.272809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-09T18:09:01.624555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.624555Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:18fadc21313926aee47ffb10be464a56485c648a79694b23266a4328fbb08ed3","observation_id":"46110983-3b6c-4d9d-a724-85304659df95","resolution":{"observed_at":"2026-08-09T18:09:01.624555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.627606Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.627606Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:e9b02228d1052714a28817b67fc2bd6ca46c5a50d0e6dcd2a692685c3c9521ce","observation_id":"8048585d-e5f7-4b1b-97c7-e9d50480054f","resolution":{"observed_at":"2026-08-09T18:09:01.627606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15475","last_updated":"2026-05-26T21:14:13Z","snapshot_observed_at":"2026-07-06T13:26:33.250328Z","submitted_at":"2022-06-30T17:59:15Z","title":"Causal Machine Learning: A Survey and Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15475","snapshot_observed_at":"2026-08-09T18:09:01.630239Z","title":"Kusner, and Ricardo Silva","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.630239Z"},"links":{"cited_paper":"/paper/2206.15475","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:10b11dc9cea75925d50a40b006fa10e39c761559e23cec37c6e553ea90019d97","observation_id":"b41e42e1-dd22-4450-b693-b7db6bbc2283","resolution":{"observed_at":"2026-08-09T18:09:01.630239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15147","last_updated":"2024-04-06T15:20:18Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:52:06Z","title":"S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15147","snapshot_observed_at":"2026-08-09T18:09:01.632998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.632998Z"},"links":{"cited_paper":"/paper/2310.15147","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:bf0d94a02cef9b8d170509dd5d41223fc5ee5f7dcdd0b001def63e6d9b1f772c","observation_id":"ed49413c-ef14-4cc2-9cf8-c678d0e839e4","resolution":{"observed_at":"2026-08-09T18:09:01.632998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.636225Z","title":"u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.636225Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:a0a24461842c82b002b0826c1aea9bc9032df6b44ef77ecf1cc6c40aeac39d75","observation_id":"9dc084b1-b4bb-49ff-a534-a4ec3c054b90","resolution":{"observed_at":"2026-08-09T18:09:01.636225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19740","last_updated":"2024-10-18T06:57:08Z","snapshot_observed_at":"2026-08-08T23:35:33.282872Z","submitted_at":"2024-05-30T06:38:32Z","title":"PertEval: Unveiling Real Knowledge Capacity of LLMs with Knowledge-Invariant Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19740","snapshot_observed_at":"2026-08-09T18:09:01.639375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.639375Z"},"links":{"cited_paper":"/paper/2405.19740","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:ae418bdf37c9559812716ebc0a5b28a8d2cb7eaf44a4dafb866dcd067869716d","observation_id":"a9011def-dae2-4f1d-87ff-a979333e27b6","resolution":{"observed_at":"2026-08-09T18:09:01.639375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15545","last_updated":"2025-04-18T07:56:16Z","snapshot_observed_at":"2026-07-06T19:06:58.753073Z","submitted_at":"2024-08-28T05:41:52Z","title":"SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15545","snapshot_observed_at":"2026-08-09T18:09:01.642749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.642749Z"},"links":{"cited_paper":"/paper/2408.15545","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:98a8e686608671450fd56fcc34d37eecec772558f25d4155284d653a1fe7327b","observation_id":"9de263b1-2e74-46f2-9b23-f5dce2ebfe53","resolution":{"observed_at":"2026-08-09T18:09:01.642749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04857","last_updated":"2024-12-06T08:49:49Z","snapshot_observed_at":"2026-07-06T20:02:39.525801Z","submitted_at":"2024-12-06T08:49:49Z","title":"Neuro-Symbolic Data Generation for Math Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04857","snapshot_observed_at":"2026-08-09T18:09:01.645942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.645942Z"},"links":{"cited_paper":"/paper/2412.04857","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:ab4ac8e49fcb1c5cedfd38bf77ef364e2fb28a7419d29fab065500dfaf096c65","observation_id":"fa841f16-f458-4531-b321-e2c6e00cf99c","resolution":{"observed_at":"2026-08-09T18:09:01.645942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.256620Z","title":null,"venue":null,"work_id":"ae96b285-5d28-47c5-b7a2-f4ff33eb7a2a","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.649187Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:0cd7d7e4caaed9de55356c39e80cd8b0d666f60e974c741cf872f142f20dcbc9","observation_id":"f34460d2-0fbb-435c-9df8-cf06c89b198e","resolution":{"observed_at":"2026-08-09T18:09:02.259671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.651983Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.651983Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:8e0e3e8cf87e8e553d47b5b2ec230dd5a8843662db305e049998138988b7ad66","observation_id":"6bae59c9-87d6-4204-992f-178418605f0d","resolution":{"observed_at":"2026-08-09T18:09:01.651983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10627","last_updated":"2024-07-15T11:26:07Z","snapshot_observed_at":"2026-07-06T18:46:22.753758Z","submitted_at":"2024-07-15T11:26:07Z","title":"Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10627","snapshot_observed_at":"2026-08-09T18:09:01.654904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.654904Z"},"links":{"cited_paper":"/paper/2407.10627","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:725dd8f49b62d7bd27107a228382798ebae48f7b67cf7bd5b71ef37d6dc1c9d2","observation_id":"4b83488c-1a55-4c61-99f9-e55a04e3cea2","resolution":{"observed_at":"2026-08-09T18:09:01.654904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.247662Z","title":null,"venue":null,"work_id":"34ca2828-830e-4713-bee0-aafbf0ddb64c","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.658012Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:ac466b303f7e8d03176e74511ebabfd3a90f1a6e898d48fe110dee99a5f4338b","observation_id":"062255dc-8e6f-4159-a0b9-9b7359880775","resolution":{"observed_at":"2026-08-09T18:09:02.250661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11968","last_updated":"2024-09-18T13:20:23Z","snapshot_observed_at":"2026-08-06T16:44:42.775112Z","submitted_at":"2024-09-18T13:20:23Z","title":"Efficacy of Synthetic Data as a Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11968","snapshot_observed_at":"2026-08-09T18:09:01.660763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.660763Z"},"links":{"cited_paper":"/paper/2409.11968","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:895dbbecc15ad86221a657ed8c01411ace2a8e8b116eadc607c3f898d463342d","observation_id":"47e2f6de-f977-4a8f-a546-7593aeafc266","resolution":{"observed_at":"2026-08-09T18:09:01.660763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03971","last_updated":"2019-05-20T21:14:54Z","snapshot_observed_at":"2026-07-06T07:44:38.449115Z","submitted_at":"2019-04-08T11:44:41Z","title":"Jointly Measuring Diversity and Quality in Text Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03971","snapshot_observed_at":"2026-08-09T18:09:01.663911Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.663911Z"},"links":{"cited_paper":"/paper/1904.03971","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:96010d6c30712ef34bd358b4583e7720b29ee05ebee022d25d8a96c53b48f952","observation_id":"813d0a62-8588-41a4-9753-68695f3865a2","resolution":{"observed_at":"2026-08-09T18:09:01.663911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.238466Z","title":"text-embedding-ada-002","venue":null,"work_id":"a82ca194-d540-4389-a971-48927854120b","year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.667583Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:cabf303f50084921f6f685dce14d00d1b89fc1936e695c14abb039e570795976","observation_id":"01342007-e778-4b7c-9999-a77c32f4bee6","resolution":{"observed_at":"2026-08-09T18:09:02.241496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.670630Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.670630Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:00b1bc1a079948c61609573456883290dbdbfb5186b866ba1d628b99d435b6eb","observation_id":"1d3daef6-8ce7-4d38-920d-10f5a683dc7b","resolution":{"observed_at":"2026-08-09T18:09:01.670630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.225117Z","title":null,"venue":null,"work_id":"378a0937-6819-43fe-992a-18858b5d7aad","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.673654Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:01e8311fdb91a7ef2e8ab2b7eef866ff399d4189b2e319ad0f25c32f1ff88c4e","observation_id":"c3ac89a6-e4f0-452f-9a4f-66abd3dcc4f5","resolution":{"observed_at":"2026-08-09T18:09:02.227588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-08-09T18:09:01.676414Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.676414Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:5becb7438aa7bbd608e1bc8ed8b741ffcb6c19b03e3eefaaca3de745abc2a0b6","observation_id":"322e1967-c2d6-4d9b-9e65-c7729d065468","resolution":{"observed_at":"2026-08-09T18:09:01.676414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-09T18:09:01.679147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.679147Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:039cc9151a098865ad6b70a18b620e2d8cf913dc7bcedb3b1326df6628e2fbfc","observation_id":"6338cc35-3f69-4baf-81b6-61d9ce791fa7","resolution":{"observed_at":"2026-08-09T18:09:01.679147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.681746Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.681746Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:fae15579c5bcf4fd6e39392e21601e04111d4c74697d7e014c3c463094bc99d4","observation_id":"15100bd0-b637-4948-b51c-5437ba88c379","resolution":{"observed_at":"2026-08-09T18:09:01.681746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12896","last_updated":"2024-10-16T16:12:39Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T16:12:39Z","title":"A Survey on Data Synthesis and Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12896","snapshot_observed_at":"2026-08-09T18:09:01.684146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.684146Z"},"links":{"cited_paper":"/paper/2410.12896","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:a9b5a6b88d4a9b5144a6095e9d88d44b2c39a53da1f4d90744d87bafc9b3b987","observation_id":"7aadc72c-cbde-4595-9497-b379dc9755cc","resolution":{"observed_at":"2026-08-09T18:09:01.684146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.217147Z","title":"Le, Ed H","venue":null,"work_id":"6a3e5b86-da13-40e9-9234-f152c30bcc73","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.686768Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:9e1494519caff3961e629b4b64b56cc7b3e0aec7ae369aecb8225aefbae6c396","observation_id":"802f192e-afe5-4bc8-8a87-08459d2ff2e5","resolution":{"observed_at":"2026-08-09T18:09:02.219700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.689516Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.689516Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:154e08c91ec7390602b73a4233633f2371f8d4416cc40c5e44333b4934b2ef87","observation_id":"0dfa2173-c8c7-4ebc-843b-b17971b1f720","resolution":{"observed_at":"2026-08-09T18:09:01.689516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-09T18:09:01.692472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.692472Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:08276b9a695bf2af68fc8e7428c6820fa5ed6e22479d02549ab7bb18de08345f","observation_id":"f201a6fa-2ab2-48c6-9b03-78a3b22f9612","resolution":{"observed_at":"2026-08-09T18:09:01.692472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.695833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.695833Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:cfa86dabc2b6bfaa2ea02be7d851cc639f72a97843eb1386df34941c16a051a5","observation_id":"a00b135b-b20e-4822-b2c6-cbe659517f71","resolution":{"observed_at":"2026-08-09T18:09:01.695833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T18:09:01.699197Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.699197Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:e875a01e4a8aea7b35371889e107bd2695c623884ddb2e38b39d65de5fadd5d3","observation_id":"349d573e-8f42-4ca0-8451-ab19848bfad3","resolution":{"observed_at":"2026-08-09T18:09:01.699197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.702260Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.702260Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:39e2ad63bd73bb6a2f6345f0e9fe20c8a294c6cc7c2c852423d2b684d03ba0dc","observation_id":"23275359-7005-4eb7-865c-0dfc726f1abf","resolution":{"observed_at":"2026-08-09T18:09:01.702260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.202573Z","title":"Ratner, Ranjay Krishna, Jiaming Shen, and Chao Zhang","venue":null,"work_id":"596bf10d-ec49-48d0-b1f1-f5b49769a236","year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.705080Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:2389bfce2d354fddb7ef8e7166c8432e467b87d7ebee584479d4c9bbe3d6b15c","observation_id":"6d891ced-ae80-4651-8f13-d79f342473d2","resolution":{"observed_at":"2026-08-09T18:09:02.206843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.708002Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.708002Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:10033d20e06ef1efe18261c26804629cae5f414272f97581d4856ac9256f109a","observation_id":"01b89090-28f8-44de-9f76-cf7415f5dd79","resolution":{"observed_at":"2026-08-09T18:09:01.708002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.711080Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.711080Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:b3a182b96679fc2ec10d3103b8553a44e9ef7ed06f27f72703959052e8ed4112","observation_id":"1a30f425-3980-4673-b508-1551318daebf","resolution":{"observed_at":"2026-08-09T18:09:01.711080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.188530Z","title":null,"venue":null,"work_id":"28141b87-0e94-4d58-8981-0ad4b33e583c","year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.714267Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:a7ea972375e1aba36fc2b90c4efc9b52cb60e8b0ad01edeab748f44236916b59","observation_id":"327f84c9-0dcd-4483-98f7-2268689f33f9","resolution":{"observed_at":"2026-08-09T18:09:02.191757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14865","last_updated":"2024-06-07T09:19:45Z","snapshot_observed_at":"2026-07-31T23:14:38.550278Z","submitted_at":"2024-02-21T06:46:34Z","title":"Dynamic Evaluation of Large Language Models by Meta Probing Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14865","snapshot_observed_at":"2026-08-09T18:09:01.717256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.717256Z"},"links":{"cited_paper":"/paper/2402.14865","citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:43e7b1a5494d33e16be1edb4823401a07b677999d39d0f6e93b5e3638e555e74","observation_id":"1ee7a73b-7456-4d9b-8939-e8246680a985","resolution":{"observed_at":"2026-08-09T18:09:01.717256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:02.153799Z","title":null,"venue":null,"work_id":"57a69fe5-bccc-405d-b50d-a1ec80cd272f","year":2018},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.720740Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:11662ea5cff3f8107ad54cec6c290b7672c0c0a932b363238e0a5b6179b77b1a","observation_id":"a16acfb5-74d5-4b93-9f88-ea0107d16fcb","resolution":{"observed_at":"2026-08-09T18:09:02.157754Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.724723Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.724723Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:2e3c0dbfa4fc3f6047b2d12ca0b31df63e8c307522598d65a66b2114ffdd6a03","observation_id":"8b6d801a-7488-4531-aaa1-6d43c4e56507","resolution":{"observed_at":"2026-08-09T18:09:01.724723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:09:01.728564Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T18:09:01.728564Z"},"links":{"citing_paper":"/paper/2502.01683"},"observation_digest":"sha256:7975503d93f7b57ac6d916d600d06160ed01135214e8a0a86481f40d2d6b6779","observation_id":"26448a66-4b4f-4581-b83b-0d457d9303ed","resolution":{"observed_at":"2026-08-09T18:09:01.728564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01683","last_updated":"2025-02-02T06:36:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T08:03:00.746482Z","submitted_at":"2025-02-02T06:36:01Z","title":"LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2502.01683."}